Como resumen del anterior post:10 consejos para determinar qué tipo de distribución de datos siguen nuestros datos, quiero publicar un resumen de las distribuciones más utilizadas por los data scientist.
En la imagen, se muestra 5 de las distribuciones de datos más importantes y un pequeño resumen de sus características y aplicaciones.
Mostrando entradas con la etiqueta Estadística Básica. Mostrar todas las entradas
Mostrando entradas con la etiqueta Estadística Básica. Mostrar todas las entradas
jueves, 2 de abril de 2020
martes, 28 de abril de 2015
Test Estadísticos: Test de Chi al Cuadrado (Ji-Cuadrado)
La prueba de Ji-cuadrado determina si
existe asociación entre variables cualitativas. Se utiliza para analizar tablas
de contingencia y comparación de proporciones en datos independientes.
Existen diferentes procedimientos
estadísticos para el análisis de las tablas de contingencia como la prueba
ji-cuadrado, la prueba exacta de fisher, la prueba de McNemar o la prueba Q de
Cochran, entre otras. En este artículo se expondrá el cálculo e interpretación
de la prueba como método estándar de análisis en el caso de grupos
independientes.La prueba permite determinar si dos variables cualitativas están o no asociadas. Si al final del estudio concluimos que las variables no están relacionadas podremos decir con un determinado nivel de confianza, previamente fijado, que ambas son independientes.
En la investigación médica o de
mercados nos encontramos con frecuencia con datos o variables de tipo
cualitativo, mediante las cuales un grupo de individuos se clasifican en dos o
más categorías mutuamente excluyentes. Las proporciones son una forma habitual
de expresar frecuencias cuando la variable objeto de estudio tiene dos posibles
respuestas, como presentar o no un evento de interés (enfermedad, compra, ,
etc.).
lunes, 8 de septiembre de 2014
Pruebas No Paramétricas
El análisis de la varianza asume que las distribuciones subyacentes están distribuidas normalmente y que las variaciones de las distribuciones que son comparadas son similares.
El coeficiente de correlación de Pearson asume normalidad.
Mientras que las técnicas paramétricas son robustas (es decir, conservan a menudo un poder considerable para detectar diferencias o semejanzas incluso cuando se violan estas asunciones), algunas distribuciones no cumplen las características necesarias, por lo que una alternativa no paramétrica es más deseable para detectar una diferencia o una semejanza.
Pruebas no paramétricas para muestras relacionadas
El coeficiente de correlación de Pearson asume normalidad.
Mientras que las técnicas paramétricas son robustas (es decir, conservan a menudo un poder considerable para detectar diferencias o semejanzas incluso cuando se violan estas asunciones), algunas distribuciones no cumplen las características necesarias, por lo que una alternativa no paramétrica es más deseable para detectar una diferencia o una semejanza.
Pruebas no paramétricas para muestras relacionadas
viernes, 25 de julio de 2014
Test Estadísticos: Ejemplo del Test de Correlación de Pearson
Como vimos en una entrada anterior, el test de correlación de Pearson mide la relación existente entre dos variables, su intensidad y su sentido (positivo o negativo).
A continuación veremos un ejemplo de su aplicación:
El Equipo Directivo de una empresa está interesado en conocer la relación que existe entre el tiempo semanal (horas) que dedican los trabajadores a formación y la productividad media de los mismos al final del año. Eligiendo 11 trabajadores al azar, han encontrado los siguientes resultados tras calcular el coeficiente de correlación de Pearson.
Media:
Como se puede ver en la tabla inferior se muestran los resultados de x e y que son puntuaciones diferenciales que se han conseguido restándoles las medias a las puntuaciones directas. El valor de la media en cada una de las variables las mostraré a continuación junto con las operaciones para calcular la covarianza de cada variable.
Covarianza:
El resultado de la covarianza al ser positivo, nos indica cierta tendencia a que a un tiempo semanal de estudio por encima de la media corresponden calificaciones por encima de la media, y a un tiempo de estudio por debajo de la media corresponden calificaciones por debajo de la media.
Para calcular el coeficiente de correlación de Pearson nos ayudarán los resultados del ejercicio anterior. Pero además tendremos que calcular la desviación típica de x e y. Y para la desviación típica necesitaremos los resultados de la varianza de x e y respectivamente. Mostraré a continuación el procedimiento y los resultados del proceso necesario para obtener lo solicitado por el problema.
Para calcular el coeficiente de correlación de Pearson nos ayudarán los resultados del ejercicio anterior. Pero además tendremos que calcular la desviación típica de x e y. Y para la desviación típica necesitaremos los resultados de la varianza de x e y respectivamente. Mostraré a continuación el procedimiento y los resultados del proceso necesario para obtener lo solicitado por el problema.
Viendo los resultados llegamos a la conclusión de que estamos ante una correlación muy alta, lo que quiere decir a puntuaciones altas en cuanto a notas se corresponden altas horas de trabajo y estudio semanal.
martes, 10 de junio de 2014
Ejemplo práctico de intervalo de confianza
En este blog, publicamos una entrada sobre los intervalos de confianza para un promedio. En dicho post estudiamos su teoría y la correcta interpretación:
Si el intervalo en cuestión es (a,b). Pues bien, esto quiere decir que si elegimos 100 muestras de tamaño 50 y cada vez calculamos el intervalo de confianza resultante, acertaremos en nuestro pronóstico en 95 de las 100 veces que realizaríamos la estimación con cada muestra.
Ejemplo práctico:
Los siguientes datos son las puntuaciones obtenidas para 45 personas de una escala de depresión (mayor puntuación significa mayor depresión).
Si el intervalo en cuestión es (a,b). Pues bien, esto quiere decir que si elegimos 100 muestras de tamaño 50 y cada vez calculamos el intervalo de confianza resultante, acertaremos en nuestro pronóstico en 95 de las 100 veces que realizaríamos la estimación con cada muestra.
Ejemplo práctico:
Los siguientes datos son las puntuaciones obtenidas para 45 personas de una escala de depresión (mayor puntuación significa mayor depresión).
Para construir un
intervalo de confianza para la puntuación promedio poblacional, asumamos que los
datos tienen distribución normal, con varianza poblacional desconocida. Como la varianza poblacional es desconocida, lo estimamos por s2=18,7. Luego, un intervalo de
confianza aproximado es:
Luego,
el intervalo de confianza para Nu es
(13,2 , 15,8). Es decir, la puntuación promedio poblacional se encuentra entre
13,2 y 15,8 con una confianza 95%.
Suscribirse a:
Entradas (Atom)





