Mostrando entradas con la etiqueta Inferencia Estadística. Mostrar todas las entradas
Mostrando entradas con la etiqueta Inferencia Estadística. Mostrar todas las entradas

jueves, 9 de diciembre de 2021

¿Qué es el teorema central del límite (TCL)?

El teorema del límite central es una teoría estadística que establece que, independientemente de cuál sea la distribución original de la población, al tomar muestras aleatorias de la población, la distribución de las medias o sumas de las muestras aleatorias se aproxima a una distribución normal, con una media igual a la media de la población, además, el TCL afirma que a medida que el tamaño de la muestra aumenta, la media muestral se acercará a la media de la población:

imagen Wikipedia

Ejemplo del teorema central del límite

Imaginemos que queremos analizar las rentabilidades medias históricas de los clientes de una empresa y sabemos que esa empresa tiene unos 2000 clientes. Pero no tenemos suficiente información como para analizar a los 2000 clientes. En este caso la rentabilidad media de los clientes de la compañía será la media poblacional.

Si aplicamos el Teorema Central del Límite podemos coger una muestra de estos 2000 clientes para realizar el análisis donde tengamos toda la información necesaria. La única limitación que tenemos es que en la muestra tiene que haber más de 30 clientes para que se cumpla el teorema. Entonces imaginemos que cogemos 50 clientes de manera aleatoria y repetimos el proceso varias veces. Los pasos a seguir serían los siguientes:

Elegimos la muestra de unos 50 clientes y obtenemos la rentabilidad media de la muestra.

Repetimos el paso anterior de manera continuada escogiendo 50 clientes y obtenemos la rentabilidad media.

La distribución de todas las rentabilidades medias de todas las muestras escogidas se aproximará a una distribución normal.

Las rentabilidades medias de todas las muestras seleccionadas se aproximará a la rentabilidad media del total de clientes de la compañía (2000 clientes) tal y como demuestra el teorema Central del Límite.


jueves, 2 de abril de 2020

Estas son las principales funciones de distribución de datos

Como resumen del anterior post:10 consejos para determinar qué tipo de distribución de datos siguen nuestros datos,  quiero publicar un resumen de las distribuciones más utilizadas por los data scientist. 

En la imagen, se muestra 5 de las distribuciones de datos más importantes y un pequeño resumen de sus características y aplicaciones.


martes, 10 de febrero de 2015

Foro Estadístico: diferencias significativas.

Tras publicar varios post sobre Mínimas Diferencias significativas, nos plantean el siguiente problema estadístico que publicamos a continuación: 

"He considerado que en mi experimento exiten diferencias significativas con valores de p<0 .05.="" br="">
Utilizando el programa SAS, con el procedimiento Genmod y tras \"convertir\" el estimador en proporción, obtengo que un valor de 80,7% es significativamente diferente (p=0.03) de uno de 64.2%, y sin embargo no es diferente significativamente (p=0.06) de uno que es 63,9%. Evidentemente no hay diferencias significativas (p=0.9) entre 64.2% y 63.9%.

¿A qué se debe esto? He medio leido (pero no entendido) que puede ser debido a que no se toman medias aritméticas o algo así del procedimiento...
 
¡ Les estaría muy agradecida si pudieran ayudar! ¡GRACIAS!

miércoles, 6 de noviembre de 2013

¿Cuándo una diferencia entre medias es estadísticamente significativa?



La eterna pregunta: ¿Cuándo una diferencia entre medias es estadísticamente significativa? En cualquier análisis estadístico la información más habitual que se presenta en los informes es la Media Aritmética. Es un resultado sencillo y de fácil compresión, sin embargo, en multitud de foros y reuniones de trabajo surge la pregunta a la hora de comparar 2 medias.

Si estamos afirmando que A (sea una tienda, paciente, proveedor) vende un promedio de 140 unidades al mes este año y el año anterior vendía 149 … ¿Esta diferencia es estadísticamente significativa?
El resolver esta pregunta implica realizar un test de hipótesis ya que es la herramienta matemática que cuantifican hasta qué punto la variabilidad de la muestra puede ser responsable de los resultados de un estudio en particular. La Ho (hipótesis nula) representa la afirmación de que no hay asociación entre las dos variables estudiadas y la Ha (hipótesis alternativa) afirma que hay algún grado de relación o asociación.
Nuevamente la estadística nos muestra su utilidad ya que nos ayuda a tomar la decisión de que hipótesis debemos elegir. Dicha decisión puede ser afirmada con una seguridad que nosotros previamente decidimos y que denominamos Nivel de Significación.

¿Cómo se realiza un test de hipótesis?
Aunque con matices, se realizan de la siguiente forma. En primer lugar se mira la magnitud de la diferencia que hay entre los grupos a comparar (A y B). Si esta magnitud o valor absoluto es mayor que un error estándar definido multiplicado por una seguridad definida, concluimos que la diferencia es significativa entre A y B. Por tanto aceptamos la hipótesis alternativa y rechazamos la hipótesis nula.

Ejemplo:
Disponemos de 2 tratamientos ( A y B). El tratamiento A lo reciben 25 pacientes y el tratamiento B otros 25 pacientes. 15 pacientes responden favorablemente al tratamiento A y 20 al tratamiento B. ¿Existe diferencia significativa entre ambos tratamientos?
Ho (hipótesis nula) = No hay diferencia entre ambos tratamientos.
Ha (hipótesis alternativa) = Sí existe diferencia.




Error estándar * 1.96 = 0.1296 * 1.96 = 0.25

Como quiera que la diferencia =  | 0,60 - 0,80 | = 0,20


no supera el valor 0.25 concluimos que la diferencia entre 0.60 y 0.80 no es estadísticamente significativa. A la vista de los resultados no podemos aceptar la Ha (hipótesis alternativa).

El proceso de aceptación o rechazo de la hipótesis lleva implícito un riesgo que se cuantifica con el valor de la "p", que es la probabilidad de aceptar la hipótesis alternativa como cierta, cuando la cierta podría ser la hipótesis nula.

El valor de "p" que indica que la asociación es estadísticamente significativa ha sido arbitrariamente seleccionado y por consenso se considera en 0.05. Una seguridad del 95% lleva implícito una p < de 0.05 y una seguridad del 99% lleva implícita una p < 0.01. Cuando rechazamos la Ho (hipótesis nula) y aceptamos la Ha (hipótesis alternativa) como probablemente cierta afirmando que hay una asociación, o que hay diferencia, estamos diciendo en otras palabras que es muy poco probable que el azar fuese responsable de dicha asociación. Del mismo modo si la p>0.05 decimos que el azar no puede ser excluido como explicación de dicho hallazgo y no rechazamos la Ho (hipótesis nula) que afirma que ambas variables no están asociadas o correlacionadas.
 


martes, 20 de noviembre de 2012

Ejemplo de cómo calcular la mínima diferencia significativa

En el último post publicado, estudiamos la parte teórica de la Mínima Diferencia Significativa (LSD) como método de comparación de diferencia de medias. Ahora realizaremos el ejemplo que empezamos a analizar en la anterior entrada.

 
 
 

Como se puede observar, las diferencias que exceden (DSM) están entre las medias:
por lo tanto, sólo difieren las medias m 4 de m 1 y de m 3.

Es importante tener presente que la prueba DSM sólo se debe emplear cuando el ANDEVA ha conducido al rechazo de H0. Si las muestras no son del mismo tamaño no se debe usar DSM.

 


lunes, 19 de noviembre de 2012

Mínima Diferencia Significativa (LSD) como método de comparación de diferencia de medias

Cuando se rechaza la hipótesis nula de no diferencia de más de dos medias (H0: m 1 = m 2 = … = mk) en un análisis de varianza surge la pregunta acerca de cuáles pares de medias son diferentes, puesto que el rechazo de una hipótesis nula con cuatro tratamientos (H0: m 1 = m 2 = m 3 = m 4), podría deberse a uno o varios de los seis pares de diferencias que se pueden tener.

Existen varios procedimientos para determinar cuáles son los pares de medias que son diferentes. El más utilizado es el de la Diferencia Significativa Mínima (DSM) de Fisher. Este procedimiento es una extensión de la prueba t de Student para el caso de comparación de dos medias con varianza ponderada.

Veamos un ejemplo encontrado en internet: Una empresa tiene cuatro plantas y sabe que la planta A satisface los requisitos impuestos por el gobierno para el control de desechos de fabricación, pero quisiera determinar cuál es la situación de las otras tres. Para el efecto se toman cinco muestras de los líquidos residuales de cada una de las plantas y se determina la cantidad de contaminantes. Los resultados del experimento aparecen en la siguiente tabla.


Previamente a realizar la prueba de diferencia mínima significativa (DSM) de Fisher conviene realizar:

  • Análisis para detectar datos anómalos o outliers.
  • Análisis de la varianza. Cuando el análisis de varianza indica la existencia de una diferencia significativa se desea conocer cuál de los pares de medias causa la diferencia. Cuando las muestras son de igual tamaño la Diferencia Significativa Mínima (DSM) de Fisher nos ayuda a localizar esta fuente.
La Diferencia Significativa Mínima (DSM) se define como la diferencia mínima que podría existir entre dos medias de muestras significativamente diferentes. Para obtener la fórmula para la DSM, se usa la prueba t de Student para la diferencia entre dos medias cuando las varianzas no son diferentes cuyo estadístico de contraste es:
Además, si se considera ni = nj = n, entonces:

 
Si este valor calculado es mayor que el valor teórico (de tablas) decimos que la diferencia entre m 1 y m 2 es significativa. Así, la DSM puede considerarse como la menor de las diferencias , es decir:
 
 



miércoles, 17 de octubre de 2012

Test Estadísticos: Prueba de Kolmogorov-Smirnov

El test de Kolmogorov-Smirnov es una prueba de significación estadística no paramétrica utilizada para determinar la bondad del ajuste de dos distribuciones de probabilidad entre sí.

Es decir, trataremos de verificar si el conjunto de datos se puede ajustar o afirmar que proviene de una determinada distribución. Las pruebas estadísticas que tratan este problema reciben el nombre general de “Pruebas de Bondad de Ajuste”.

La Prueba de Kolmogorov-Smirnov  mide, el grado de ajuste que existe entre la distribución obtenida a partir de la muestra y la distribución teórica que se supone debe seguir esa muestra. Ambas pruebas están basadas en la hipótesis nula de que no hay diferencias significativas entre la distribución muestral y la teórica. Ambas pruebas están basadas en las siguientes hipótesis:
  • H0: f(x,q) = f0(x,q)
  • H1: f(x,q) <> f0(x,q)
donde f0(x,q) es la distribución que se supone sigue la muestra aleatoria. La hipótesis alternativa siempre se enuncia como que los datos no siguen la distribución supuesta. Si se desea examinar otra distribución específica, deberá realizarse de nuevo la otra prueba suponiendo que la hipótesis nula es esta nueva distribución. Al especificar la hipótesis nula, el conjunto de parámetros definidos por que puede ser conocido o desconocido. En caso de que los parámetros sean desconocidos, es necesario estimarlos mediante alguno de los métodos de estimación.

Para formular la hipótesis nula deberán tenerse en cuenta los siguientes aspectos o criterios:

a) La naturaleza de los datos a analizar. Por ejemplo, si tratamos de investigar la distribución que siguen los tiempos de fallo de unos componentes, podríamos pensar en una distribución exponencial, o una distribución gama o una distribución Weibull, pero en principio no consideraríamos una distribución normal. Si estamos analizando los caudales de un río en un determinado sitio, podríamos pensar en una distribución logarítmica normal, pero no en una distribución normal.

b) Histograma. La forma que tome el histograma de frecuencia es quizás la mejor indicación del tipo de distribución a considerar.

Este contraste, que es válido únicamente para variables continuas, compara la función de distribución (probabilidad acumulada) teórica con la observada, y calcula un valor de discrepancia, representado habitualmente como D, que corresponde a la discrepancia máxima en valor absoluto entre la distribución observada y la distribución teórica, proporcionando asimismo un valor de probabilidad P, que corresponde, si estamos verificando un ajuste a la distribución normal, a la probabilidad de obtener una distribución que discrepe tanto como la observada si verdaderamente se hubiera obtenido una muestra aleatoria, de tamaño n, de una distribución normal.

Si esa probabilidad es grande no habrá por tanto razones estadísticas para suponer que nuestros datos no proceden de una distribución, mientras que si es muy pequeña, no será aceptable suponer ese modelo probabilístico para los datos.