Mostrando entradas con la etiqueta Distribución Normal. Mostrar todas las entradas
Mostrando entradas con la etiqueta Distribución Normal. Mostrar todas las entradas

jueves, 9 de diciembre de 2021

¿Qué es el teorema central del límite (TCL)?

El teorema del límite central es una teoría estadística que establece que, independientemente de cuál sea la distribución original de la población, al tomar muestras aleatorias de la población, la distribución de las medias o sumas de las muestras aleatorias se aproxima a una distribución normal, con una media igual a la media de la población, además, el TCL afirma que a medida que el tamaño de la muestra aumenta, la media muestral se acercará a la media de la población:

imagen Wikipedia

Ejemplo del teorema central del límite

Imaginemos que queremos analizar las rentabilidades medias históricas de los clientes de una empresa y sabemos que esa empresa tiene unos 2000 clientes. Pero no tenemos suficiente información como para analizar a los 2000 clientes. En este caso la rentabilidad media de los clientes de la compañía será la media poblacional.

Si aplicamos el Teorema Central del Límite podemos coger una muestra de estos 2000 clientes para realizar el análisis donde tengamos toda la información necesaria. La única limitación que tenemos es que en la muestra tiene que haber más de 30 clientes para que se cumpla el teorema. Entonces imaginemos que cogemos 50 clientes de manera aleatoria y repetimos el proceso varias veces. Los pasos a seguir serían los siguientes:

Elegimos la muestra de unos 50 clientes y obtenemos la rentabilidad media de la muestra.

Repetimos el paso anterior de manera continuada escogiendo 50 clientes y obtenemos la rentabilidad media.

La distribución de todas las rentabilidades medias de todas las muestras escogidas se aproximará a una distribución normal.

Las rentabilidades medias de todas las muestras seleccionadas se aproximará a la rentabilidad media del total de clientes de la compañía (2000 clientes) tal y como demuestra el teorema Central del Límite.


jueves, 2 de abril de 2020

Estas son las principales funciones de distribución de datos

Como resumen del anterior post:10 consejos para determinar qué tipo de distribución de datos siguen nuestros datos,  quiero publicar un resumen de las distribuciones más utilizadas por los data scientist. 

En la imagen, se muestra 5 de las distribuciones de datos más importantes y un pequeño resumen de sus características y aplicaciones.


lunes, 12 de septiembre de 2016

10 consejos para determinar qué tipo de distribución de datos siguen nuestros datos

  1. Conoce los diferentes tipos de distribución de datos: uniforme discreta, Bernoulli, binomio, binomio negativo, Poisson, geométrica, uniforme continua, normal (curva de campana), exponencial, gamma y beta. 
  2. Realiza una representación gráfica de tus datos.
  3. Descarta primero lo que no puede ser.
  4. Si hay algún pico en el conjunto de datos, no puede ser una distribución uniforme discreta.
  5. Si los datos tienen más de un pico, no es Poisson o binomio.
  6. Si tiene una sola curva, no hay picos secundarios, y tiene una pequeña pendiente en cada lado, podría ser una distribución Poisson o gamma. Pero no podrá ser una distribución uniforme discreta.
  7. Si los datos se distribuyen de manera uniforme, y es sin inclinar hacia un lado, es seguro excluir una distribución gamma o Weibull. 
  8. Si la función tiene una distribución uniforme o un pico en el medio de los resultados graficados, no es una distribución geométrica o una distribución exponencial.
  9. Después de que el tipo de distribución de probabilidad se ha reducido, haz un análisis de R cuadrado de cada posible tipo de distribución de probabilidad. El que tenga el mayor valor R cuadrado es probablemente el correcto.
  10. Elimina un dato atípico. A continuación, vuelve a calcular R cuadrado. Si el mismo tipo de distribución de probabilidad aparece como la coincidencia más cercana, luego hay un alto grado de confianza de que se trate de la distribución de probabilidad correcta para utilizar en el conjunto de datos.

viernes, 19 de junio de 2015

La Campana de Gauss como herramienta estadística para evitar el fraude



Como bien nos ilustra la Wikipedia, la distribución normal, también conocida como distribución de Gauss o distribución Gaussiana, es una distribución continua de probabilidad. Su importancia está en que permite modelar fenómenos naturales, sociólogos o psicológicos.  Su gráfica tiene forma de campana, y es simétrica respecto a un parámetro estadístico.



Veamos su uso en caso de fraude, el siguiente ejemplo ocurrió en un examen para acceder a un puesto de la administración pública. Se presentaron 670 aspirantes y ante la sospecha de anomalías por preguntas imposibles de responder, se decidió realizar un sencillo análisis estadístico utilizando la campana de Gauss:
 
Efectivamente, los 670 resultados del examen se distribuyen como la distribución Normal. El 81,5% de los aspirantes obtuvieron de 4 a 9.9 respuestas acertadas. Sin embargo hay 6 personas con notas especialmente altas. Alertados se ha descubierto que 5 de esas 6 personas tenían relación de parentesco con escoltas de políticos en el gobierno…

Una vez más la estadística al servicio del fraude, no permite demostrar nada pero si pone sobre la pista.