jueves, 9 de diciembre de 2021

¿Qué es el teorema central del límite (TCL)?

El teorema del límite central es una teoría estadística que establece que, independientemente de cuál sea la distribución original de la población, al tomar muestras aleatorias de la población, la distribución de las medias o sumas de las muestras aleatorias se aproxima a una distribución normal, con una media igual a la media de la población, además, el TCL afirma que a medida que el tamaño de la muestra aumenta, la media muestral se acercará a la media de la población:

imagen Wikipedia

Ejemplo del teorema central del límite

Imaginemos que queremos analizar las rentabilidades medias históricas de los clientes de una empresa y sabemos que esa empresa tiene unos 2000 clientes. Pero no tenemos suficiente información como para analizar a los 2000 clientes. En este caso la rentabilidad media de los clientes de la compañía será la media poblacional.

Si aplicamos el Teorema Central del Límite podemos coger una muestra de estos 2000 clientes para realizar el análisis donde tengamos toda la información necesaria. La única limitación que tenemos es que en la muestra tiene que haber más de 30 clientes para que se cumpla el teorema. Entonces imaginemos que cogemos 50 clientes de manera aleatoria y repetimos el proceso varias veces. Los pasos a seguir serían los siguientes:

Elegimos la muestra de unos 50 clientes y obtenemos la rentabilidad media de la muestra.

Repetimos el paso anterior de manera continuada escogiendo 50 clientes y obtenemos la rentabilidad media.

La distribución de todas las rentabilidades medias de todas las muestras escogidas se aproximará a una distribución normal.

Las rentabilidades medias de todas las muestras seleccionadas se aproximará a la rentabilidad media del total de clientes de la compañía (2000 clientes) tal y como demuestra el teorema Central del Límite.


miércoles, 17 de febrero de 2021

Random Forest explicado de forma sencilla

Random Forest es un modelo de machine learning de aprendizaje supervisado para clasificación. Es un algoritmo predictivo que usa la técnica de Bagging para combinar diferentes árboles de decisión, donde cada árbol es construido con observaciones y variables aleatorias.

En forma resumida sigue este proceso:

o   Selecciona individuos al azar (usando muestreo con reemplazo) para crear diferentes sets de datos.

o   Crea un árbol de decisión con cada dataset de datos, obteniendo diferentes árboles, ya que cada dataset contiene diferentes observaciones y diferentes variables en cada nodo.

o   Al crear los árboles se eligen variables al azar en cada nodo del árbol, dejando crecer el árbol en profundidad, es decir, sin podar.

o   Predice los nuevos datos usando el "voto mayoritario", donde clasificará como "positivo" si la mayoría de los arboles predicen la observación como positiva.

En resumen, Random Forest es un tipo de Ensamble en Machine Learning en donde combinaremos diversos árboles de decisión y la salida de cada uno se contará como “un voto” y la opción más votada será la respuesta del Bosque Aleatorio.


1.     ¿cómo funciona el Random Forest?

  • Seleccionamos k features (columnas o variables) de las m totales (siendo k menor a m) y creamos un árbol de decisión con esas k características.
  • Creamos n árboles variando siempre la cantidad de k features y también podríamos variar la cantidad de muestras que pasamos a esos árboles (esto es conocido como “bootstrap sample”)
  • Tomamos cada uno de los n árboles y le pedimos que hagan una misma clasificación. Guardamos el resultado de cada árbol obteniendo n salidas.
  • Calculamos los votos obtenidos para cada “clase” seleccionada y consideraremos a la más votada como la clasificación final de nuestro “bosque”.

Recomendamos:

viernes, 15 de enero de 2021

Los mejores libros gratuitos para aprender Machine Learning y Data Science en 2021

A continuación os dejamos una lista de los mejores libros sobre técnicas estadísticas, data science y machine learning que están disponibles en internet para descargar directamente en pdf o similar. Actualizaremos esta entrada y crearemos nuevas listas con recursos gratuitos. 

Data Science and Machine Learning: Mathematical and Statistical Methods. Escrito por: D.P. Kroese, Z.I. Botev, T. Taimre, R. Vaisman, Chapman and Hall/CRC, Boca Raton, 2019.

Ver PDF

Causal Inference Book. Escrito por Miguel Hernán y Jamie Robins. Los aspectos fundamentales de la inferencia causal  en 300 páginas de texto.

Ver PDF

Statistics with Julia:Fundamentals for Data Science, MachineLearning and Artificial Intelligence. Escrito por Yoni Nazarathy, Hayden Klok.  inferencia estadística, los intervalos de confianza, las pruebas de hipótesis, la regresión lineal, el aprendizaje automático y más.

Ver PDF

Foundations of Data Science. Escrito por Avrim Blum, John Hopcroft, y Ravindran Kannan. Desde la universidad de Cornell  este libro nos aportará los conocimientos teóricos necesarios para desarrollar una carrera en ciencia de datos con unos sólidos fundamentos.

Ver PDF

The Elements of Statistical Learning: Autores: Jerome H. Friedman, Robert Tibshirani y Trevor Hastie

Ver PDF


jueves, 2 de abril de 2020

Estas son las principales funciones de distribución de datos

Como resumen del anterior post:10 consejos para determinar qué tipo de distribución de datos siguen nuestros datos,  quiero publicar un resumen de las distribuciones más utilizadas por los data scientist. 

En la imagen, se muestra 5 de las distribuciones de datos más importantes y un pequeño resumen de sus características y aplicaciones.


miércoles, 13 de noviembre de 2019

Truco sencillo para conocer las variables de tu dataset con Sas

En muchas ocasiones tenemos problemas para visualizar todas las variables que forman nuestra tabla de datos o dataset con el que estamos trabajando. 

Utilizando este sencillo código de sas ®, obtenemos un dataset (X) con el nombre de todas las variables y la posición que ocupa en nuestro fichero. 

proc contents
     data = TOTAL
          noprint
          out = X
               (keep = name varnum);
run;

lunes, 12 de septiembre de 2016

10 consejos para determinar qué tipo de distribución de datos siguen nuestros datos

  1. Conoce los diferentes tipos de distribución de datos: uniforme discreta, Bernoulli, binomio, binomio negativo, Poisson, geométrica, uniforme continua, normal (curva de campana), exponencial, gamma y beta. 
  2. Realiza una representación gráfica de tus datos.
  3. Descarta primero lo que no puede ser.
  4. Si hay algún pico en el conjunto de datos, no puede ser una distribución uniforme discreta.
  5. Si los datos tienen más de un pico, no es Poisson o binomio.
  6. Si tiene una sola curva, no hay picos secundarios, y tiene una pequeña pendiente en cada lado, podría ser una distribución Poisson o gamma. Pero no podrá ser una distribución uniforme discreta.
  7. Si los datos se distribuyen de manera uniforme, y es sin inclinar hacia un lado, es seguro excluir una distribución gamma o Weibull. 
  8. Si la función tiene una distribución uniforme o un pico en el medio de los resultados graficados, no es una distribución geométrica o una distribución exponencial.
  9. Después de que el tipo de distribución de probabilidad se ha reducido, haz un análisis de R cuadrado de cada posible tipo de distribución de probabilidad. El que tenga el mayor valor R cuadrado es probablemente el correcto.
  10. Elimina un dato atípico. A continuación, vuelve a calcular R cuadrado. Si el mismo tipo de distribución de probabilidad aparece como la coincidencia más cercana, luego hay un alto grado de confianza de que se trate de la distribución de probabilidad correcta para utilizar en el conjunto de datos.

lunes, 5 de septiembre de 2016

R cuadrado o coeficiente de determinación o de correlación múltiple y R cuadrado ajustado

El R cuadrado es una herramienta estadística (un estadístico) que se utiliza en modelos estadísticos como en una regresión para predecir futuros resultados. Por ejemplo, a los inversores permite hacer predicciones sobre el crecimiento o variación de un dato determinado según como se correlaciona con otras variables. El R cuadrado es el indicador que nos permitirá conocer cómo de bien se pueden predecir esos resultados. 

El R2 es el porcentaje de variación de la variable de respuesta que explica su relación con una o más variables predictoras. Por lo general, mientras mayor sea el R2, mejor será el ajuste del modelo a sus datos. El R2 siempre se encuentra entre 0 y 100%. El R-cuadrado también se conoce como el coeficiente de determinación o determinación múltiple (en la regresión lineal múltiple).



El primer modelo de regresión explica 85.5% de la varianza mientras que el segundo explica 22.6%. Mientras mayor sea la varianza que explica el modelo de regresión, más cerca estarán los puntos de los datos de la línea de regresión ajustada.

¿Qué es el R-cuadrado ajustado?
El R2 ajustado es el porcentaje de variación en la variable de respuesta que es explicado por su relación con una o más variables predictoras, ajustado para el número de predictores en el modelo.
Es decir, a medida que incluyamos más variables en el modelo, el R cuadrado aumentará por lo que puede hacernos pensar que el modelo es mejor porque incluye más variables.
Para comprobar si es cierto que nuestro modelo es mejor por la inclusión de nuevas variables debemos analizar el R cuadrado ajustado. 



En la siguiente tabla observamos como con una variable el R cuadrado es del 52%. Al agregar el segundo término, usted observa que el R2 ajustado mejoró, lo que indica que la segunda variable mejoró el modelo. Con el tercer término,  aunque el R2 aumenta, el R2 ajustado no lo hace. Puesto que la tercera variable no mejoró el modelo, podríamos considerar eliminarla del modelo. 


Para saber más sobre el R cuadrado.


viernes, 1 de abril de 2016

Microsoft R Server, la plataforma analítica de datos basada en R

El análisis de datos, la estadística, la tecnología y la informática van muy relacionadas. En estos tiempos de análisis masivo de datos no se concibe una sin la otra. El Big Data ha llegado para quedarse en nuestras vidas. Las grandes corporación están dando pases al frente para no perder mercado y posicionarse para comer el mayor trozo de pastel posible. 

Microsoft ha presentado Microsoft R Server, su plataforma de analítica de datos empresarial, escalable y segura, basada en R, el lenguaje de programación para estadística y análisis predictivo más usado en el mundo. 

El nuevo Microsoft R Server soporta una gran variedad de sistemas estadísticos de Big Data, modelización predictiva y capacidades de machine learning. La compañía ofrece R Server a través de múltiples plataformas, permitiendo a los clientes empresariales acceder a sistemas analíticos avanzados sin importar si usan Hadoop (Hortonworks, Cloudera y MapR), Linux (Red Hat y SUSE), o Teradata. Para Windows, Microsoft R Server estará incluido en SQL Server 2016. Microsoft también ha anunciado el lanzamiento de una edición para desarrolladores con todas las características de la versión comercial que puede descargarse de forma totalmente gratuita. Para estudiantes, Microsoft R Server también está disponible para su uso académico a través del programa Microsoft DreamSpark.

Además, Microsoft sigue fiel a su compromiso de ofrecer soporte al proyecto open-source de R con el lanzamiento de Microsoft R Open, que mejora el rendimiento del antiguo Revolution R Open desarrollado por Revolution Analytics.

martes, 12 de enero de 2016

Teoría del Análisis de Correlación

Lo que hay que saber previamente.
  • Las variables deben ser numéricas.
  • Distribuciones Bidimensionales: surgen cuando se consideran simultáneamente dos caracteres de una misma población o muestra. En este caso a cada elemento observado le corresponde un par de valores. Por ejemplo, con indicadores económicos o demográficos podemos estudiar si existe correlación entre la esperanza de vida y el porcentaje de alfabetización entre los datos de los países del mundo.
  • La covarianza: La covarianza de una variable bidimensional es la media aritmética de los productos de las desviaciones de cada una de las variables respecto a sus medias respectivas. Es de gran importancia es este análisis, no tanto por el valor que pueda tomar si no por su signo que indica el sentido de la variación conjunta de las variables que estamos considerando. Si la covarianza es positiva, ambas variables varían en el mismo sentido alrededor de sus medias.
La correlación trata de establecer la relación o dependencia que existe entre las dos variables que intervienen en una distribución bidimensional. 
Es decir, determinar si los cambios en una de las variables influyen en los cambios de la otra. En caso de que suceda, diremos que las variables están correlacionadas o que hay correlación entre ellas. El coeficiente de correlación intenta medir la intensidad con que dos variables están relacionadas.

Tipos de correlación:
Si r=1 existe correlación perfecta positiva y la relación entre ambas variables es exacta y positiva, variando ambas variables en el mismo sentido (al aumentar o disminuir una aumenta o disminuye la otra).
Si r=-1 existe correlación perfecta negativa y la relación entre ambas variables es exacta y negativa, variando ambas en el sentido opuesto (al aumentar una disminuye la otra y al disminuir una aumenta la otra).
Si r=0 la correlación es nula y las variables no están asociadas.
Si 0 < r < 1 la correlación es positiva, pero el grado de asociación entre las dos variables será mayor a medida que r se acerca más a 1, y será menor a medida que r se acerca más a cero. Si -1 < r < 0 la correlación es negativa, pero el grado de asociación entre las dos variables será mayor a medida que r se acerca más a -1 y será menor a medida que r se acerca más a cero. El grado de correlación indica la proximidad que hay entre los puntos de la nube de puntos. 

Se pueden dar dos tipos: 

1. Correlación fuerte: La correlación será fuerte cuanto más cerca estén los puntos de la recta. 
2. Correlación débil: La correlación será débil cuanto más separados estén los puntos de la recta.

miércoles, 30 de diciembre de 2015

Estadísticas de la esperanza de vida en España

Con motivo del fin de año me gustaría escribir unas breves notas sobre la estadística de la esperanza de vida, es un datos interesante ya que resume como la población está influenciada por factores como la alimentación, higiene, sanidad, etc. La inmortalidad es algo que preocupa a la humanidad y aunque vamos avanzando poco a poco y grandes empresas están invirtiendo en buscar el secreto de la eterna juventud, los datos, a día de hoy anuncian que aún estamos lejos de vivir 500 años. 

  • Los últimos datos de esperanza de vida publicados en España por el Instituto Nacional de Estadística (INE) son del año 2014 e indican que la esperanza de vida de los españoles es de 82,98 años.
  • Si usted o su padre, o su abuelo tienen 80 años y está leyendo esto no se preocupe, no les queda 2,98 años de vida. ¿No lo entiendes? La esperanza aumenta en 9,4 años al llegar a los 80 años, es decir, es muy probable que supere los 90 años.
  • ¿Y por sexo? Las mujeres viven más que los hombres. 85,71 años ellas y 80,17 ellos.
  • ¿No está mal verdad? Que sepas que solo las mujeres japonesas viven más que las españolas. Hasta los 87 años las niponas.
  •  
  • "Si durante los últimos 100 años hemos conseguido vivir unos 40 años más ¿Por qué no vamos a ganar otros 40 en el próximo siglo?” James Vaupel - demógrafo estadounidense.
  • ¿quieres saber en qué paises se vive más? 
 


    Data from World Bank

jueves, 10 de septiembre de 2015

La paradoja de Simpson en la estadística

La paradoja de Simpson no es un capítulo de la popular serie de animación de Matt Groening, la wikipedia la define como una paradoja en la cual una tendencia que aparece en varios grupos, desaparece cuando estos grupos se agregan en uno solo y además surge la tendencia contraria para los datos agregados.
Puede parecer un poco complejo, pero con un ejemplo se puede entiende fácilmente en qué consiste la paradoja de Simpson. Los resultados de las admisiones para el verano de 1973 en la universidad de California Berkeley mostraban los siguientes resultados:



Solicitudes Admisiones
Hombres 8442 44%
Mujeres 4321 35%


Aparentemente los hombres solicitantes tenían mayor probabilidad de ser admitidos que las mujeres y que la diferencia era tal que no era posible que fuera debida al azar. ¿Nos encontramos ante un caso de discriminación?

En la investigación se desagregó las admisiones por departamento:


Departamento Hombres Mujeres
Solicitudes Admisiones Solicitudes Admisiones
A 825 62% 108 82%
B 560 63% 25 68%
C 325 37% 593 34%
D 417 33% 375 35%
E 191 28% 393 24%
F 272 6% 341 7%

En 4 de 6 departamentos, se han seleccionado a más mujeres qué hombres. Las mujeres solían presentar solicitudes en campos competitivos con bajo porcentaje de admisiones (tales como el departamento de lengua inglesa) mientras que los hombres solían presentar en departamentos con menor competencia y mayor porcentaje de admisiones.

La diferencia entre las muestras de los diferentes departamentos provoca que al calcular de forma global el % de admitidos, provoque la aparente contradicción.

Esta paradoja viene explicada en el libro Causality. Lectura recomentada.

viernes, 19 de junio de 2015

La Campana de Gauss como herramienta estadística para evitar el fraude



Como bien nos ilustra la Wikipedia, la distribución normal, también conocida como distribución de Gauss o distribución Gaussiana, es una distribución continua de probabilidad. Su importancia está en que permite modelar fenómenos naturales, sociólogos o psicológicos.  Su gráfica tiene forma de campana, y es simétrica respecto a un parámetro estadístico.



Veamos su uso en caso de fraude, el siguiente ejemplo ocurrió en un examen para acceder a un puesto de la administración pública. Se presentaron 670 aspirantes y ante la sospecha de anomalías por preguntas imposibles de responder, se decidió realizar un sencillo análisis estadístico utilizando la campana de Gauss:
 
Efectivamente, los 670 resultados del examen se distribuyen como la distribución Normal. El 81,5% de los aspirantes obtuvieron de 4 a 9.9 respuestas acertadas. Sin embargo hay 6 personas con notas especialmente altas. Alertados se ha descubierto que 5 de esas 6 personas tenían relación de parentesco con escoltas de políticos en el gobierno…

Una vez más la estadística al servicio del fraude, no permite demostrar nada pero si pone sobre la pista.