Mostrando entradas con la etiqueta Estadística. Mostrar todas las entradas
Mostrando entradas con la etiqueta Estadística. Mostrar todas las entradas

lunes, 12 de septiembre de 2016

10 consejos para determinar qué tipo de distribución de datos siguen nuestros datos

  1. Conoce los diferentes tipos de distribución de datos: uniforme discreta, Bernoulli, binomio, binomio negativo, Poisson, geométrica, uniforme continua, normal (curva de campana), exponencial, gamma y beta. 
  2. Realiza una representación gráfica de tus datos.
  3. Descarta primero lo que no puede ser.
  4. Si hay algún pico en el conjunto de datos, no puede ser una distribución uniforme discreta.
  5. Si los datos tienen más de un pico, no es Poisson o binomio.
  6. Si tiene una sola curva, no hay picos secundarios, y tiene una pequeña pendiente en cada lado, podría ser una distribución Poisson o gamma. Pero no podrá ser una distribución uniforme discreta.
  7. Si los datos se distribuyen de manera uniforme, y es sin inclinar hacia un lado, es seguro excluir una distribución gamma o Weibull. 
  8. Si la función tiene una distribución uniforme o un pico en el medio de los resultados graficados, no es una distribución geométrica o una distribución exponencial.
  9. Después de que el tipo de distribución de probabilidad se ha reducido, haz un análisis de R cuadrado de cada posible tipo de distribución de probabilidad. El que tenga el mayor valor R cuadrado es probablemente el correcto.
  10. Elimina un dato atípico. A continuación, vuelve a calcular R cuadrado. Si el mismo tipo de distribución de probabilidad aparece como la coincidencia más cercana, luego hay un alto grado de confianza de que se trate de la distribución de probabilidad correcta para utilizar en el conjunto de datos.

martes, 12 de enero de 2016

Teoría del Análisis de Correlación

Lo que hay que saber previamente.
  • Las variables deben ser numéricas.
  • Distribuciones Bidimensionales: surgen cuando se consideran simultáneamente dos caracteres de una misma población o muestra. En este caso a cada elemento observado le corresponde un par de valores. Por ejemplo, con indicadores económicos o demográficos podemos estudiar si existe correlación entre la esperanza de vida y el porcentaje de alfabetización entre los datos de los países del mundo.
  • La covarianza: La covarianza de una variable bidimensional es la media aritmética de los productos de las desviaciones de cada una de las variables respecto a sus medias respectivas. Es de gran importancia es este análisis, no tanto por el valor que pueda tomar si no por su signo que indica el sentido de la variación conjunta de las variables que estamos considerando. Si la covarianza es positiva, ambas variables varían en el mismo sentido alrededor de sus medias.
La correlación trata de establecer la relación o dependencia que existe entre las dos variables que intervienen en una distribución bidimensional. 
Es decir, determinar si los cambios en una de las variables influyen en los cambios de la otra. En caso de que suceda, diremos que las variables están correlacionadas o que hay correlación entre ellas. El coeficiente de correlación intenta medir la intensidad con que dos variables están relacionadas.

Tipos de correlación:
Si r=1 existe correlación perfecta positiva y la relación entre ambas variables es exacta y positiva, variando ambas variables en el mismo sentido (al aumentar o disminuir una aumenta o disminuye la otra).
Si r=-1 existe correlación perfecta negativa y la relación entre ambas variables es exacta y negativa, variando ambas en el sentido opuesto (al aumentar una disminuye la otra y al disminuir una aumenta la otra).
Si r=0 la correlación es nula y las variables no están asociadas.
Si 0 < r < 1 la correlación es positiva, pero el grado de asociación entre las dos variables será mayor a medida que r se acerca más a 1, y será menor a medida que r se acerca más a cero. Si -1 < r < 0 la correlación es negativa, pero el grado de asociación entre las dos variables será mayor a medida que r se acerca más a -1 y será menor a medida que r se acerca más a cero. El grado de correlación indica la proximidad que hay entre los puntos de la nube de puntos. 

Se pueden dar dos tipos: 

1. Correlación fuerte: La correlación será fuerte cuanto más cerca estén los puntos de la recta. 
2. Correlación débil: La correlación será débil cuanto más separados estén los puntos de la recta.

miércoles, 30 de diciembre de 2015

Estadísticas de la esperanza de vida en España

Con motivo del fin de año me gustaría escribir unas breves notas sobre la estadística de la esperanza de vida, es un datos interesante ya que resume como la población está influenciada por factores como la alimentación, higiene, sanidad, etc. La inmortalidad es algo que preocupa a la humanidad y aunque vamos avanzando poco a poco y grandes empresas están invirtiendo en buscar el secreto de la eterna juventud, los datos, a día de hoy anuncian que aún estamos lejos de vivir 500 años. 

  • Los últimos datos de esperanza de vida publicados en España por el Instituto Nacional de Estadística (INE) son del año 2014 e indican que la esperanza de vida de los españoles es de 82,98 años.
  • Si usted o su padre, o su abuelo tienen 80 años y está leyendo esto no se preocupe, no les queda 2,98 años de vida. ¿No lo entiendes? La esperanza aumenta en 9,4 años al llegar a los 80 años, es decir, es muy probable que supere los 90 años.
  • ¿Y por sexo? Las mujeres viven más que los hombres. 85,71 años ellas y 80,17 ellos.
  • ¿No está mal verdad? Que sepas que solo las mujeres japonesas viven más que las españolas. Hasta los 87 años las niponas.
  •  
  • "Si durante los últimos 100 años hemos conseguido vivir unos 40 años más ¿Por qué no vamos a ganar otros 40 en el próximo siglo?” James Vaupel - demógrafo estadounidense.
  • ¿quieres saber en qué paises se vive más? 
 


    Data from World Bank

jueves, 10 de septiembre de 2015

La paradoja de Simpson en la estadística

La paradoja de Simpson no es un capítulo de la popular serie de animación de Matt Groening, la wikipedia la define como una paradoja en la cual una tendencia que aparece en varios grupos, desaparece cuando estos grupos se agregan en uno solo y además surge la tendencia contraria para los datos agregados.
Puede parecer un poco complejo, pero con un ejemplo se puede entiende fácilmente en qué consiste la paradoja de Simpson. Los resultados de las admisiones para el verano de 1973 en la universidad de California Berkeley mostraban los siguientes resultados:



Solicitudes Admisiones
Hombres 8442 44%
Mujeres 4321 35%


Aparentemente los hombres solicitantes tenían mayor probabilidad de ser admitidos que las mujeres y que la diferencia era tal que no era posible que fuera debida al azar. ¿Nos encontramos ante un caso de discriminación?

En la investigación se desagregó las admisiones por departamento:


Departamento Hombres Mujeres
Solicitudes Admisiones Solicitudes Admisiones
A 825 62% 108 82%
B 560 63% 25 68%
C 325 37% 593 34%
D 417 33% 375 35%
E 191 28% 393 24%
F 272 6% 341 7%

En 4 de 6 departamentos, se han seleccionado a más mujeres qué hombres. Las mujeres solían presentar solicitudes en campos competitivos con bajo porcentaje de admisiones (tales como el departamento de lengua inglesa) mientras que los hombres solían presentar en departamentos con menor competencia y mayor porcentaje de admisiones.

La diferencia entre las muestras de los diferentes departamentos provoca que al calcular de forma global el % de admitidos, provoque la aparente contradicción.

Esta paradoja viene explicada en el libro Causality. Lectura recomentada.

viernes, 19 de junio de 2015

La Campana de Gauss como herramienta estadística para evitar el fraude



Como bien nos ilustra la Wikipedia, la distribución normal, también conocida como distribución de Gauss o distribución Gaussiana, es una distribución continua de probabilidad. Su importancia está en que permite modelar fenómenos naturales, sociólogos o psicológicos.  Su gráfica tiene forma de campana, y es simétrica respecto a un parámetro estadístico.



Veamos su uso en caso de fraude, el siguiente ejemplo ocurrió en un examen para acceder a un puesto de la administración pública. Se presentaron 670 aspirantes y ante la sospecha de anomalías por preguntas imposibles de responder, se decidió realizar un sencillo análisis estadístico utilizando la campana de Gauss:
 
Efectivamente, los 670 resultados del examen se distribuyen como la distribución Normal. El 81,5% de los aspirantes obtuvieron de 4 a 9.9 respuestas acertadas. Sin embargo hay 6 personas con notas especialmente altas. Alertados se ha descubierto que 5 de esas 6 personas tenían relación de parentesco con escoltas de políticos en el gobierno…

Una vez más la estadística al servicio del fraude, no permite demostrar nada pero si pone sobre la pista.

martes, 10 de febrero de 2015

Foro Estadístico: diferencias significativas.

Tras publicar varios post sobre Mínimas Diferencias significativas, nos plantean el siguiente problema estadístico que publicamos a continuación: 

"He considerado que en mi experimento exiten diferencias significativas con valores de p<0 .05.="" br="">
Utilizando el programa SAS, con el procedimiento Genmod y tras \"convertir\" el estimador en proporción, obtengo que un valor de 80,7% es significativamente diferente (p=0.03) de uno de 64.2%, y sin embargo no es diferente significativamente (p=0.06) de uno que es 63,9%. Evidentemente no hay diferencias significativas (p=0.9) entre 64.2% y 63.9%.

¿A qué se debe esto? He medio leido (pero no entendido) que puede ser debido a que no se toman medias aritméticas o algo así del procedimiento...
 
¡ Les estaría muy agradecida si pudieran ayudar! ¡GRACIAS!

martes, 30 de septiembre de 2014

El concepto p-valor

Se denomina p-valor o nivel de significación o valor p, donde p indica probabilidad, al valor de alfa más pequeño que haga que la muestra observada nos indique que se debe rechazar Ho. De este modo, las personas que vean los resultados de un experimento pueden decidir por sí mismas si el riesgo de cometer un error de tipo I es satisfactorio.

Cuando se interpretan resultados de un contraste, las conclusiones están basadas en una regla de decisión. Ésta se establece teniendo en cuenta el riesgo que asume el investigador de cometer un error de tipoI, siendo la probabilidad de este error el nivel de significación alfa.

 

viernes, 29 de agosto de 2014

Oferta de Empleo

Contacta con nosotros Fabiola Alcalde, consultora de selección, de la consultora I+ADDH encargada de dar soporte en la búsqueda de talento de profesionales de la carrera de Ingenieros Estadística, que deseen desarrollar una carrera en el Banco de Crédito de Crédito.

Nos solicita que publiquemos la siguiente oferta de empleo de estadística en nuestro blog. Los interesados pueden remitir sus CV al email: 

Descripción del empleo:
Esta es tu oportunidad de iniciar una carrera en el mundo Financiero y desarrollar tus habilidades analíticas, relacionándote con profesionales de primer nivel que se caracterizan por su conocimiento y trayectoria profesional, pasión por metas y resultados y capacidad de innovar.
Ocuparas la posición de Analista Senior de Inteligencia de Cumplimiento y asumirás el reto de planificar y ejecutar proyectos de minería de datos para mejorar los procesos del área. Así como desarrollar modelos estadísticos, especializados que permiten identificar alertas en las operaciones.
Formarás parte del área de Inteligencia de Cumplimiento, quien es la encargada de implementar modelos de comportamiento y predictivos que se sustenten en estudios de investigación y minería de datos con el objetivo de automatizar la generación de alertas.

Perfil Profesional
- Egresado o Bachiller de la carrera de Estadística.
- Experiencia mínima de 2 años en la ejecución de proyectos de datamining o minería de datos en el sector financiero.
- Indispensable experiencia en la construcción de modelos de minería de datos y análisis estadístico.
- Indispensable conocimientos avanzados en el manejo de herramientas estadísticas como: SAS (Base/Guide/Miner), SPSS, Modeler.
- Conocimientos avanzados en el lenguaje de SQL.

Funciones Principales:
1. Planificar, coordinar y ejecutar proyectos que permitan identificar operaciones y clientes inusuales a través de modelos especializados de minería de datos.
2. Ejecutar proyectos sobre modelamiento predictivo o supervisado como análisis de regresiones, árboles de decisiones, con el fin de hacer más eficientes las labores de detección o evaluación.
3. Obtener información de los sistemas transaccionales, Datawarehouse y datamart para el desarrollo de modelos datamining, a través del desarrollo de procedimientos en lenguaje SQL.
4. Realizar análisis estadísticos para identificar datos inusuales a través del análisis exploratorio y descriptivo.
5. Automatización de modelos datamining a través de la programación en código SAS para su puesta en producción en servidores del Datawarehouse o servidores propios del área.
6. Investigar sobre nuevas técnicas de modelamiento.

Te ofrecemos:
- Pertenecer al banco líder del mercado
- La oportunidad de trabajar con los mejores profesionales del negocio
- Un trabajo retador en donde desarrollarás diferentes habilidades
- Oportunidades de desarrollo internas
- Beneficios financieros, de salud, educación y recreación
- Préstamos financieros a tasas especiales.

domingo, 3 de agosto de 2014

Balance del Blog

Nos vais a permitir que escribamos una entrada lejos de los contenidos técnicos sobre estadística a los que os estamos acostumbrados. Simplemente nos gustaría haceros partícipes de los datos que maneja este sencillo blog, que como decimos en nuestra sección, simplemente nació con el objetivo de convertirse en un punto de encuentro, información, consulta y opinión de los profesionales del análisis de datos.

El blog en estadísticas

Se han publicado 38 entradas, tenemos 27 comentarios útiles publicados y 10 seguidores.
La primera entrada es de Septiembre de 2012. 2 años después hemos visto como han ido creciendo sus visitas de manera lenta.

En el gráfico podéis ver el ritmo de visitantes:


Monetización

Famosa palabra entre los negocios online. Hacer el trabajo de escribir, publicar, etc, nos lleva unas cuantas horas, trabajo y en algunos momentos hasta dinero. Por ese motivo este blog intenta financiarse con 3 vías.

  • Publicidad Adsense. Podéis verla en el menú de la derecha. Poco intrusiva. Si os interesa algún anuncio no dudéis en hacer click. 
  • Donativos: si te gusta lo que lees y quieres que esto crezca, puedes hacer un pequeño donativo en la sección colaboración. El importe lo eliges tú.
  • Libros de estadística: hemos decidido hacer crecer esta sección. Facilitamos títulos elegidos y clasificados entre el catálogo de Amazon y ayudamos a difundir publicaciones de interés a cambio de una pequeña comisión.
En el futuro

Seguir creciendo, nos encantaría poder ofrecer nuestros propios cursos online, hacer nuestros libros, crear un foro para poder responder dudas, tener nuestro propio hosting y dominio.... pero todo cuesta dinero.

Iremos poco a poco, compraremos un dominio y aumentaremos la frecuencia de publicaciones para fidelizar más a nuestros visitantes.

Por último, hemos decidio eliminar la sección servicios ya que no podemos atender y resolver todas  vuestras dudas. Pero aquellas que nos lleguen, las publicaremos para que cualquier visitante pueda daros soporte a través de sus comentarios.




lunes, 4 de noviembre de 2013

Cursos universitarios de Estadística, online y gratuitos

En los próximos días, diferentes universidades comenzarán una serie de interesantes cursos gratuitos, alguno de ellos relacionados con la estadística. Los cursos que presentamos aquí son en español y os aconsejamos que visitéis el enlance para conocer más detalles.




Estadística para investigadores: Todo lo que siempre quiso saber  (Universidad de Salamanca)
Es una excelente propuesta para aquellos que deseen iniciarse en los conceptos básicos de la Estadística. Dirigido a todo el mundo que tenga inquietudes en la interpretación de datos estadísticos. Además, es ideal para recordar y actualizar los conocimientos que ya tiene sobre estadística básica, proporcionándole un buena base para su investigación, de una manera muy sencilla de comprender.

Análisis Estadístico Básico con SPSS  (Universidad de Cantabria) 
El Curso pretende introducir al alumno en los aspectos básicos del manejo del SPSS y ver sus aplicaciones prácticas a los diseños de investigación más conocidos. Crear unas bases sólidas que permitan continuar al alumno ampliando su conocimiento del SPSS por si mismo.

Aprende Análisis Estadístico de Datos con R  (UCAM)
R es un entorno informático de computación estadística y de generación de gráficos. R funciona en un amplio rango de sistemas operativos como UNIX, Windows o MacOS. Pese a su potencialidad, versatilidad y flexibilidad; R puede parecer árido en el momento en que el usuario trata de interaccionar con sus componentes. Se suele decir que “la curva de aprendizaje es lenta”. Sin embargo, los resultados que produce son ampliamente satisfactorios. Este curso está destinado a “lubricar” esos primeros encuentros con éste entorno estadístico.


Curso Práctico de Bioestadística con R (Primera parte)  (Universidad San Pablo)
Curso de Estadística aplicada a las Ciencias de la Salud. En esta primera parte el curso se centrará en la estadística descriptiva de una o más variables y de sus relaciones. El curso también introducirá el manejo del programa de análisis de datos R y el paque rk.Teaching con el que se realizarán los análisis estadísticos.



¿Quieres ayudarnos a mantener vivo el blog?
 

jueves, 3 de octubre de 2013

Medir la incertidumbre con la estadística Bayesiana

¿Qué es la estadística Bayesiana? Vamos a tratar de explicar en qué consiste con un ejemplo. ¿Cuál es la probabilidad de que mañana llueva en Madrid? La "lluvia de mañana en Madrid" lo denominaremos evento A. La información que obtengamos de diferentes fuentes como institutos de meteorología con datos actuales y anteriores como la humedad, el clima regional, la presión, etc, se representan con B. 

La propuesta de Bayes es calcular cuál es la probabilidad de que llueva mañana dada la información de B. Tenemos unos datos y, dado que tenemos esa información, queremos calcular la probabilidad de algún evento. Con este desarrollo, Bayes fundó una manera de hacer estadística que hoy denominamos estadística bayesiana. 

Supongamos que los meteorólogos le asignan al evento A una probabilidad de 10%.¿qué quiere decir que la probabilidad de que llueva mañana es del 10%? La teoría bayesiana establece que esa probabilidad del 10% no representa una frecuencia, sino que es una medida de lo que conocemos nosotros, una magnitud de nuestra incertidumbre o de nuestra certeza. Si al evento "llueve mañana miércoles en la ciudad de Madrid" le asignamos una probabilidad de 10%, dados los datos que tenemos, esto significa que tenemos alguna certeza de que no va a llover mañana, que es poco probable. 

Para saber más puedes visitar la Wikipedia y su entrada sobre el Teorema de Bayes. 

Comprando directamente desde los enlaces inferiores, obtendrás el mejor precio y ayudarás a mantener nuestro blog:

miércoles, 4 de septiembre de 2013

Test Estadísticos: Test de Correlación de Pearson

Hablamos de correlación cuando nos referimos a la relación  existente entre dos variables, su intensidad y su sentido (positivo o negativo).

La covarianza definida anteriormente como promedio de desviaciones conjuntas de dos variables sobre sus respectivas medias, no resulta ser una medida adecuada de la relación entre dos variables, pues el valor de Sxy está relacionado con el valor de la media de X y con el valor de la media de Y. por este motivo, si cambiamos la unidad de medida, la covarianza se vera modificada.

Podemos afirmar que el valor de la covarianza depende de la unidad de medida. Para evitar el efecto de la unidad de medida sobre Sxy podemos dividir las puntuaciones diferenciales por las respectivas desviaciones típicas Sx y Sy. El nuevo índice de relación que obtengamos tendrá la ventaja de ser invariante ante cualquier cambio en la unidad de medida. A este índice de correlación se le denomina coeficiente de correlación de Pearson o también coeficiente de correlación producto momento.





Aplicar el coeficiente de correlación de Pearson exige que las variables estén medidas al menos en una escala de intervalos y que se de una relación lineal entre ellas. Es decir, que los puntos del diagrama de dispersión se posicionen en la forma aproximada de una línea recta. Por tanto, usar el coeficiente de correlación de Pearson presupone la sospecha de que entre los grupos de puntuaciones se da una relación lineal.
El valor del coeficiente de correlación de Pearson se encuentra comprendido entre -1 y 1.
•    Valores próximos a 1 indicarán fuerte asociación lineal positiva.
•    Valores próxi¬mos a -1 indicarán fuerte asociación lineal negativa.
•    Valores próximos a 0 indicarán no asociación lineal, lo que no significa que no pueda existir otro tipo de asociación.

Resulta difícil precisar a partir de que valor de rxy podemos considerar que existe una correlación lineal entre dos variables. Siempre debemos tener en cuenta para la interpretación el tipo de variables a las que se aplica. Sin embargo, para tener un referente, y siendo conscientes de que estos coeficientes no son aplicables a todas las situaciones, tomamos los determinados por Bisquerra:




Además debemos tener presente que la existencia de una correlación no implica que necesariamente deba existir una relación causal directa. Por relación causal directa se entiende que si X e Y están correlacionadas, entonces X es en gran parte la causa de Y, o Y es en parte la causa de X.
No obstante, es habitual que tras encontrar una elevada correlación entre variables se hipoteticen relaciones causa efecto. Pero la existencia de una relación de este tipo habrá de ser comprobada recurriendo a otras estrategias de investigación y a otras técnicas estadísticas.