martes, 28 de agosto de 2012

Medidas de Tendencia Central

Denominamos Medidas de Tendencia Central a aquellos estadísticos que nos permiten identificar los valores más representativos de los datos. Estas medidas aplicadas a las características de las unidades de una muestra se les denomina estimadores, mientras que aplicadas a poblaciones se les denomina parámetros o valores estadísticos de la población. Existen tres Medidas fundamentales de Tendencia Central: la media, la mediana y la moda.

Media
Es la medida de posición central más utilizada, la más conocida y la más sencilla de calcular. Su principal desventaja radica en su sensibilidad al cambio de uno de sus valores o a los valores extremos demasiado grandes o pequeños. La media se define como la suma de todos los valores observados, dividido por el número total de observaciones.

Cuando los valores representan una población la ecuación se define como:
 
Donde (m) representa la media, (N) representa el tamaño de la población y (Xi) representa cada uno de los valores de la población. Ya que en la mayoría de los casos se trabajan con muestras de la población todas las ecuaciones que se presenten a continuación serán representativas para las muestras. La media aritmética para una muestra sería:

 
Donde (X) representa la Media para la muestra, (n) el tamaño de la muestra y (Xi) representa cada uno de los valores observados.
 
Mediana
La mediana nos indica el valor que separa los datos en dos fracciones iguales con el cincuenta por ciento de los datos cada una. Con esta medida podemos identificar el valor que se encuentra en el centro de los datos, es decir, nos permite conocer el valor que se encuentra exactamente en la mitad del conjunto de datos después que las observaciones se han ubicado en serie ordenada. Esta medida nos indica que la mitad de los datos se encuentran por debajo de este valor y la otra mitad por encima del mismo. Para determinar la posición de la mediana se utiliza la fórmula:


Para comprender este concepto vamos a suponer que tenemos la serie ordenada de valores (2, 5, 8, 10 y 13), la posición de la mediana sería:

Lo que nos indica que el valor de la mediana corresponde a la tercera posición de la serie, que equivale al número (8). Si por el contrario contamos con un conjunto de datos que contiene un número par de observaciones, es necesario promediar los dos valores medios de la serie. Si en el ejemplo anterior le anexamos el valor 15, tendríamos la serie ordenada (2, 5, 8, 10, 13 y 15) y la posición de la mediana sería:

Es decir, la posición tres y medio. Dado que es imposible destacar la posición tres y medio, es necesario promediar los dos valores de la posiciones tercera y cuarta para producir una mediana equivalente, que para el caso corresponden a (8 + 10)/2 =9. Lo que nos indicaría que la mitad de los valores se encuentra por debajo del valor 9 y la otra mitad se encuentra por encima de este valor.
Moda
La medida modal nos indica el valor que más veces se repite dentro de los datos. Si tenemos la serie ordenada (2, 2, 5 y 7), el valor que más veces se repite es el número 2 quien sería la moda de los datos. Es posible que en algunas ocasiones se presenten dos valores con la mayor frecuencia, lo cual se denomina Bimodal o en otros casos más de dos valores, lo que se conoce como multimodal.

 

martes, 2 de junio de 2009

Funciones Sas para variables de Texto

Sas es un potentísimo software de análisis estadístico pero además de sus virtudes analíticas presenta una serie de funciones orientadas a la manipulación y depuración o limpieza de variables.

En esta ocasión vamos a nombrar sólo unas pocas, las que personalmente más utilizo cuando me encuentro en las bases de datos teléfonos mal grabados, direcciones de emails, nombres de personas en mayúsculas y minúsculas, etc, y tenemos que hacer una labor de limpieza para homogeneizar todo lo posible estos datos.

Compbl (cadena): Elimina blancos de la cadena.
Compress (cadena, ‘car’): elimina de la cadena los caracteres específicados en car.
Upcase (cadena): convierte en mayúsculas la cadena.
Lowcase (cadena): convierte en minúsculas la cadena.
Tranwrd (cadena, ‘lo que quiero substituir’, ‘por lo que quiero substituir’): sustituye en la cadena todas las ocurrencias de origen por el destino.
Substr (cadena, a1, a2): devuelve una extracción de la variable de texto cadena que comienza en la posición a1 y tiene una longitud de a2.
Ejemplo: tenemos un campo denominado TELEFONO donde observamos datos de esta manera: 91-77*777 77-7
data BBDD; set BBDD;
TELEFONO =Compbl (TELEFONO) /*--> 91-77*77777-7*/
TELEFONO =Compress (TELEFONO,'-','*') /*--> 9177777777 */
run;

¿Quieres ayudarnos a mantener vivo el blog?

martes, 30 de septiembre de 2008

Segmentación de Mercado

Según la American Marketing Association (AMA), la Segmentación de Mercado es: “The process of subdividing a market into distinct subsets of customers that behave in the same way or have similar needs. Each subset may conceivably be chosen as a market target to be reached with a distinct marketing strategy. The process begins with a basis of segmentation-a product-specific factor that reflects differences in customers' requirements or responsiveness to marketing variables (possibilities are purchase behavior, usage, benefits sought, intentions, preference, or loyalty).”


Con la segmentación de mercado, conseguimos seleccionar a grupos de clientes según variables de negocio con el fin de poder aplicarles unos mismos procesos y/o estrategias, ya sean de comunicación, promoción, fidelización, incentivación, etc.

Tipos de Segmentación:Geográfica (por provincia, por país, por región…)
Demográfica (edad, sexo, nivel de estudios,…)
Psicográfica (status, ingresos, actitudes, motivaciones…)
Por mercado (clientes actuales, potenciales, latentes,…)
Mediante el cruce de distintas variables obtenemos los clientes que cumplen las condiciones fijadas.

Todos los clientes de la BdD están segmentados en función de los distintos valores de las variables de negocio.
Con ello se pueden hacer acciones de MK directo y/o comunicaciones a los distintos nichos o segmentos considerados (cada celda representa un nicho).

jueves, 24 de julio de 2008

Como exportar un dataset de Sas a Excel

Aunque en próximas entradas veremos otra manera de exportar a excel, aquí os presentamos dos de las más importantes:

PROC EXPORT
proc export data=datasetname outfile="/usr2/users/student/mkaushik/ names9900.csv" dbms=csv replace; delimiter=','; run;

ODS
ODS html FILE='/usr2/users/student/mkaushik/AIIMS/becker/try2.xls';
proc print data=&dataset noobs; run; ODS html CLOSE;

¿Quieres ayudarnos a mantener vivo el blog?

Error Estadístico Tipo I y II

En un estudio de investigación, el error tipo I, es el error que se comete cuando el investigador rechaza la hipótesis nula (Ho) siendo ésta verdadera en la población. Es equivalente a encontrar un resultado falso positivo, porque el investigador llega a la conclusión de que existe una diferencia entre las hipótesis cuando en realidad no existe.

En un estudio de investigación, el error tipo II, también llamado error tipo beta (aunque beta es la probabilidad de que exista éste error), se comete cuando el investigador no rechaza la hipótesis nula siendo ésta falsa en la población. Es equivalente a la probabilidad de un resultado falso negativo, ya que el investigador llega a la conclusión de que ha sido incapaz de encontrar una diferencia que existe en la realidad.

Se acepta en un estudio que el valor del error beta debe estar entre el 5 y el 20%..

El poder o potencia del estudio representa la probabilidad de observar en la muestra una determinada diferencia o efecto, si existe en la población. Es el complementario del error tipo II (1-beta).


¿Quieres ayudarnos a mantener vivo el blog?