Mostrando entradas con la etiqueta Data Mining. Mostrar todas las entradas
Mostrando entradas con la etiqueta Data Mining. Mostrar todas las entradas

martes, 9 de octubre de 2012

Introducción al Data Mining

El objetivo del presente artículo, es el de presentar un sencilla técnica estadística de análisis. La mayoría de las empresas generan y almacenan gran cantidad de información.

q  ¿Cómo almacenar de forma segura esa información?
q  ¿Es posible obtener el máximo rendimiento de la información disponible en las organizaciones?
q  ¿Con qué medios contamos para la gestión eficiente de los datos?
 
Algunos sistemas que son sólo parcialmente conocidos, producen una cantidad inmensa de datos; estos datos con frecuencia contienen valiosa información que puede resultar muy útil. Se trata de auténticas vetas de oro para los ejecutivos de una corporación.
 
¿Cuál es el problema?
La mayoría de las multinacionales generan más información en una semana que la que cualquier persona podría leer en toda su vida, e incluso las pequeñas empresas generan un volumen de datos que no son capaces de manejar.
 
 
 
El Data Mining se considera un área multidisciplinar del entorno de la Inteligencia de Negocio constituida por un conjunto de metodologías y herramientas que permiten extraer conocimiento útil (patrones de comportamiento, modelos operativos, de tendencia, etc.) para dar soporte a la toma de decisiones, comprensión y mejora de los procesos y sistemas, a partir de grandes cantidades de datos.
 
¿Cuándo tiene utilidad aplicar las técnicas de Minería de Datos?
 
q  Cuando la toma de decisiones debe estar basada en el conocimiento.
q  Cuando el escenario es cambiante.
q  Cuando los métodos disponibles no son óptimos o el sistema es parcialmente desconocido.
q  Cuando se dispone de un gran volumen de datos, accesibles y con potencial de información interesante.
 
Campos de aplicación de las técnicas de Minería de Datos
 
q  APLICACIONES DE NEGOCIOS
   §   Marketing dirigido
§   Detección de fugas de clientes
§   Comportamiento del cliente en supermercados ciertos días de la semana.
§   Inversiones, deportes y entrenamiento, telecomunicaciones, e-Commerce,  etc.
q  APLICACIONES WEB
§   Mecanismos de búsqueda, rastreadores de páginas web, etc.
q   APLICACIONES DE GOBIERNO
§   Mejora de las leyes, detección de fraudes, anti-terrorismo, etc.
 
Algunas técnicas que se aplican en Data Mining:
 
 Asociación:
q  La asociación resuelve problemas del tipo “Análisis de la Bolsa de la Compra”, con el fin de obtener las tendencias de compra de los clientes.
q  Trata la posible relación entre dos sucesos aparentemente independientes.
q  La expresión de una regla de asociación tiene dos componentes, el antecedente (cuando los alumnos cursan AOO), y el consecuente (cursan asignatura optativa POO)
SECUENCIACIÓN
 
q  Es similar a la asociación, pero incluye el tiempo de análisis añadiendo comparaciones de tiempo, como el análisis del tiempo transcurrido entre el suceso inductor y el suceso inducido.
q  Dentro de los seis primeros meses, al cabo de quince días, la próxima vez que,
CLASIFICACIÓN
 
q  Agrupa todas las herramientas que permiten asignar un elemento a un determinado grupo o clase.
q   Se utiliza en la detección de transacciones fraudulentas, riesgo en la entrega de créditos, identificación de procedimientos médicos, etc.
q   Utiliza datos históricos (conjunto de entrenamiento) para predecir un comportamiento futuro en cada clase (perfil de la clase).
q  Se utiliza para:
q    Clasificar cada elemento a partir de los valores de sus variables.
q    Ver que variables influyen en otras.
REGRESIÓN
 
q  Similar a la clasificación.
q   El modelo generado intenta predecir el valor más probable para una observación.
AGRUPAMIENTO
 
q Se utiliza en Marketing (población con las mismas afinidades), Medicina (pacientes con los mismos malestares), etc.
q Partición de la base de datos en subconjuntos en base a un criterio, de forma que los elementos tengan comportamientos comunes en sus variables.
q Diferencia con clasificación: NO se parte de un conjunto de entrenamiento.

domingo, 2 de septiembre de 2012

Introducción a los Árboles de Decisión

Un Árbol de Decisión es un modelo de predicción utilizado para modelar construcciones lógicas sobre el contenido de bases de datos, para la toma decisiones en base a esas entradas, es decir, es una forma gráfica y analítica de representar todos los eventos que pueden surgir a partir de una decisión asumida en cierto momento.

Los valores que pueden tomar las entradas y las salidas pueden ser discretos o continuos. Cuando se utilizan valores discretos se habla de modelos de clasificación y cuando son continuos de modelos de regresión.

Un Árbol de Decisión realiza un testeo a medida que recorre sus hojas hasta alcanzar una decisión. En un árbol se distinguen: nodos internos, nodos de probabilidad, nodos hoja y ramas.

Nodo de decisión:
Indica que una decisión necesita tomarse en ese punto del proceso. Está representado por un cuadrado.

Nodo de probabilidad:
Indica que en ese punto del proceso ocurre un evento aleatorio. Está representado por un círculo.

Rama:
Nos muestra los distintos caminos que se pueden emprender cuando tomamos una decisión o bien ocurre algún evento aleatorio:

 
q  Los Árboles de Decisión se utilizan para descubrir patrones en los datos, se recogen estas pautas y se organizan en modelos que se utilizarán posteriormente para hacer predicciones.

q  Los árboles son gráficos en los que cualesquiera dos nodos están conectados por exactamente un camino. Cada nodo es un camino elegido sobre la base de las pruebas realizadas en los atributos de entrada, hasta que al final de una “hoja” se alcanza un nodo. El nodo hoja representa una decisión y se utiliza como el resultado previsto para nuevos y desconocidos datos venideros.

Ejemplo de Árbol de Decisión

Una compañía de seguros nos ofrece una indemnización por accidente de 210.000$. Si no aceptamos la oferta y decidimos ir a juicio podemos obtener 185.000$, 415.000$ o 580.000$dependiendo de las alegaciones que el juez considere aceptables. Si perdemos el juicio, debemos pagar las costas que ascienden a30.000$.Sabiendo que el 70% de los juicios se gana, y de éstos, en el 50% se obtiene la menor indemnización, en el 30% la intermedia y en el 20% la más alta, determinar la decisión más acertada.

martes, 30 de septiembre de 2008

Segmentación de Mercado

Según la American Marketing Association (AMA), la Segmentación de Mercado es: “The process of subdividing a market into distinct subsets of customers that behave in the same way or have similar needs. Each subset may conceivably be chosen as a market target to be reached with a distinct marketing strategy. The process begins with a basis of segmentation-a product-specific factor that reflects differences in customers' requirements or responsiveness to marketing variables (possibilities are purchase behavior, usage, benefits sought, intentions, preference, or loyalty).”


Con la segmentación de mercado, conseguimos seleccionar a grupos de clientes según variables de negocio con el fin de poder aplicarles unos mismos procesos y/o estrategias, ya sean de comunicación, promoción, fidelización, incentivación, etc.

Tipos de Segmentación:Geográfica (por provincia, por país, por región…)
Demográfica (edad, sexo, nivel de estudios,…)
Psicográfica (status, ingresos, actitudes, motivaciones…)
Por mercado (clientes actuales, potenciales, latentes,…)
Mediante el cruce de distintas variables obtenemos los clientes que cumplen las condiciones fijadas.

Todos los clientes de la BdD están segmentados en función de los distintos valores de las variables de negocio.
Con ello se pueden hacer acciones de MK directo y/o comunicaciones a los distintos nichos o segmentos considerados (cada celda representa un nicho).

martes, 11 de septiembre de 2007

Introducción al Data Mining

1. Definición de Data Mining

Es un proceso de descubrimiento de los patrones, perfiles y tendencias significativas a través del análisis de los datos, mediante el uso de tecnologías de reconocimiento de patrones y técnicas estadísticas y matemáticas.

El Data Mining difiere de otros métodos de análisis de datos de un modo fundamental:
  • Descubre estructuras ocultas, ratios patrones y tendencias.
  • Es una técnica dinámica sólo por el hecho de no necesitar una búsqueda (query) o configurar el análisis para resolver un problema particular antes de realizar la minería.
Para construir un modelo útil se deben descubrir dos aspectos clave dentro del fichero de datos:
  • Los atributos significativos.
  • Los intervalos que identifican un patrón o firma de los clientes de la compañía.
Las herramientas OLAP y Query ofrecen información limitada para la toma de decisiones, ya que aportan información sobre lo que ha ocurrido pero no sobre las causas que han originado esa situación, siendo el analista quien debe deducirlo. Es en este punto donde entran en juego las herramientas de Data Mining, encontrando reglas o hechos de negocio relevantes del estudio particular de una masa de datos de forma inductiva.

2. Objetivos
  • Explicar los fenómenos.
  • Transformar la información en decisiones útiles y eficaces.
  • Permitir la construcción de modelos automáticos e inteligentes.
3. Beneficios
  • Modelos descriptivos: En un contexto de objetivos definidos, permite a las empresas explorar automáticamente, visualizar y comprender los datos e identificar patrones, relaciones y dependencias que impactan en la cuenta de resultados.
  • Modelos predictivos: permite expresar relaciones no descubiertas como reglas de negocio o modelos predictivos.