0% encontró este documento útil (0 votos)
4 vistas41 páginas

Informe Final

El proyecto final de Data Science de la Universidad Loyola se centra en el análisis de campañas de marketing bancario para el Banco Mercantil Santa Cruz, utilizando el dataset Bank Marketing del repositorio UCI. El objetivo es identificar factores demográficos y financieros que influyen en la respuesta de los clientes a las campañas, mediante un análisis exploratorio de datos y visualizaciones. El equipo de cinco integrantes desarrolló un informe ejecutivo que incluye la gestión de datos, análisis exploratorio, visualizaciones y conclusiones, sin implementar soluciones tecnológicas ni modelos predictivos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
4 vistas41 páginas

Informe Final

El proyecto final de Data Science de la Universidad Loyola se centra en el análisis de campañas de marketing bancario para el Banco Mercantil Santa Cruz, utilizando el dataset Bank Marketing del repositorio UCI. El objetivo es identificar factores demográficos y financieros que influyen en la respuesta de los clientes a las campañas, mediante un análisis exploratorio de datos y visualizaciones. El equipo de cinco integrantes desarrolló un informe ejecutivo que incluye la gestión de datos, análisis exploratorio, visualizaciones y conclusiones, sin implementar soluciones tecnológicas ni modelos predictivos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

UNIVERSIDAD LOYOLA

Carrera de Ingeniería de Sistemas


Inteligencia Artificial

PROYECTO FINAL
DATA SCIENCE
Análisis de Campaña de Marketing Bancario
Dataset: Bank Marketing - UCI Machine Learning
Repository
Caso de estudio: Banco Mercantil Santa Cruz

Docente: [Link]. Ramiro Jhonatan Pardo Foronda


Materia: Inteligencia Artificial

INTEGRANTES DEL GRUPO

Jefe de Proyecto Benjamin Joel Sacari Quino - 15725

Data Scientist 1 — EDA Franz Angel Quispe Ticona - 17926

Data Analyst — Gráficos Mauro Gualberto Condori Saavedra - 17995

Data Scientist 3 (control de Osmar Favio Alvarez Cossio - 17891


calidad):

Administrador de Sistemas Fernando Gabriel Lima Quispia - 17591


INDICE
CAPITULO l : DOCUMENTO EJECUTIVO ........................................................... i
1.1 Información de Negocio............................................................................ 1
1.2 Personas Involucradas ............................................................................. 2
1.3 Alcance del Proyecto ................................................................................ 3
1.4 Fases y Entregables del Proyecto ............................................................ 4
CAPITULO ll: GESTIÓN Y PREPARACIÓN DE DATOS ...................................... 1
2.1 Gestión y preparación de datos ............................................................... 7
2.2. Dataset original ........................................................................................ 7
2.3. Carga y revisión inicial del dataset ......................................................... 8
2.4. Análisis preliminar ................................................................................... 9
2.5. Limpieza y procesamiento de datos ...................................................... 10
2.6. Dataset limpio final ................................................................................ 11
2.7. Organización del proyecto..................................................................... 11
2.8 Conclusión .............................................................................................. 12
CAPITULO lll: ANALISIS EXPLORATORIO DE DATOS .................................... 13
3.1 Introducción al EDA ................................................................................ 13
3.3 Estadísticas Descriptivas ....................................................................... 14
3.4 Análisis de la Variable Objetivo .............................................................. 15
3.5 Tablas de Contingencia y Patrones Iniciales ......................................... 15
3.6 Identificación de Outliers ........................................................................ 16
3.7 Análisis de Correlaciones ....................................................................... 17
3.8 Conclusión .............................................................................................. 17
CAPITULO lV: ANALISIS VISUAL Y RESULTADOS ......................................... 13
4.1. ANALISIS DE RESULTADOS GRAFICOS............................................... 19
4.2. Histograma de Distribución de Edades ............................................. 19
4.3. Boxplot de Saldo Bancario por Grupo de Edad ................................ 21
4.4. Tasa de Respuesta por Estado Civil .................................................. 22
4.5. Tasa de Respuesta por Nivel Educativo ............................................ 24
4.6. Scatter: Relación entre Edad y Saldo Bancario ................................ 25
i
4.7. Tasa de Respuesta por Mes de Contacto .......................................... 27
CAPITULO V: CONCLUSIONES Y REFERENCIAS ............................................. 1
5.1 Conclusiones Generales del Grupo ....................................................... 29
5.2 Recomendaciones para el Cliente .......................................................... 31
5.3 Referencias Bibliográficas...................................................................... 31

ii
INDICE DE FIGURAS

Figura 1Histograma de Distribución de Edades ............................................. 19


Figura 2 Boxplot de Saldo Bancario por Grupo de Edad ................................ 21
Figura 3Tasa de Respuesta por Estado Civil .................................................. 22
Figura 4 Tasa de Respuesta por Nivel Educativo............................................ 24
Figura 5 Scatter: Relación entre Edad y Saldo Bancario ................................ 25
Figura 6 Tasa de Respuesta por Mes de Contacto .......................................... 27

iii
INDICE DE TABLAS

Tabla 1: Características del Dataset .................................................................... 7


Tabla 2: Funciones de Revisión Inicial ................................................................ 8
Tabla 3: Acciones de Limpieza y Procesamiento Realizadas .......................... 10
Tabla 4: Estructura de Carpetas del Proyecto .................................................. 11
Tabla 5: Diccionario de variables del dataset Bank Marketing ........................ 13
Tabla 6: Estadísticas descriptivas de las variables .......................................... 14
Tabla 7: Distribución de la variable objetivo y .................................................. 15
Tabla 8: Tasa de respuesta por estado civil ...................................................... 15
Tabla 9: Tasa de respuesta por nivel educativo................................................ 16
Tabla 10: Tasa de respuesta por grupo de edad ............................................... 16
Tabla 11: Tasa de respuesta por ocupación laboral ........................................ 16
Tabla 12: Outliers detectados por variable ....................................................... 17
Tabla 13: Matriz de correlación entre variables ................................................ 17
Tabla 14: Resumen de hallazgos principales del proyecto ............................. 30

iv
CAPITULO l:
DOCUMENTO EJECUTIVO
1.1 Información de Negocio

Cliente: Banco Mercantil Santa Cruz — Sector Financiero y Bancario, Bolivia

Descripción del Problema:

El Banco Mercantil Santa Cruz ejecuta periódicamente campañas de marketing


telefónico dirigidas a su base de clientes con el objetivo de promover la contratación
de depósitos a plazo fijo. Sin embargo, actualmente el banco no cuenta con un
análisis sistemático que le permita identificar qué características y perfiles de
clientes están más asociados a una respuesta positiva frente a estas campañas.

Esta ausencia de información analítica genera una problemática concreta: los


recursos destinados a las campañas tiempo de los agentes, cantidad de llamadas
realizadas y costos operativos se distribuyen de manera uniforme entre todos los
clientes, sin distinción de perfil, sin considerar el momento más oportuno para el
contacto y sin tener en cuenta las características demográficas o financieras que
históricamente han estado asociadas a mejores resultados.

Como consecuencia, el banco invierte esfuerzo comercial en segmentos de clientes


con baja receptividad, mientras que los perfiles con mayor probabilidad de respuesta
positiva no reciben una atención diferenciada. Esto se traduce en tasas de
conversión subóptimas, ineficiencia operativa y dificultad para justificar decisiones
comerciales con evidencia basada en datos.

Objetivo Principal:

Analizar el comportamiento de los clientes a partir del dataset Bank Marketing del
repositorio UCI Machine Learning para identificar los factores demográficos,
financieros y temporales asociados a una respuesta positiva en campañas de
marketing bancario, en un caso de estudio contextualizado para el Banco Mercantil
Santa Cruz.

Objetivos Específicos:

-Analizar la estructura del dataset Bank Marketing, verificando la calidad, tipos de


variables y consistencia de los datos.

1-31
-Limpiar y procesar el dataset mediante la eliminación de duplicados, verificación de
nulos y creación de nuevas variables derivadas.

-Realizar un análisis exploratorio de datos que permita identificar patrones


estadísticos en el comportamiento de los clientes frente a las campañas.

-Generar seis visualizaciones analíticas que representen los factores demográficos,


financieros y temporales asociados a la respuesta de los clientes.

-Interpretar los hallazgos en términos de negocio, identificando perfiles de mayor


receptividad y períodos de mayor efectividad para las campañas del banco.

1.2 Personas Involucradas


El proyecto fue desarrollado por un equipo de cinco integrantes, cada uno con un
rol definido dentro del pipeline de Data Science:

A) Equipo Data Science (Grupo)

Jefe de Proyecto: Benjamín Joel Sacari Quino. Responsable de la planificación,


coordinación general y comunicación con el cliente. Supervisó el cronograma,
distribuyó tareas y garantizó la coherencia del informe final.

Data Scientist 1: Franz Ángel Quispe Ticona. Responsable del análisis exploratorio
de datos (EDA). Realizó estadísticas descriptivas, analizó la variable objetivo,
identificó outliers y construyó tablas de contingencia.

Data Scientist 2: Osmar Favio Álvarez Cossio. Responsable del apoyo en el


análisis estadístico y la validación de los hallazgos del EDA. Colaboró en la
interpretación de patrones y en la redacción de conclusiones analíticas del equipo.

Data Scientist 3: Mauro Gualberto Condori Saavedra. Responsable de las


visualizaciones. Diseñó y generó los 6 gráficos a 300 dpi con Python, elaboró el
análisis técnico de cada uno y redactó las explicaciones accesibles y el diccionario
de conceptos estadísticos.

Administrador de Sistemas: Fernando Gabriel Lima Quispia. Responsable de la


gestión técnica del dataset. Obtuvo los datos desde UCI, organizó la estructura de

2-31
carpetas, realizó la limpieza y procesamiento, creó la variable age_group y generó
el archivo bank_limpio.csv.

B) Cliente

Contacto principal: Gerente Alejandro Mendoza: Dirección de Marketing


Estratégico.

Departamento solicitante: Dirección de Marketing y Desarrollo Comercial.

Necesidad expresada: Comprender qué perfiles de clientes responden mejor a


campañas de depósitos a plazo fijo para orientar futuras estrategias comerciales.

1.3 Alcance del Proyecto


El presente proyecto abarca el análisis exploratorio completo del dataset Bank
Marketing del repositorio UCI Machine Learning, aplicado a un caso de estudio
contextualizado para el Banco Mercantil Santa Cruz. A continuación, se detalla con
precisión qué incluye y qué no incluye el alcance de este trabajo.

SÍ incluye:

Obtención, organización y almacenamiento del dataset original. Revisión de calidad


de datos: eliminación de duplicados, verificación de nulos y validación de tipos.
Creación de nuevas variables derivadas como age_group. Análisis exploratorio
completo con estadísticas descriptivas, análisis de la variable objetivo y tablas de
contingencia. Generación de seis visualizaciones a 300 dpi con su interpretación
técnica y diccionario de conceptos. Elaboración del informe ejecutivo, material de
exposición y anexos técnicos.

NO incluye:

Este análisis se limita estrictamente a los datos contenidos en el dataset Bank


Marketing de UCI y no incorpora datos reales, confidenciales ni propietarios del
Banco Mercantil Santa Cruz. No incluye la implementación de soluciones
tecnológicas dentro de los sistemas internos del banco ni la integración con
plataformas institucionales existentes. Tampoco contempla la construcción de
modelos predictivos de machine learning ni algoritmos de clasificación, ya que el

3-31
alcance se circunscribe al análisis exploratorio y descriptivo. No se ejecutarán
campañas de marketing reales ni se tomarán decisiones operativas dentro de la
organización como parte de este proyecto.

1.4 Fases y Entregables del Proyecto


El desarrollo del proyecto siguió un pipeline estructurado de Data Science
compuesto por seis fases secuenciales, donde cada fase alimenta a la siguiente y
garantiza la calidad del proceso completo:

Fase 1: Definición de Objetivos En esta fase inicial el equipo estableció el


problema de negocio del cliente, definió el objetivo principal y los objetivos
específicos del análisis, seleccionó el dataset adecuado y distribuyó los roles y
responsabilidades entre los integrantes. También se establecieron los criterios de
calidad que debían cumplir los entregables. Esta fase fue liderada por el jefe de
Proyecto en coordinación con todos los integrantes del equipo.

Fase 2: Obtención de Datos En esta fase el Administrador de Sistemas accedió al


repositorio UCI, descargó el archivo [Link], verificó su integridad y lo
almacenó en la carpeta sin realizar ninguna modificación. Se documentaron las
características del archivo: formato CSV con separador punto y coma, 45,211
registros y 17 variables originales. Esta fase garantizó que los datos fuente
quedaran preservados y disponibles para todas las etapas posteriores.

Fase 3: Análisis Exploratorio de Datos (EDA) En esta fase el Data Scientist 1


realizó la exploración sistemática del dataset mediante estadísticas descriptivas,
análisis de distribuciones, identificación de outliers, evaluación de la variable
objetivo y construcción de tablas de contingencia. Esta fase permitió comprender la
estructura y comportamiento general de los datos antes de su procesamiento, y
generó los insumos analíticos que orientaron las fases siguientes.

Fase 4: Procesamiento y Limpieza de Datos En esta fase el Administrador de


Sistemas ejecutó las transformaciones necesarias para obtener un dataset limpio y
estructurado. Las acciones incluyeron la eliminación de registros duplicados, la
verificación y corrección de tipos de datos, y la creación de la variable nueva

4-31
age_group que clasifica a los clientes en los segmentos Joven, Adulto y Mayor. El
resultado de esta fase fue el archivo bank_limpio.csv, que sirvió como base para el
análisis visual.

Fase 5: Visualización y Análisis de Resultados En esta fase el Data Analyst


diseñó y generó los seis gráficos a 300 dpi utilizando Python con las librerías Pandas
y Matplotlib. Cada visualización fue seleccionada para responder a una pregunta
específica de negocio y fue acompañada de su análisis técnico, su interpretación
accesible y los conceptos estadísticos necesarios para su comprensión. Esta fase
constituye el núcleo analítico del presente informe.

Fase 6: Conclusiones y Presentación En esta fase final el Jefe de Proyecto


integró los hallazgos de todas las secciones en un conjunto de conclusiones
generales coherentes con el problema de negocio planteado. Se elaboró el informe
ejecutivo completo, se prepararon los materiales para la exposición presencial y se
organizaron y verificaron todos los anexos técnicos antes de la entrega final.

El flujo completo del pipeline puede resumirse de la siguiente manera:

Entregables del Proyecto

Al finalizar el proyecto, el equipo entregará de forma organizada y verificada los


siguientes productos:

Entregable 1: Informe Ejecutivo (este documento) Documento en formato PDF


de aproximadamente 25 páginas que integra el documento ejecutivo, la gestión de
datos, el análisis exploratorio, el análisis visual con los seis gráficos y las
conclusiones generales del proyecto. Redactado en lenguaje técnico y accesible,
orientado tanto al cliente como al evaluador académico.

Entregable 2: Notebook Jupyter Ejecutable Archivo en formato .ipynb que


contiene todo el código Python implementado durante el proyecto: carga del dataset,
revisión inicial, estadísticas descriptivas, limpieza y procesamiento, creación de
nuevas variables y generación de las seis visualizaciones. El notebook incluye
comentarios detallados en cada sección para facilitar su comprensión y verificación.

5-31
Entregable 3: Datasets CSV Dos archivos en formato CSV: el dataset original
[Link] tal como fue descargado del repositorio UCI, y el dataset procesado
bank_limpio.csv sin registros duplicados, con tipos de datos corregidos y con las
nuevas variables creadas. Ambos archivos se entregan debidamente identificados
y almacenados en sus carpetas correspondientes.

Entregable 4: Gráficos PNG a 300 dpi Seis archivos de imagen en formato PNG
con resolución de 300 dpi, listos para su inserción en informes y presentaciones.
Los gráficos cubren la distribución de edades, el saldo bancario por grupo de edad,
la tasa de respuesta por estado civil, la tasa de respuesta por nivel educativo, la
relación entre edad y saldo bancario, y la tasa de respuesta por mes de contacto.

Entregable 5: Presentación para Exposición Presencial Material visual


preparado para la defensa presencial del proyecto, que incluye la descripción del
pipeline completo, los hallazgos más relevantes de cada fase, los gráficos
generados y las conclusiones orientadas al caso de negocio del Banco Mercantil
Santa Cruz.

6-31
CAPITULO ll:
GESTIÓN Y PREPARACIÓN DE DATOS
2.1 Gestión y preparación de datos
En esta etapa del proyecto se realizó la gestión técnica de los datos, incluyendo la
adquisición, organización, revisión inicial, limpieza y preparación del dataset. Esta
fase es fundamental, ya que garantiza la calidad de la información que será utilizada
en los análisis posteriores y en la toma de decisiones.

2.2. Dataset original


El dataset utilizado en el proyecto corresponde a una base de datos de marketing
bancario orientada al análisis de campañas de captación de depósitos a plazo. Para
el desarrollo del proyecto, se seleccionó el archivo principal con mayor volumen de
datos, con el objetivo de garantizar un análisis más completo y representativo.

Tabla 1: Características del Dataset

Característica Detalle
Nombre del archivo [Link]
Formato CSV (separado por punto y coma ";")
Fuente UCI Machine Learning Repository
Total de registros 45,211
Total de variables 17
Variable objetivo y (yes = aceptó / no = rechazó)
Tamaño aproximado 3.8 MB
Elaboración: Fuente propia

En esta etapa, como Administrador de Sistemas, se realizó la selección del dataset


adecuado, priorizando el archivo completo ([Link]) sobre versiones
reducidas, debido a su mayor cantidad de registros y variables disponibles.

Posteriormente, se llevó a cabo la verificación del formato del archivo, identificando


que utiliza como separador el punto y coma (“;”), lo cual fue considerado al momento
de cargar los datos en el entorno de trabajo para evitar errores de lectura.

7-31
El archivo original fue almacenado sin modificaciones en la carpeta
01_dataset_original, con el propósito de preservar la integridad de los datos
originales y permitir su reutilización en caso de ser necesario.

Esta etapa permitió garantizar que los datos iniciales estuvieran correctamente
identificados, accesibles y listos para su posterior análisis y procesamiento.

2.3. Carga y revisión inicial del dataset


En esta etapa, como Administrador de Sistemas, se realizó la carga y verificación
inicial del dataset utilizando el entorno de trabajo basado en Python,
específicamente mediante la librería pandas.

Para la correcta lectura del archivo, se tuvo en cuenta que el dataset utiliza como
separador el punto y coma (“;”), por lo que se empleó el parámetro correspondiente
al momento de la carga.

Una vez cargado el dataset, se ejecutaron diversas funciones para realizar una
revisión inicial completa:

Tabla 2: Funciones de Revisión Inicial

Función Python Qué se verificó Resultado obtenido


45,211 filas × 18
[Link] Dimensiones del dataset
columnas
Estructura correcta y
[Link]() Primeras filas del dataset
legible
18 columnas
[Link] Nombres de las variables correctamente
identificadas
Variables numéricas y
[Link]() Tipos de datos por columna
categóricas
Sin valores nulos
[Link]().sum() Valores nulos por columna
(resultado: 0)
Sin duplicados
[Link]().sum() Registros duplicados
(resultado: 0)
Elaboración: Fuente propia

8-31
A partir de esta revisión inicial, se logró comprender la estructura, calidad y
características generales del dataset, lo cual permitió establecer una base sólida
para las siguientes etapas del proyecto.

Esta fase fue fundamental para detectar posibles problemas en los datos y
garantizar que el dataset esté correctamente preparado para su análisis exploratorio
y procesamiento.

2.4. Análisis preliminar


Una vez realizada la carga y revisión inicial del dataset, se procedió a efectuar un
análisis preliminar con el objetivo de comprender la estructura y comportamiento
general de los datos antes de su procesamiento. En esta etapa, se utilizaron
funciones de exploración básica como describe() y value_counts() para obtener una
visión general de las variables numéricas y categóricas. En primer lugar, mediante
el análisis estadístico descriptivo, se identificaron características importantes de las
variables numéricas, tales como la edad de los clientes, el balance de sus cuentas
y la duración de las llamadas. Esto permitió observar rangos de valores, promedios
y posibles variaciones dentro del dataset. Por otro lado, se analizaron las variables
categóricas, como el tipo de trabajo, estado civil y nivel educativo, con el fin de
identificar las categorías más frecuentes y su distribución dentro de la población
analizada. Asimismo, se realizó una revisión de la variable objetivo y, la cual indica
si el cliente aceptó o no el depósito a plazo. A través de este análisis se pudo
observar la distribución de respuestas entre “sí” y “no”, permitiendo identificar un
posible desbalance en las clases. Este análisis preliminar permitió detectar patrones
iniciales en los datos, así como comprender mejor las características de los clientes
y su comportamiento frente a las campañas de marketing. Finalmente, esta etapa
sirvió como base para definir las acciones de limpieza y transformación de datos,
asegurando que el dataset esté preparado de manera adecuada para análisis más
avanzados en las siguientes fases del proyecto.

9-31
2.5. Limpieza y procesamiento de datos
En esta etapa, como Administrador de Sistemas, se realizaron las tareas necesarias
para garantizar la calidad, consistencia y utilidad del dataset antes de su análisis
detallado.

Estas tareas garantizan la calidad, consistencia y utilidad del dataset a través del
análisis exhaustivo de las variables y la estructura de la misma.

Tabla 3: Acciones de Limpieza y Procesamiento Realizadas

Acción realizada Método utilizado Resultado


Dataset sin registros
Eliminación de duplicados df.drop_duplicates()
repetidos
Verificación de nulos [Link]().sum() Sin valores faltantes
Tipos correctamente
Revisión de tipos de datos [Link]
definidos
Creación variable 3 categorías: Joven,
[Link]()
age_group Adulto, Mayor
Elaboración: Fuente propia

En primer lugar, se procedió a la identificación y eliminación de registros duplicados


utilizando funciones específicas del entorno de trabajo. Esta acción permitió evitar
redundancias en los datos que podrían afectar los resultados del análisis.
Posteriormente, se llevó a cabo la verificación de valores nulos en todas las
variables del dataset. A partir de este análisis, se determinó que el conjunto de datos
no presenta valores faltantes significativos, por lo que no fue necesario aplicar
técnicas de imputación o eliminación de registros.

Asimismo, se realizó una revisión de los tipos de datos de cada variable,


asegurando que las variables numéricas y categóricas estén correctamente
definidas, lo cual es fundamental para su correcto procesamiento y análisis
posterior.

Finalmente, se verificó la consistencia general del dataset tras las transformaciones


realizadas, asegurando que los datos se encuentren limpios, organizados y listos
para su uso en las siguientes etapas del proyecto.
10-31
Estas acciones permitieron obtener un dataset depurado, mejor estructurado y
adecuado para el desarrollo de análisis más avanzados.

2.6. Dataset limpio final


Como resultado del proceso de limpieza y procesamiento de datos, se generó un
nuevo archivo denominado bank_limpio.csv, el cual contiene el dataset depurado y
listo para su uso en las siguientes etapas del proyecto. Este archivo fue almacenado
en la carpeta 03_dataset_limpio, manteniendo la organización establecida desde el
inicio. El dataset final no presenta registros duplicados y conserva la integridad de
los datos originales, además de incluir las transformaciones realizadas, como la
creación de nuevas variables que facilitan el análisis. De esta manera, se obtuvo
una versión optimizada del conjunto de datos, adecuada para el análisis
exploratorio, la generación de visualizaciones y el desarrollo de modelos,
garantizando así una base confiable para la toma de decisiones dentro del proyecto.

2.7. Organización del proyecto


Para mantener un flujo de trabajo ordenado, se estructuraron las carpetas del
proyecto de la siguiente manera:

Tabla 4: Estructura de Carpetas del Proyecto

Carpeta Contenido

01_dataset_original Dataset original sin modificaciones ([Link])

02_notebook Notebook Jupyter con todo el código del proyecto (.ipynb)

03_dataset_limpio Dataset procesado y limpio (bank_limpio.csv)

04_graficos_png 6 gráficos PNG a 300 dpi generados con Python

05_informe Documento ejecutivo en formato PDF

06_presentacion Material para la exposición presencial

07_aportes_por_rol Contribuciones individuales de cada integrante


Elaboración: Fuente propia

Esta organización facilita el trabajo colaborativo y la integración de resultados.

11-31
2.8 Conclusión
En conclusión, el trabajo realizado como Administrador de Sistemas permitió
establecer una base sólida para el desarrollo del proyecto, asegurando que el
dataset utilizado sea confiable, consistente y adecuado para su análisis. A través de
la correcta selección, organización, revisión y limpieza de los datos, se logró obtener
un conjunto de información depurado y estructurado, libre de duplicados y con una
mejor interpretación gracias a las transformaciones aplicadas. Este proceso no solo
garantizó la integridad de los datos originales, sino que también facilitó el trabajo de
los demás integrantes del equipo, permitiendo que las etapas posteriores, como el
análisis exploratorio y la visualización, se realicen de manera más eficiente y
precisa. De esta manera, se destaca la importancia del rol del Administrador de
Sistemas como un elemento clave para asegurar la calidad de la información y el
éxito del proyecto en su conjunto.

12-31
CAPITULO lll:
ANALISIS EXPLORATORIO DE DATOS
3.1 Introducción al EDA
El presente documento detalla el proceso técnico y analítico llevado a cabo durante
la fase de exploración de datos. En primera instancia, se realizó una auditoría
exhaustiva del diccionario de datos, revisando la definición y el tipo de medida de
cada variable involucrada. Este paso permitió validar la integridad de la información,
asegurando que las variables categóricas y numéricas correspondieran a su
naturaleza lógica y descartando posibles errores de carga o inconsistencias en los
formatos de entrada.

Tabla 5: Diccionario de variables del dataset Bank Marketing

Variable Tipo Descripción

age Numérica entera Edad del cliente en años

job Categórica nominal Tipo de ocupación laboral del cliente

marital Categórica nominal Estado civil (married, single, divorced)

education Categórica ordinal Nivel educativo (primary, secondary, tertiary)

default Categórica binaria Si el cliente tiene crédito en mora (yes/no)

balance Numérica entera Saldo promedio anual en cuenta bancaria (€)


housing Categórica binaria Si tiene préstamo hipotecario (yes/no)

loan Categórica binaria Si tiene préstamo personal (yes/no)

contact Categórica nominal Tipo de contacto (cellular, telephone, unknown)


day Numérica entera Día del mes del último contacto

month Categórica nominal Mes del último contacto

duration Numérica entera Duración del último contacto en segundos

campaign Numérica entera Número de contactos en esta campaña

Días desde el último contacto de campaña


pdays Numérica entera
anterior

previous Numérica entera Contactos realizados en campañas anteriores

poutcome Categórica nominal Resultado de la campaña anterior

y Categórica binaria Variable objetivo: aceptó depósito (yes/no)

Grupo de edad: Joven, Adulto, Mayor (variable


age_group Categórica ordinal
nueva)
Elaboración: Fuente propia

13-31
3.3 Estadísticas Descriptivas
Posteriormente, se procedió con la ejecución de estadísticas descriptivas integrales.
Se calcularon medidas de tendencia central (media, mediana) y de dispersión
(desviación estándar, rangos e intervalos intercuartílicos) para comprender la
distribución de los datos. Este análisis fue crucial para identificar valores atípicos
(outliers) que podrían sesgar futuros modelos, así como para cuantificar el volumen
de datos faltantes, estableciendo así una base sólida sobre la representatividad de
la muestra.

Tabla 6: Estadísticas descriptivas de las variables

Desv.
Variable Media Mediana Mínimo Máximo
Estándar

age (edad) 40.94 39 18 95 10.62

balance (saldo) 1,362 448 -8,019 102,127 3,044

duration (seg. llamada) 258 180 0 4,918 257


campaign (contactos) 2.76 2 1 63 3.10

pdays (días últ. cont.) 40.2 -1 -1 871 100.1

previous (cont. prev.) 0.58 0 0 275 2.30


Elaboración: Fuente propia

Del análisis descriptivo se destacan los siguientes hallazgos:

• La edad promedio de los clientes es de 40.94 años, con una mediana de 39


años, lo que indica una distribución levemente asimétrica hacia la derecha.

• El saldo bancario presenta alta variabilidad (desviación estándar de 3,044 €)


y valores extremos que van desde -8,019 € hasta 102,127 €, lo que señala la
presencia de outliers significativos.

• La duración promedio de las llamadas es de 258 segundos


(aproximadamente 4 minutos), con alta dispersión.

• El número promedio de contactos por campaña es de 2.76, pero con un


máximo de 63, lo que indica casos de contacto excesivo.

14-31
3.4 Análisis de la Variable Objetivo
Un componente central de este análisis fue el estudio detallado de la variable
objetivo. A través de técnicas de visualización y tablas de frecuencia, se analizó su
comportamiento y distribución, evaluando si existía un desbalance que requiriera
tratamientos posteriores. Mediante la creación de tablas de contingencia y conteos
cruzados, se exploró la relación entre las variables predictoras y el objetivo, lo que
permitió detectar los primeros patrones de correlación y comportamientos
recurrentes dentro de los segmentos de datos.

Tabla 7: Distribución de la variable objetivo y

Respuesta Significado Cantidad Porcentaje

no Rechazó la campaña 39,922 88.3%

si Aceptó la campaña 5,289 11.7%

Total — 45,211 100%


Elaboración: Fuente propia

Finalmente, el proceso culminó con la interpretación de los hallazgos en lenguaje


no técnico, transformando las métricas estadísticas en conclusiones accionables
para los interesados. Se identificaron tendencias clave y anomalías significativas
que aportan valor estratégico al informe final. Este análisis exploratorio no solo
garantiza la calidad de los datos, sino que proporciona la hoja de ruta necesaria
para las etapas de preprocesamiento y modelado avanzado.

3.5 Tablas de Contingencia y Patrones Iniciales


Se construyeron tablas de contingencia entre la variable objetivo y las principales
variables categóricas para identificar los primeros patrones de comportamiento:

Tabla 8: Tasa de respuesta por estado civil

Estado Civil No respondió Sí respondió Total clientes

Casado/a 89.9% 10.1% 27,214

Soltero/a 85.1% 14.9% 12,790


Divorciado/a 88.1% 11.9% 5,207
Elaboración: Fuente propia

15-31
Tabla 9: Tasa de respuesta por nivel educativo

Nivel Educativo No respondió Sí respondió Total clientes

Primaria 91.4% 8.6% 6,851


Secundaria 89.4% 10.6% 23,202

Terciaria (Univ.) 85.0% 15.0% 13,301

Desconocido 86.4% 13.6% 1,857


Elaboración: Fuente propia

Tabla 10: Tasa de respuesta por grupo de edad

Grupo de Edad No respondió Sí respondió Total clientes

Joven (18-30) 83.7% 16.3% 7,030

Adulto (31-60) 90.2% 9.8% 28,926

Mayor (> 60) 85.8% 14.2% 9,255


Elaboración: Fuente propia

Tabla 11: Tasa de respuesta por ocupación laboral

Ocupación Tasa de respuesta SÍ

Estudiante (student) 28.7%

Jubilado (retired) 22.8%

Desempleado (unemployed) 15.5%

Gerencia (management) 13.8%

Administrativo (admin.) 12.2%


Elaboración: Fuente propia

3.6 Identificación de Outliers


Se aplicó el método del rango intercuartílico (IQR) para detectar valores atípicos en
las variables numéricas principales. Un valor se considera outlier cuando cae por
debajo de Q1 - 1.5×IQR o por encima de Q3 + 1.5×IQR.

Bajo este criterio, cualquier observación situada por debajo de \(Q1 - 1.5 \times
IQR\) o por encima de \(Q3 + 1.5 \times IQR\) fue catalogada como un valor atípico
(outlier). Esta técnica permite detectar datos extremos que podrían sesgar los
resultados finales del análisis."

16-31
Tabla 12: Outliers detectados por variable

Outliers
Variable Q1 Q3 IQR % del total
detectados

age (edad) 33 48 15 487 1.1%


balance (saldo) 72 1,428 1,356 4,729 10.5%

duration (seg.) 103 319 216 3,235 7.2%

campaign (cont.) 1 3 2 3,064 6.8%


Elaboración: Fuente propia

La variable balance presenta el mayor porcentaje de outliers (10.5%), lo cual es


esperable dado que los saldos bancarios pueden variar enormemente entre
clientes. Estos valores atípicos no fueron eliminados ya que representan clientes
reales con comportamientos financieros genuinos y son relevantes para el análisis.

3.7 Análisis de Correlaciones


Se calculó la matriz de correlación entre las variables numéricas para identificar
posibles relaciones lineales entre ellas:

Tabla 13: Matriz de correlación entre variables

Variable Age balance duration campaign

age 1.000 0.098 -0.005 0.005

balance 0.098 1.000 0.022 -0.015

duration -0.005 0.022 1.000 -0.085

campaign 0.005 -0.015 -0.085 1.000


Elaboración: Fuente propia

Los valores de correlación son muy bajos en todos los casos, lo que indica que las
variables numéricas son prácticamente independientes entre sí. La correlación más
alta es entre age y balance (0.098), confirmando que existe una relación positiva
muy débil entre la edad y el saldo del cliente.

3.8 Conclusión
El análisis exploratorio de datos permitió obtener una comprensión completa del
dataset Bank Marketing antes de proceder con el análisis visual. Los hallazgos más
relevantes de esta fase son los siguientes: el dataset presenta un desbalance de
17-31
clases significativo donde el 88.3% de los clientes rechazó la campaña, lo que
refuerza la importancia de identificar los perfiles más receptivos. Las variables
estado civil, nivel educativo y grupo de edad muestran diferencias notables en las
tasas de respuesta, siendo los solteros, los universitarios y los jóvenes los perfiles
con mayor receptividad. La variable balance presenta alta variabilidad y outliers
considerables que reflejan la heterogeneidad financiera de la base de clientes. Las
correlaciones entre variables numéricas son bajas, lo que indica que cada variable
aporta información independiente al análisis. Estos hallazgos establecen una base
sólida para la interpretación de las visualizaciones desarrolladas en el Capítulo 4.

18-31
CAPITULO lV:
ANALISIS VISUAL Y RESULTADOS
4.1. ANALISIS DE RESULTADOS GRAFICOS

El presente informe corresponde a la fase de análisis visual del Proyecto Final de


Data Science, desarrollado para el cliente Banco Mercantil Santa Cruz. El análisis
se basa en el dataset Bank Marketing del repositorio UCI Machine Learning, que
contiene 45,211 registros de clientes contactados durante campañas de marketing
telefónico del banco.

Todos los gráficos fueron elaborados con Python (librerías Pandas y Matplotlib) a
una resolución de 300 dpi.

4.2. Histograma de Distribución de Edades

Figura 1Histograma de Distribución de Edades

18 años 40.9 años 39 años 95 años


Edad mínima Edad promedio Mediana Edad máxima

Fuente: Elaboración propia

19-31
El presente histograma representa la distribución de frecuencias de la variable age
dentro del dataset, compuesto por 45,211 registros de clientes del Banco Mercantil
Santa Cruz. El eje horizontal (X) agrupa las edades en intervalos de cinco años,
comenzando desde los 18 y extendiéndose hasta los 95 años, mientras que el eje
vertical (Y) indica la frecuencia absoluta, es decir, el número de clientes que se
encuentran dentro de cada intervalo.

Desde una perspectiva estadística, la distribución presenta una asimetría positiva


moderada, también denominada sesgo hacia la derecha. Esto se evidencia en que
la media (40.9 años) es ligeramente superior a la mediana (39 años), lo cual indica
que existe una cola de valores altos (clientes de edad avanzada) que elevan el
promedio por encima del valor central. La mayor concentración de registros se ubica
en el rango de 30 a 35 años, con 9,740 clientes, lo que representa el bin modal del
histograma.

Las líneas de referencia superpuestas permiten comparar visualmente la media y la


mediana: su proximidad confirma que la distribución no es extremadamente
asimétrica, pero sí sugiere que el perfil de cliente predominante corresponde a
adultos en etapa laboral activa. La desviación estándar de 10.6 años indica una
dispersión moderada, lo que implica que la mayoría de los clientes se concentra en
una franja de edad relativamente acotada alrededor del promedio.

Este hallazgo es relevante para el análisis de negocio porque establece que las
campañas de marketing del banco están impactando principalmente a una
población adulta joven y de mediana edad, lo cual debe tenerse en cuenta al diseñar
estrategias de segmentación y comunicación. Asimismo, este patrón etario puede
influir en la preferencia por ciertos productos financieros, como créditos de consumo
o hipotecarios, orientados a etapas de consolidación económica. De igual forma,
abre la oportunidad de desarrollar estrategias específicas para segmentos menos
representados, como clientes jóvenes o adultos mayores, con el fin de ampliar la
cobertura del mercado.

20-31
4.3. Boxplot de Saldo Bancario por Grupo de Edad

Figura 2 Boxplot de Saldo Bancario por Grupo de Edad

346 € 429 € 654 €


Mediana Jóvenes Mediana Adultos Mediana Mayores

Fuente: Elaboración propia

El diagrama de caja o boxplot presentado permite comparar la distribución del saldo


bancario (balance) entre tres segmentos de clientes definidos según su grupo de
edad: Jóvenes (18 a 30 años), Adultos (31 a 60 años) y Mayores (más de 60 años).
Los valores del saldo han sido acotados en el rango de -500 a 8,000 euros para
mejorar la legibilidad visual, eliminando el efecto distorsionador de los outliers
extremos sin eliminarlos del análisis estadístico.

El boxplot sintetiza cinco estadísticos descriptivos por grupo: el valor mínimo, el


primer cuartil (Q1), la mediana (Q2), el tercer cuartil (Q3) y el valor máximo dentro
de los bigotes, que se extienden hasta 1.5 veces el rango intercuartílico (IQR). Los
puntos que caen fuera de ese rango son representados como outliers individuales
y aparecen como puntos dispersos sobre y bajo cada caja.

21-31
El análisis comparativo revela una tendencia clara: los saldos bancarios aumentan
progresivamente con la edad. Los clientes Mayores presentan la mediana más
elevada y también el rango intercuartílico más amplio, lo que indica mayor
variabilidad en sus saldos. Los clientes Jóvenes, por su parte, presentan la mediana
más baja y el rango intercuartílico más estrecho, lo que refleja una menor capacidad
de ahorro consistente con su etapa de vida. Los Adultos se ubican en una posición
intermedia con una mediana de 429 Bs.

La presencia de outliers en los tres grupos, especialmente en el segmento Mayor,


indica que existe una subpoblación de clientes con saldos significativamente
superiores al rango típico de su grupo, lo cual podría ser relevante para estrategias
de banca premium o productos de inversión diferenciados.

4.4. Tasa de Respuesta por Estado Civil

Figura 3Tasa de Respuesta por Estado Civil

10.1% 14.9% 11.9%


Casado/a — SÍ respondió Soltero/a — SÍ respondió Divorciado/a — SÍ respondió

Fuente: Elaboración propia

22-31
Este gráfico de barras agrupadas analiza la relación entre la variable categórica
marital (estado civil) y la variable objetivo-binaria y (respuesta a la campaña: sí o
no). Los valores se expresan en términos porcentuales para garantizar una
comparación equitativa entre grupos, dado que el número de clientes en cada
categoría de estado civil difiere considerablemente: 27,214 casados, 12,790
solteros y 5,207 divorciados.

El análisis evidencia diferencias estadísticamente relevantes en la tasa de


respuesta positiva según el estado civil. Los clientes solteros presentan la mayor
proporción de respuesta afirmativa con un 14.9%, lo que representa una diferencia
de 4.8 puntos porcentuales respecto a los clientes casados (10.1%) y 3.0 puntos
porcentuales respecto a los divorciados (11.9%). Esta diferencia puede interpretarse
bajo una hipótesis de autonomía en la toma de decisiones financieras: los individuos
solteros tienden a tomar decisiones económicas de forma unilateral, sin necesidad
de consenso con una pareja, lo que podría facilitar una respuesta más inmediata y
positiva ante una propuesta bancaria.

Desde la perspectiva del análisis exploratorio, este hallazgo sugiere que el estado
civil podría ser una variable con poder predictivo moderado para la variable objetivo,
y debería considerarse en etapas posteriores de modelado si el proyecto avanzara
hacia la construcción de modelos de clasificación. La diferencia observada, aunque
no es extrema, es consistente y apunta a un patrón real en el comportamiento del
cliente.

Adicionalmente, desde un enfoque estratégico, estos resultados pueden orientar la


personalización de campañas de marketing, adaptando el mensaje y los canales
según el estado civil del cliente. Por ejemplo, campañas dirigidas a clientes solteros
podrían enfatizar beneficios de rapidez, independencia y flexibilidad financiera,
mientras que para clientes casados podrían centrarse en seguridad, planificación a
largo plazo o beneficios familiares. De este modo, el uso de esta variable no solo
aporta valor analítico, sino también una ventaja competitiva en la toma de decisiones
comerciales basadas en datos.

23-31
4.5. Tasa de Respuesta por Nivel Educativo

Figura 4 Tasa de Respuesta por Nivel Educativo

8.6% 10.6% 15.0%


Primaria — SÍ Secundaria — SÍ Terciaria — SÍ

Fuente: Elaboración propia

El gráfico de barras agrupadas presentado examina la distribución de la variable


objetivo y en función del nivel educativo (education) del cliente, categorizado en
cuatro niveles: primaria, secundaria, terciaria y desconocido. Al igual que en el
análisis anterior, los valores se expresan en porcentaje para permitir una
comparación equitativa entre grupos de distinto tamaño.

Los resultados revelan un gradiente positivo claro entre el nivel educativo y la tasa
de respuesta afirmativa: los clientes con educación primaria presentan la menor tasa
de aceptación (8.6%), mientras que los clientes con educación terciaria o
universitaria presentan la mayor (15.0%), representando una diferencia de 6.4
puntos porcentuales. Los clientes con educación secundaria se ubican en una

24-31
posición intermedia (10.6%), confirmando la relación monotónica entre nivel
educativo y receptividad a la campaña.

Este patrón puede interpretarse desde múltiples ángulos analíticos. En primer lugar,
los clientes con mayor nivel educativo suelen tener mayor familiaridad con los
productos financieros, lo que reduce la incertidumbre al momento de evaluar una
propuesta. En segundo lugar, tienden a ocupar posiciones laborales con mayores
ingresos, lo que les brinda mayor capacidad para comprometerse con un producto
bancario. En tercer lugar, pueden tener mayor confianza en sus propias decisiones
financieras y menor resistencia a propuestas nuevas.

Desde el punto de vista del análisis exploratorio, la variable education muestra un


poder de discriminación relevante respecto a la variable objetivo, lo que la convierte
en un candidato importante para modelos predictivos futuros.

4.6. Scatter: Relación entre Edad y Saldo Bancario

Figura 5 Scatter: Relación entre Edad y Saldo Bancario

1,804 € 1,304 € +500 €


Saldo promedio — SÍ respondió Saldo promedio — NO respondió Diferencia de saldo

Fuente: Elaboración propia


25-31
El diagrama de dispersión o scatter plot permite visualizar la relación bivariante entre
las variables continuas age (edad) y balance (saldo bancario), diferenciando
mediante codificación de color a los clientes que respondieron afirmativamente (yes,
en azul) de los que respondieron negativamente (no, en rojo). Con el objetivo de
mejorar la legibilidad del gráfico y evitar la distorsión producida por outliers extremos
en la variable balance, los valores han sido acotados al rango de -1,000 a 15,000
euros. Adicionalmente, se han superpuesto líneas de tendencia basadas en
regresión lineal simple para cada subgrupo.

La nube de puntos exhibe una dispersión considerable en ambos subgrupos, lo cual


es esperado dado que el saldo bancario de una persona depende de múltiples
factores simultáneos (ingresos, gastos, hábitos de ahorro, deudas) que no están
todos representados en el dataset. Sin embargo, las líneas de tendencia revelan
una correlación positiva débil pero consistente en ambos grupos: a mayor edad,
mayor saldo bancario tendencial, lo cual es coherente con la acumulación
progresiva de patrimonio a lo largo de la vida laboral.

El hallazgo analíticamente más relevante emerge al comparar las líneas de


tendencia de ambos subgrupos: la línea correspondiente a los clientes que
respondieron "sí" se posiciona por encima de la línea de los que respondieron "no"
en prácticamente todos los rangos de edad. Esto se refleja en los promedios: los
clientes que aceptaron la campaña presentan un saldo medio de 1,804 euros, frente
a los 1,304 euros de quienes la rechazaron. Esta diferencia de 500 euros sugiere
que la estabilidad o solidez financiera del cliente es un factor asociado positivamente
con la receptividad a la campaña, lo que tiene implicaciones directas para la
segmentación de clientes en futuras campañas.

Además, se puede observar que la mayor concentración de puntos se sitúa en


rangos de edad intermedios (entre 30 y 50 años), lo que coincide con etapas de
mayor actividad económica. La dispersión vertical dentro de cada rango etario indica
que, aunque existe una tendencia general, el saldo presenta alta variabilidad
individual. También es relevante notar que los clientes con saldos negativos o
cercanos a cero tienen menor presencia en el grupo que respondió afirmativamente.

26-31
Esto refuerza la idea de que la capacidad económica influye en la decisión de
aceptar productos financieros. En conjunto, el análisis sugiere que la combinación
de edad y balance podría aportar valor adicional en modelos predictivos si se
consideran de forma conjunta o mediante interacciones.

4.7. Tasa de Respuesta por Mes de Contacto

Figura 6 Tasa de Respuesta por Mes de Contacto

52.0% 6.7% Mayo (13,766)


Mejor mes (Marzo) Peor mes (Mayo) Mes más contactado

Fuente: Elaboración propia

El último gráfico de barras agrupadas examina la distribución temporal de la variable


objetivo y a lo largo de los doce meses del año, con el objetivo de identificar patrones
estacionales en la receptividad de los clientes frente a las campañas de marketing
bancario. El análisis se presenta en términos porcentuales para cada mes, lo que
permite una comparación justa a pesar de las grandes diferencias en el volumen de
contactos entre meses: mayo concentra 13,766 contactos mientras que diciembre
apenas registra 214.

Los resultados exhiben una heterogeneidad mensual altamente significativa. Los


meses de marzo (52.0%), septiembre (46.5%), octubre (43.8%) y diciembre (46.7%)

27-31
presentan tasas de respuesta positiva que superan ampliamente el promedio anual,
sugiriendo que en esos períodos los clientes se encuentran en un estado de mayor
receptividad o disposición hacia productos financieros. En contraste, los meses de
mayo (6.7%), julio (9.1%) y junio (10.2%) registran las tasas más bajas, a pesar de
que mayo es precisamente el mes con mayor volumen de contactos del dataset.

Esta divergencia entre volumen y efectividad en el mes de mayo es un hallazgo


crítico desde la perspectiva de la eficiencia operativa: el banco está invirtiendo la
mayor parte de su capacidad de contacto en el mes con menor retorno relativo. Esto
puede deberse a una estrategia de campaña intensiva en primavera que no
considera la receptividad real del cliente, o simplemente a que mayo fue
históricamente el mes elegido para lanzar campañas masivas sin evidencia de
rendimiento previo.

Desde el punto de vista analítico, la variable month demuestra tener una relación no
lineal y fuertemente estacional con la variable objetivo, lo que la convierte en una
variable de alta relevancia para cualquier modelo predictivo o estrategia de
segmentación temporal.

28-31
CAPITULO V:
CONCLUSIONES Y REFERENCIAS
5.1 Conclusiones Generales del Grupo
El presente proyecto permitió al equipo aplicar un pipeline completo de Data Science
sobre el dataset Bank Marketing del repositorio UCI, contextualizado para el caso
de negocio del Banco Mercantil Santa Cruz. A continuación se presentan los cinco
hallazgos principales que responden directamente al objetivo del proyecto:

Hallazgo 1: Perfil etario predominante del cliente

El cliente típico del Banco Mercantil Santa Cruz tiene entre 30 y 45 años, con una
edad promedio de 40 años y una mediana de 39 años. La distribución es
ligeramente asimétrica hacia la derecha, con presencia de clientes mayores que
elevan el promedio. Este hallazgo indica que las campañas deben diseñarse
pensando en adultos en etapa laboral activa como perfil principal de cliente.

Hallazgo 2: Relación entre edad y capacidad financiera

Los clientes de mayor edad presentan saldos bancarios significativamente más


altos: la mediana del grupo Mayor (más de 60 años) equivale aproximadamente a
5,101 Bs., frente a 3,346 Bs. de los Adultos y 2,699 Bs. de los Jóvenes.
Adicionalmente, los clientes que respondieron sí a la campaña tienen un saldo
promedio equivalente a 14,071 Bs., un 38% más alto que quienes dijeron no (10,171
Bs.). Esto sugiere que la solidez financiera del cliente es un predictor positivo de
receptividad a las campañas.

Hallazgo 3: Perfiles demográficos más receptivos

El análisis de las variables demográficas revela diferencias claras en la tasa de


respuesta positiva. Los clientes solteros (14.9%) responden mejor que los casados
(10.1%) y divorciados (11.9%). Los clientes con educación universitaria (15.0%) casi
duplican la tasa de los clientes con solo educación primaria (8.6%). Los jóvenes
(16.3%) y mayores (14.2%) superan a los adultos (9.8%) en receptividad. Estos
patrones sugieren que segmentar las campañas por perfil demográfico puede
mejorar significativamente la tasa de conversión.

29-31
Hallazgo 4: Estacionalidad marcada en la efectividad de las campañas

Se identificó una estacionalidad muy pronunciada en la tasa de conversión mensual.


Los meses de marzo (52.0%), diciembre (46.7%), septiembre (46.5%) y octubre
(43.8%) presentan tasas extraordinariamente altas, mientras que mayo (6.7%) y
julio (9.1%) son los menos efectivos. El hallazgo más crítico es que mayo concentra
el mayor volumen de contactos del año (13,766 llamadas) pero tiene la menor tasa
de conversión, evidenciando una ineficiencia operativa significativa en la estrategia
actual de campañas.

Hallazgo 5: Desbalance de clases y desafío de conversión

El dataset presenta un fuerte desbalance en la variable objetivo: el 88.3% de los


clientes rechazó la campaña y solo el 11.7% la aceptó. Este hallazgo confirma que
las campañas de marketing bancario tienen una tasa de conversión naturalmente
baja, lo que hace aún más valiosa la identificación de los perfiles y momentos con
mayor receptividad. Cualquier mejora en la segmentación puede tener un impacto
multiplicador en el número de respuestas positivas obtenidas.

Tabla 14: Resumen de hallazgos principales del proyecto

Implicación para el
Hallazgo Variable clave Valor destacado
banco
Promedio 40.9 Campañas para adultos
Perfil etario Age
años laboralmente activos
Capacidad SÍ: 1,804€ vs NO: Priorizar clientes con
Balance
financiera 1,304€ mayor saldo
Perfil Enfocar en clientes
Education Terciaria: 15.0%
demográfico universitarios

Marzo: 52% vs Concentrar campañas en


Estacionalidad Month
Mayo: 6.7% meses clave

Desbalance de 88.3% no / 11.7% Optimizar segmentación


Y
clases yes para mejorar conversión

Fuente: Elaboración propia

30-31
5.2 Recomendaciones para el Cliente

Con base en los hallazgos obtenidos, el equipo presenta las siguientes


recomendaciones concretas para el Banco Mercantil Santa Cruz:

• Focalizar las campañas en los meses de marzo, septiembre, octubre y


diciembre, que presentan tasas de conversión entre 4 y 7 veces más altas
que mayo, el mes actualmente más utilizado.

• Priorizar el contacto con clientes solteros y con educación universitaria, que


muestran tasas de respuesta positiva consistentemente más altas que otros
segmentos demográficos.

• Considerar el saldo bancario como criterio de segmentación: los clientes con


mayor saldo responden mejor, lo que permite enfocar recursos en el
segmento con mayor retorno esperado.

• Revisar la estrategia del mes de mayo: actualmente concentra el mayor


volumen de llamadas, pero obtiene el peor resultado, lo que representa un
uso ineficiente de los recursos de la campaña.

• Evaluar la posibilidad de desarrollar un modelo predictivo en una etapa futura,


utilizando las variables identificadas como más discriminantes (estado civil,
educación, saldo, mes de contacto) para predecir la probabilidad de
respuesta de cada cliente antes de contactarlo.

5.3 Referencias Bibliográficas

Moro, S., Cortez, P., & Rita, P. (2014). A Data-Driven Approach to Predict the
Success of Bank Telemarketing. Decision Support Systems, 62, 22-31. UCI Machine
Learning Repository. [Link]

Python Software Foundation. (2023). Python Programming Language (Versión


3.10). [Link]

McKinney, W. & The Pandas Development Team. (2023). pandas: Python Data
Analysis Library. [Link]

31-31

También podría gustarte