Práctica 3
B. López
Sección Bioelectrónica, Departamento de Ingenierı́a Eléctrica
Cinvestav
Ciudad de México, México
[Link]@[Link]
Resumen—Este estudio desarrolla un modelo de aprendizaje coeficiente de correlación (r) y el coeficiente de determinación
automático para predecir concentraciones de benceno en aire (R²), con el fin de cuantificar su capacidad predictiva frente a
usando datos de sensores quı́micos. Tras un preprocesamiento los datos reales.
riguroso (limpieza, corrección de formatos y manejo de valores
faltantes), se implementó selección de caracterı́sticas median- II. M ATERIALES Y M ÉTODO
te Random Forest, conservando predictores clave, seguido de
modelado con red neuronal MLP bayesiana (arquitectura de 3 II-A. Pre procesamiento
neuronas ocultas con activación tansig y capa lineal purelin). Se importó el archivo [Link], asegurando una
Mediante validación robusta con 20 repeticiones y partición correcta lectura de las columnas de fecha y hora como texto.
temporal (61.2 % entrenamiento cronológico, 38.8 % aleatoriza-
do), se obtuvieron resultados: R² = 1.0000 ± 0.0000, MAE = Posteriormente, se combinaron en una nueva variable datetime,
0.02563 ± 0.0013 µg/m³, y el 90 % de las muestras mostraron que sirvió como referencia temporal. Las columnas originales
errores inferiores a 0.2 µg/m³. Estos hallazgos confirman la alta de fecha y hora, junto con dos columnas sin nombre (Var16
confiabilidad del modelo para monitoreo ambiental de benceno y Var17), fueron eliminadas al contener datos vacı́os.
en tiempo real. Todos los datos almacenados como texto se transformaron a
Index Terms—benceno, redes neuronales, calidad del aire,
sensores quı́micos, aprendizaje automático. valores numéricos, corrigiendo el formato europeo al reempla-
zar comas por puntos decimales. Finalmente, se identificaron
I. I NTRODUCCI ÓN y eliminaron las filas con valores perdidos en la variable
objetivo, que corresponde a la concentración de benceno
En este trabajo se empleó la base de datos Air Quality UCI, (µg/m³) medida por el analizador de referencia. Los valores
recopilada por la Agencia de Protección Ambiental de Italia y faltantes estaban marcados con -200 o como NaN, y se registró
publicada por De Vito et al. (2008). Esta base contiene medi- el porcentaje de datos eliminados en relación con el conjunto
ciones horarias registradas entre marzo de 2004 y febrero de total [1].
2005 en una estación de monitoreo ubicada en una zona urbana A partir del conjunto limpio, se definieron como variables
de una ciudad italiana. Los datos incluyen concentraciones de predictoras las resistencias de sensores MOX y ciertas medi-
gases contaminantes medidas por sensores MOX de bajo costo, ciones de referencia, mientras que la variable objetivo fue la
junto con valores de referencia proporcionados por analizado- concentración de benceno.
res convencionales, variables meteorológicas (temperatura y Siguiendo un enfoque temporal, se utilizaron los primeros
humedad relativa) y marcas temporales. 8 meses cronológicos (marzo a octubre de 2004), correspon-
El objetivo principal fue predecir la concentración de ben- dientes a 5,498 muestras (61.2 %), como conjunto de entrena-
ceno utilizando como entrada las señales provenientes de miento, ya que representan diversas condiciones estacionales
sensores MOX y ciertas variables de referencia. Para ello, se y posibles derivas sensoriales [1]. Los 6 meses restantes
extrajeron las variables relevantes, se limpiaron y normalizaron se permutaron aleatoriamente para evitar sesgos temporales,
los datos, y se desarrolló un modelo de regresión basado en dividiéndose en 524 muestras (5.8 %) para validación y 2,969
redes neuronales artificiales. muestras (33.0 %) para prueba.
Durante la fase de preprocesamiento, se aplicaron técnicas Para identificar las variables predictoras más relevantes, se
de imputación y eliminación de valores atı́picos o inválidos, entrenó un modelo de Random Forest compuesto por 300
ası́ como transformación temporal. Posteriormente, se utilizó árboles, utilizando únicamente el conjunto de entrenamiento
el algoritmo de Random Forest para identificar las variables [2].
más relevantes en la predicción del benceno, basándose en su La validación se realizó mediante el método Out-Of-Bag
importancia OOB (Out-Of-Bag). Para reducir la redundancia, (OOB). En este enfoque, cada árbol se entrena sobre una
se eliminaron variables altamente correlacionadas. muestra aleatoria del conjunto (con reemplazo), y aquellas
Finalmente, se entrenó una red neuronal de tipo Multilayer observaciones que no se usan para entrenarlo se emplean como
Perceptron (MLP), configurada para resolver un problema subconjunto de prueba (OOB).
de regresión. Este modelo fue evaluado mediante métricas La importancia de cada variable se estimó mediante la técni-
como el error absoluto medio (MAE), el error cuadrático ca de permutación [3]: se altera aleatoriamente una variable en
medio (MSE), la raı́z del error cuadrático medio (RMSE), el las muestras OOB y se mide cuánto se incrementa el error de
predicción. Si el error aumenta significativamente, se considera Para evaluar la capacidad de generalización del modelo y
que la variable tiene alta relevancia. mitigar el riesgo de sobreajuste, se implementó un protocolo
La importancia de la variable xj se define formalmente de validación robusto basado en repeticiones múltiples con
como Ecuación (1): partición cronológica para entrenamiento y aleatoria para
validación y prueba.
Imp(xj ) = ErrOOB(j) − ErrOOB (1) Cada experimento se repitió 20 veces para garantizar ro-
bustez estadı́stica en las métricas de desempeño. En cada
donde ErrOOB es el error promedio del modelo evaluado repetición, se generó una nueva partición aleatoria de los
sobre las muestras OOB, y ErrOOB(j) es el error obtenido tras conjuntos de validación y prueba.
permutar aleatoriamente los valores de la variable xj . Antes de entrenar la red neuronal, se aplicó una normali-
Para filtrar las variables menos relevantes, se utilizó como zación min-max al rango [–1, 1], coherente con la función de
umbral la media de todas las importancias, Ecuación (2): activación tansig utilizada en la capa oculta. Este escalamiento
p se realizó exclusivamente sobre los datos del conjunto de
1X entrenamiento, extrayendo los valores mı́nimos y máximos
Umbral = Imp(xj ) (2)
p j=1 de cada variable. Posteriormente, los mismos parámetros se
aplicaron a los conjuntos de validación y prueba, garantizando
donde p es el número total de variables predictoras. Solo se consistencia en la escala sin comprometer la independencia
conservaron aquellas cuya importancia fue igual o superior a de los conjuntos. Es decir, si en los conjuntos de validación
este umbral. o prueba existı́an valores fuera del rango observado en el
Posteriormente, sobre las variables retenidas, se calculó la entrenamiento, estos quedaban fuera del intervalo [–1, 1], lo
matriz de correlación absoluta [4]. Para cada par de variables que podı́a provocar cierta pérdida de información.
con coeficiente de correlación mayor a 0.90, se eliminó la
de menor importancia relativa según el modelo de Random II-B. Entrenamiento del modelo
Forest. Este paso asegura que el subconjunto final esté libre de El modelo empleado fue una red neuronal feedforward
redundancias y conserve únicamente las variables con mayor con una sola capa oculta de 3 neuronas, implementada en
valor predictivo único [5]. MATLAB mediante la función feedforwardnet, siguiendo la
Finalmente, las variables seleccionadas se almacenaron en el arquitectura clásica conocida como MLP [5].
conjunto, y se utilizó la matriz correspondiente como entrada Se seleccionó el algoritmo de entrenamiento Bayesian Re-
para la red neuronal MLP. La contribución individual de gularization (trainbr) como alternativa robusta al método tradi-
cada variable puede visualizarse en la gráfica de barras de cional Levenberg–Marquardt, ya que ofrece mayor resistencia
importancias OOB, junto con la lı́nea del umbral definido al sobreajuste [7]. Esta función incorpora internamente un
(véase Fig. 1 y Cuadro I). término de regularización que penaliza la magnitud de los
pesos durante la optimización, reduciendo ası́ la complejidad
del modelo y mitigando el sobreajuste sin necesidad de un
conjunto de validación explı́cito [7]. Este enfoque es espe-
cialmente útil en conjuntos de datos ruidosos o de tamaño
limitado.
La capa oculta emplea la función de activación no lineal
tansig, y una capa de salida con función lineal purelin, combi-
naciones recomendadas para problemas de regresión continua.
El entrenamiento se limitó a un máximo de 1000 épocas,
criterio suficiente para observar convergencia en este tipo de
redes.
Figura 1. Importancia OOB de las variables predictoras y umbral de selección.
Dado que trainbr no distingue entre entrenamiento y vali-
dación interna, todos los datos proporcionados son utilizados
durante la optimización. Por ello, la partición de los datos se
Cuadro I
I MPORTANCIA OOB DE LAS VARIABLES PREDICTORAS . definió manualmente con divideind, combinando los ı́ndices
originalmente destinados a entrenamiento y validación en un
Variable Importancia OOB
único conjunto de ajuste, mientras que el conjunto de prueba
PT08.S2 (NMHC) 1.7415
PT08.S1 (CO) 0.5217 quedó reservado exclusivamente para la evaluación final. Esta
PT08.S5 (O3) 0.7591 estrategia asegura una estimación imparcial del desempeño del
CO(GT) 0.4049 modelo sobre datos no vistos durante el entrenamiento [8].
PT08.S4 (NO2) 0.8138
PT08.S3 (NOx) 0.6977 II-C. Evaluación del modelo
NOx (GT) 0.7308
NMHC (GT) 0.5738 Una vez entrenado el modelo, el modelo fue evaluado
NO2 (GT) 0.7332 sobre el conjunto de prueba previamente normalizado. Las
predicciones obtenidas fueron luego desnormalizadas mediante
la operación inversa de mapminmax, permitiendo ası́ comparar
directamente los resultados del modelo con las concentracio-
nes reales de benceno.
III. R ESULTADOS Y D ISCUSIONES
Durante la fase de entrenamiento, se monitoreó la evolución
del error utilizando el error cuadrático medio (MSE), el cual
mostró una disminución progresiva hasta alcanzar la conver-
gencia. La Fig. 2 presenta la evolución del MSE por época, Figura 4. Diagrama de dispersión: valores reales vs. predichos.
mientras que la Fig. 3 detalla el estado del entrenamiento,
incluyendo el gradiente final de 7.3742e-06, el parámetro de
Para cuantificar el desempeño del modelo en la estima-
adaptación µ y una ausencia de fallos consecutivos en la
ción de concentraciones de benceno, se emplearon métricas
validación. Estos parámetros permiten verificar la estabilidad
recomendadas en la literatura: MSE, raı́z del MSE (RMSE),
del aprendizaje y el uso adecuado de validación temprana para
error absoluto medio (MAE), coeficiente de correlación de
prevenir sobreajuste.
Pearson (r) y coeficiente de determinación (R²). Los resultados
Además, se evaluó la relación entre los resultados del
promedios y sus desviaciones estándar del conjunto de prueba
modelo y los valores reales durante el entrenamiento. La Fig.
se presentan en el Cuadro II.
4 muestra el coeficiente de correlación obtenido cercano a uno,
evidenciando el ajuste entre las predicciones del modelo y los
Cuadro II
datos reales. D ESEMPE ÑO PROMEDIO DEL MODELO MLP SOBRE EL CONJUNTO DE
PRUEBA (20 REPETICIONES )
Métrica Desempeño
MSE (µg/m³) 0.0013 ± 0.0007
RMSE (µg/m³) 0.0352 ± 0.0086
MAE (µg/m³) 0.0263 ± 0.0013
Correlación (r) 1.0000 ± 0.0000
R² 1.0000 ± 0.0000
El MAE promedio fue inferior a 0.03 µg/m³, lo cual implica
que, en promedio, el modelo comete errores mı́nimos y con-
sistentes en sus predicciones. Esta métrica es particularmente
útil por su interpretación directa en las mismas unidades del
problema. La cercanı́a entre el MAE y el RMSE sugiere una
Figura 2. Evolución del MSE durante el entrenamiento. ausencia de errores extremos, lo cual indica una predicción ro-
busta incluso ante posibles atı́picos. Los valores casi perfectos
de r y R² muestran una correlación lineal excepcional entre
los valores reales y los predichos, ası́ como una capacidad del
modelo para explicar prácticamente toda la variabilidad de las
mediciones del analizador de referencia.
El análisis del error absoluto se presenta en la Fig. 5. En el
90 % de las muestras del conjunto de prueba, el error absoluto
fue menor a 0.02 µg/m³, confirmando la estabilidad del modelo
incluso en escenarios extremos.
Figura 3. Parámetros del estado del entrenamiento.
El modelo MLP fue evaluado a lo largo de 20 repeticiones
independientes con diferentes particiones de validación y Figura 5. Histograma del error absoluto entre valores reales y resultados del
prueba, manteniendo fija la secuencia cronológica del conjunto modelo.
de entrenamiento.
IV. C ONCLUSIONES
Los resultados muestran que el modelo MLP logró una
alta concordancia entre las predicciones y las concentraciones
reales de benceno, con valores promedio de R² y correlación
cercanos a 1. La baja magnitud del error absoluto medio
(MAE menor a 0.03 µg/m³) y del error cuadrático medio
(MSE aproximadamente 0.0013 µg/m³²) indica una capacidad
del modelo para generar estimaciones cercanas a los valores
de referencia.
Además, la distribución acumulada del error absoluto reveló
que en el 90 % de las muestras el error fue menor a 0.2 µg/m³,
lo que sugiere un comportamiento predecible y estable. El
análisis gráfico refuerza estas observaciones, mostrando coin-
cidencia visual entre las series temporales reales y predichas.
En conjunto, los resultados respaldan el uso del modelo
como herramienta para la estimación cuantitativa de benceno
a partir de señales sensoriales, con bajo margen de error y alta
capacidad de ajuste, incluso bajo variaciones propias de datos
ambientales.
R EFERENCIAS
[1] S. De Vito, E. Massera, M. Piga, L. Martinotto y G. Di Francia, “On
field calibration of an electronic nose for benzene estimation in an urban
pollution monitoring scenario,” Sensors and Actuators B: Chemical, vol.
129, no. 2, pp. 750–757, 2008, doi: 10.1016/[Link].2007.09.060.
[2] S. Haykin, Neural Networks: A Comprehensive Foundation, 2nd ed.
Upper Saddle River, NJ, USA: Prentice Hall, 1998.
[3] L. Breiman, “Random forests,” Machine Learning, vol. 45, no. 1, pp.
5–32, 2001, doi: 10.1023/A:1010933404324.
[4] A. Liaw and M. Wiener, “Classification and regression by randomFo-
rest,” R News, vol. 2, no. 3, pp. 18–22, 2002.
[5] T. Altmann, A. Toloşi, O. Sander and T. Lengauer, “Permutation impor-
tance: a corrected feature importance measure,” Bioinformatics, vol. 26,
no. 10, pp. 1340–1347, 2010, doi: 10.1093/bioinformatics/btq134.
[6] G. Chandrashekar and F. Sahin, “A survey on feature selection methods,”
Computers Electrical Engineering, vol. 40, no. 1, pp. 16–28, 2014, doi:
10.1016/[Link].2013.11.024.
[7] D. J. C. MacKay, “Bayesian interpolation,” Neural Computation, vol. 4,
no. 3, pp. 415–447, 1992, doi: 10.1162/neco.1992.4.3.415.
[8] F. D. Foresee and M. T. Hagan, “Gauss–Newton approximation to
Bayesian regularization,” in Proc. Int. Joint Conf. Neural Networks
(IJCNN), 1997, pp. 1930–1935, doi: 10.1109/IJCNN.1997.614194.
[9] C. M. Bishop, Neural Networks for Pattern Recognition. Oxford Uni-
versity Press, 1995.