0% encontró este documento útil (0 votos)
6 vistas20 páginas

Análisis de Datos de Accidentes de Tráfico

El documento describe el uso de bibliotecas como Pandas, Seaborn y sklearn para la manipulación y análisis de datos, así como la evaluación de modelos de regresión en un conjunto de datos de accidentes de tráfico. Se presentan estadísticas clave de las columnas del DataFrame, destacando la severidad de los accidentes y las condiciones climáticas. Además, se menciona la importancia de dividir los datos en conjuntos de entrenamiento y prueba, así como la ingeniería de características y la evaluación del modelo.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
6 vistas20 páginas

Análisis de Datos de Accidentes de Tráfico

El documento describe el uso de bibliotecas como Pandas, Seaborn y sklearn para la manipulación y análisis de datos, así como la evaluación de modelos de regresión en un conjunto de datos de accidentes de tráfico. Se presentan estadísticas clave de las columnas del DataFrame, destacando la severidad de los accidentes y las condiciones climáticas. Además, se menciona la importancia de dividir los datos en conjuntos de entrenamiento y prueba, así como la ingeniería de características y la evaluación del modelo.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

 Pandas (pd): Biblioteca esencial para la manipulación y análisis

de datos en estructuras tipo DataFrame.


 Seaborn (sns) y Matplotlib (plt): Bibliotecas de visualización
de datos que permiten crear gráficos y representaciones
visuales.
 sklearn.model_selection: Importa funciones para dividir
conjuntos de datos y evaluar modelos.
 [Link]: Incluye escaladores y codificadores
de etiquetas para preparar los datos.
 Modelos de regresión: Se importan varios modelos de
regresión
como LinearRegression, DecisionTreeRegressor, RandomForestR
egressor, y GradientBoostingRegressor.
 Métricas: Se importan funciones para evaluar la precisión del
modelo, como mean_squared_error y r2_score.
RESULTADO: Este análisis proporciona una visión general de las
estructuras y tipos de datos en el conjunto de datos de accidentes de
tráfico. Identificar columnas con valores nulos esenciales es
fundamental para preparar los datos antes de realizar análisis o
modelado.

Resultados Explicados
El resultado del método describe() proporciona diversas estadísticas
para las columnas numéricas del DataFrame. Aquí están las
estadísticas explicadas:

Estadísticas Clave
1. count: Número de observaciones no nulas en cada columna.

o Por ejemplo, count para Severity, Start_Lat, etc.,


muestra que hay 10,000 entradas para estas columnas.
o Para columnas como Visibility(mi) y Wind_Speed(mph),
el conteo es menor (9904 y 8226, respectivamente),
indicando que hay valores nulos.

2. mean: Promedio de los valores en la columna.

o Por ejemplo, el mean de Severity es 2.39, lo que indica


que en promedio, la severidad de los accidentes es leve a
moderada.
3. std: Desviación estándar, que mide la variación o dispersión de
los valores en la columna.

o std de Temperature(F) es 17.36, lo que sugiere que las


temperaturas tienen una amplia variabilidad.
4. min: Valor mínimo en la columna.

o Por ejemplo, los accidentes ocurrieron con una severidad


mínima de 1 (que puede ser el menos severo).
5. 25%, 50%, 75% (percentiles): Estas cifras indican los
cuartiles de los datos.

o 25% significa que el 25% de los datos está por debajo de


este valor (por ejemplo, para Severity, el 25% de las
observaciones tienen severidad ≤ 2).
o 50% es la mediana, y 75% significa que el 75% de los datos
está por debajo de este valor.

6. max: Valor máximo en la columna.

o Por ejemplo, Distance(mi) tiene un máximo de 24.04


millas.

Análisis de Resultados

Columnas Destacadas:

 Severity:

o Rango de severidad de 1 a 4, con un promedio de 2.39.


 Temperature(F):

o Rango de temperaturas entre 8°F y 106°F. El promedio es


de 59.6°F.
 Wind Chill(F):
o Promedio de 33.1°F con un máximo de 66°F. Indica que
algunas condiciones climáticas son bastante frías.
 Visibility(mi):

o Promedio de 8.91 millas, aunque hay un máximo de 80


millas. Esto sugiere que la visibilidad puede variar
significativamente.
 Wind Speed(mph):

o Promedio de 8.87 mph con un máximo de 33.4 mph.


 Precipitation(in):

o Los valores oscilan desde 0 a 0.49 pulgadas, con un


promedio muy bajo, lo que podría sugerir pocas
precipitaciones en los días de accidente registrados.

El resumen estadístico proporciona una comprensión


clara de las propiedades de los datos, las
distribuciones, y las variaciones en diferentes
variables.
GRAFICO DE # Contar accidentes por 'Day' (día o noche)
4. ⚠️Dividir datos en entrenamiento
(train) y prueba (test) ⚠️
Resumen
Este bloque de código prepara los datos para que sean más
adecuados para el aprendizaje automático. Principalmente, divide los
datos en conjuntos de entrenamiento y prueba, y aplica un escalado a
las características numéricas para facilitar el entrenamiento del
modelo. El escalado ayuda a que algunos algoritmos, como la
regresión lineal, funcionen mejor.

INGENIERIA DE CARACTERISTICAS
ENTRENAR DIFERENTES MODELOS
7. Evaluación del modelo - métricas
de rendimiento
8. Escoger el mejor modelo usando las
métricas de rendimiento
9. Interpretando el modelo

También podría gustarte