Comandos de Python más usados para Limpieza de Datos
1. Inspección de Datos
[Link]() # Muestra las primeras filas del DataFrame
[Link]() # Muestra información del DataFrame y tipos de datos
[Link]() # Muestra estadísticas resumidas de las columnas numéricas
2. Manejo de Datos Faltantes
[Link]().sum() # Cuenta los valores nulos por columna
[Link]() # Elimina filas con valores faltantes
[Link](value) # Reemplaza valores faltantes con un valor especificado
3. Limpieza y Transformación de Datos
df.drop_duplicates() # Elimina filas duplicadas del DataFrame
[Link](columns={'old': 'new'}) # Renombra columnas usando un diccionario
[Link]({'col': 'type'}) # Convierte tipos de datos de columnas
[Link](['old'], ['new']) # Reemplaza valores en el DataFrame
df.reset_index() # Restablece el índice a una secuencia
numérica predeterminada
[Link](['col'], axis=1) # Elimina columnas especificadas
4. Selección y Filtrado de Datos
[Link]['label', 'col'] # Selecciona datos por etiquetas/condiciones
[Link][] # Accede a datos usando posiciones enteras
df[df['col'] > value] # Filtra filas basándose en una condición
5. Agregación y Análisis de Datos
[Link]('col').agg(['mean']) # Agrupa y aplica una función de agregación
df.sort_values('col', ascending=False) # Ordena los datos por valores de columna
df.value_counts() # Cuenta valores únicos en una columna
[Link]() # Aplica una función a filas/columnas
df.pivot_table(values, index, columns) # Crea una tabla dinámica a partir de los
datos
6. Combinación/Fusión de Datos
[Link]([df1, df2]) # Concatena múltiples DataFrames
[Link](df1, df2, on='key') # Fusiona dos DataFrames en una columna clave
[Link](df2) # Une DataFrames en el índice
[Link](df2) # Agrega las filas de df2 a df1
7. Análisis de Series Temporales
Comandos de Python más usados para Limpieza de Datos
df['col'] = pd.to_datetime(df['col']) # Convierte una columna a formato datetime
df.set_index('col', inplace=True) # Establece una columna datetime como índice
[Link]('M').mean() # Re-muestrea los datos por mes y calcula la
media
[Link](1) # Desplaza los datos un período de tiempo
[Link]() # Calcula la diferencia entre filas
consecutivas
8. Visualización
[Link]() # Gráfico de líneas básico del DataFrame
df['col'].hist() # Histograma de una columna
[Link](column='col') # Diagrama de caja de una columna
df['col'].value_counts().plot(kind='bar') # Gráfico de barras de conteo de valores
[Link](x='col1', y='col2') # Diagrama de dispersión entre dos columnas