Introducción a
Python
Data science: Python para análisis de datos e Inteligencia artificial
Docente: Luis Miguel Gamo López
¿Qué es Python?
• Python es uno de los lenguajes de programación más populares del
mundo.
• Se utiliza en todo, desde el aprendizaje automático hasta la construcción
de sitios web, y se utiliza por desarrolladores como no desarrolladores.
• El nombre de Python viene de Monty Python.
• Cuando Guido van Rossum estaba creando Python, también leía los guiones de
Monty Python's Flying Circus de la BBC.
• Pensó que el nombre Python era apropiadamente corto y ligeramente misterioso.
Características de Pyhton
• Lenguaje interpretado: no se debe compilar el código antes de su ejecución.
• El código Python se ejecuta más lento que el código compilado (C++, Java..)
• Si es necesaria mucha rapidez de proceso es necesario un lenguaje de bajo nivel como C/C++
• Multiparadigma:
• Es un lenguaje imperativo (C, Fortan…) y orientado a objetos(C++, C#, Java…),
• También posee características de los lenguajes funcionales (SQL, R,…)
• Multiplataforma: disponible en los principales Sistemas Operativos (Windows, Linux y Mac).
• Tipado dinámico: no hay que definir el tipo de los datos, es inferido en tiempo de ejecución.
Librerías de Pyhton: los orígenes
NumPy (Numerical Python)
• Es el pilar fundamental de todo el ecosistema numérico en Python.
• Proporciona un objeto de tipo array multidimensional (ndarray) que permite el almacenamiento de
datos homogéneos.
• Proporciona funciones y métodos para operar eficientemente con este objeto: escritura y lectura de
datos, operaciones de álgebra lineal, números aleatorios, funciones financieras, etc.
• Pensado para conjuntos de datos de tamaño fijo
• No optimizado para datos heterogéneos (números, texto, fechas)
Librerías de Pyhton: tratamiento de datos
Pandas (PANel DAtaSet)
• Se trata de una librería construida sobre el array multidimensional de NumPy.
• Proporciona estructuras de datos de alto nivel y optimizada para análisis de datos, como el DataFrame, que supera las
limitaciones de los arrays de Numpy a la hora de aplicar etiquetas a los datos, gestionar valores inexistentes…
• Se trata de una estructura que permite el almacenamiento de datos que en su origen se representan de forma tabular
(por ejemplo: hojas de cálculo o tablas SQL).
• Incorpora herramientas para leer y escribir datos en diversos formatos: CSV, texto, Excel, bases de datos SQL,
documentos XML y JSON, ...
• Está integrada con otras librerías, como por ejemplo matplotlib, usada para la representación de los datos de forma
gráfica
Librerías de Pyhton: visualización
Matplotlib
• Biblioteca básica de visualización de datos en Python
• Compatible con múltiples formatos de gráficos: líneas, barras, cajas, dispersión…
• Personalización de estilos y elementos visuales que permite crear gráficos atractivos y
profesionales.
• Su integración con otras bibliotecas de Python, como NumPy y Pandas, facilita la
manipulación y análisis de datos.
• El módulo Pyplot contiene la mayoría de las utilidades de Matplotlib
Librerías de Pyhton: Machine Learning
Scikit-learn (se verá en el Modulo 3)
• Biblioteca básica de aprendizaje automático en Python
• Proporciona implementaciones sencillas de muchos algoritmos supervisados y no
supervisados:
• Clasificación, regresión, agrupación (clustering) y reducción de dimensionalidad
• Interfaz de programación estandarizada, que facilita:
• la implementación de modelos
• su integración con otras bibliotecas científicas de Python como NumPy, Pandas, Matplotlib…
Muchas gracias
campus@[Link]
[Link]