0% encontró este documento útil (0 votos)
5 vistas8 páginas

Act 1 Machine Learning

El documento presenta una introducción al aprendizaje automático, describiendo sus dos paradigmas principales: el aprendizaje supervisado, que utiliza datos etiquetados para aprender patrones, y el no supervisado, que busca estructuras en datos no etiquetados. Se discuten aplicaciones prácticas de ambos enfoques en la detección de cáncer, estimación de precios inmobiliarios, detección de fraude, detección de spam y predicción de contaminantes. Finalmente, se comparan métodos y algoritmos utilizados en cada paradigma, resaltando sus fortalezas y limitaciones.

Cargado por

Miguel Cruz
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
5 vistas8 páginas

Act 1 Machine Learning

El documento presenta una introducción al aprendizaje automático, describiendo sus dos paradigmas principales: el aprendizaje supervisado, que utiliza datos etiquetados para aprender patrones, y el no supervisado, que busca estructuras en datos no etiquetados. Se discuten aplicaciones prácticas de ambos enfoques en la detección de cáncer, estimación de precios inmobiliarios, detección de fraude, detección de spam y predicción de contaminantes. Finalmente, se comparan métodos y algoritmos utilizados en cada paradigma, resaltando sus fortalezas y limitaciones.

Cargado por

Miguel Cruz
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Actividad grupal: Técnicas Multivariantes y

Aprendizaje automático
Miguel Angel Cruz Gómez
Emmanuel Alvarez Vences
Equipo 2010 E
5 de diciembre de 2025

1. Introducción
El aprendizaje automático es la rama de la inteligencia artificial que utiliza el marco teóri-
co del aprendizaje estadı́stico para construir un paradigma en donde el sistema inteligente
tiene la capacidad de aprender de la experiencia (es decir, de nuevas instancias de datos).
Existen varios paradigmas del aprendizaje automático; podrı́amos hablar de 2 principales,
el aprendizaje supervisado y no supervisado. Ambos paradigmas tienen el mismo objetivo:
Aprender un patrón en los datos y cuantificar la certidumbre de este.

2. Definición de Aprendizaje Supervisado


Considere el conjunto de datos {xn } tal que para cada instancia de xn existe una etiqueta
yn . Cabe mencionar que tanto xn como yn pueden ser de carácter discreto o continuo (o,
hablando en un contexto más estadı́stico, categórico o numérico).
Ahora considere el conjunto de datos etiquetados formado por n pares D = {xn , yn }.

El aprendizaje supervisado se encarga de aprender el mapeo fθ tal que,

fθ (xn ) = ŷn
donde ŷn es la estimación de la etiqueta yn y θ es, en general, el conjunto de parámetros
que minimizan

θ = argmı́n L(fθ (xn ), yn )


θ

Donde L(·) es, en general, una medida de distancia que, abstractamente, permite esta-
blecer métricas para buscar el mapeo que minimice esta razonable interpretación de error.

1
3. Definición de Aprendizaje No Supervisado
Por otro lado, este paradigma construye una interpretación distinta sobre el conjunto de
datos {xn }, ya que trabaja bajo el supuesto de que xn es una variable aleatoria que proviene
de cierta distribución, y se encarga de aprender la función de densidad gϕ tal que,

xn ∼ gϕ
Donde ϕ es, en general, el conjunto de parámetros que ajustan la función de densidad de
acuerdo a cierta función de similitud, muy similar al caso supervisado, pero con la diferencia
de que esta última interpreta la similitud con la densidad de los datos y no con la distancia
a la señal de respuesta.

4. Casos de aplicación
En lugar de citar 5 situaciones distintas por cada paradigma, en esta sección habaremos de
las mismas 5 situaciones pero desde el punto de vista supervisado y no-supervisado, haciendo
énfasis en las diferencias entre estos y detallando en qué circunstancias se puede usar cada
paradigma.
Los 5 casos de aplicación propuestos para esta sección son:

1. Detección de cáncer

2. Estimación de precios de bienes inmobiliarios

3. Detección de fraude

4. Detección de spam

5. Predicción de concentración de contaminantes

4.1. Aprendizaje supervisado


En aprendizaje supervisado, cada fila contiene caracterı́sticas (X) y una etiqueta (y). A
continuación se muestran ejemplos visuales de cómo lucen los datos para cada caso de uso.

1. Detección de cáncer. [.]

Tamaño lesión Intensidad RGB Textura Diagnóstico


12.3 0.82 0.41 Cáncer
4.7 0.55 0.18 No cáncer
9.1 0.73 0.39 Cáncer

2
2. Estimación de precios inmobiliarios. [.]

Metros 2 Habitaciones Antigüedad Colonia Precio


85 2 10 Centro 1,950,000
130 3 5 Del Valle 3,400,000
60 1 15 Mitras 1,200,000

3. Detección de fraude. [.]

Monto Hora Paı́s Tipo dispositivo Fraude


345.20 02:14 MX Móvil Sı́
58.00 17:32 MX Laptop No
1290.10 03:05 RU Móvil Sı́

4. Detección de spam. [.]

Palabras clave Longitud Dominio remitente Spam


“free, win” 180 [Link] Sı́
“hola, reunión” 95 [Link] No
“prize” 240 [Link] Sı́

3
5. Predicción de concentración de contaminantes. [.]

Temperatura Humedad Viento PM2.5


22.1 48 2.4 35
17.8 61 1.2 48
25.3 55 3.1 28

4.2. Aprendizaje no-supervisado


En aprendizaje no-supervisado no existen etiquetas. Los datos contienen únicamente
caracterı́sticas (X), y el modelo debe descubrir estructura, clústeres o anomalı́as.

1. Detección de cáncer. [.]

Tamaño lesión Intensidad RGB Textura


12.3 0.82 0.41
4.7 0.55 0.18
9.1 0.73 0.39

2. Estimación de precios inmobiliarios. [.]

Metros 2 Habitaciones Antigüedad Colonia


85 2 10 Centro
130 3 5 Del Valle
60 1 15 Mitras

4
3. Detección de fraude. [.]

Monto Hora Paı́s Tipo dispositivo


345.20 02:14 MX Móvil
58.00 17:32 MX Laptop
1290.10 03:05 RU Móvil

4. Detección de spam. [.]

Palabras clave Longitud Dominio remitente


“free, win” 180 [Link]
“hola, reunión” 95 [Link]
“prize” 240 [Link]

5. Predicción de concentración de contaminantes. [.]

Temperatura Humedad Viento


22.1 48 2.4
17.8 61 1.2
25.3 55 3.1

5
5. Métodos y Algoritmos
5.1. Tabla comparativa

Método Paradigma Fortalezas Limitaciones


Regresión Lineal Supervisado Ajusta apropiadamen- Si es por mı́nimos cua-
te las relaciones linea- drados entonces el al-
les goritmo decae en efi-
ciencia para casos con
alta dimensionalidad
Regresión Polinomial Supervisado Ajusta apropiadamen- Si la etiqueta provie-
te las relaciones de or- ne de una fuente lineal
den superior entonces usar métodos
no lineales aumenta la
probabilidad de sobre-
ajuste del modelo.
Árbol de decisión Supervisado Es de los mejores algo- Dependiendo los da-
ritmos para encontrar tos, puede representar
patrones en datos ta- una alta varianza de
bulares acuerdo a la elección
de hiper-parámetros
(profundidad, número
máximo de hijos, etc.)
Agrupamiento por K- No-Supervisado Tiene asegurada su Decae mucho su rendi-
Medias convergencia, fácil de miento para altas di-
implementar mensiones
Inferencia Bayesiana No-Supervisado Es una manera ra- Requiere de una dis-
zonablemente fácil de tribución a priori ; De-
actualizar una distri- cae mucho su rendi-
bucı́on con la obten- miento para altas di-
ción de nueva eviden- mensiones
cia
Estimación de densi- No-Supervisado Converge relativamen- Decae mucho su rendi-
dad de kernel te rápido, fácil de im- miento para altas di-
plementar, no impone mensiones
patrones en los datos

Cuadro 1: Comparativa de métodos de aprendizaje automático

6
6. Conclusión
El aprendizaje automático tiene 2 paradigmas principales: supervisado y no-supervisado.
Es de notar las diferencias en estos enfoques: el supervisado intenta encontrar una relación
entre los datos y una etiqueta, por otro lado, el no-supervisado busca encontrar un patrón en
las caracterı́sticas intrı́nsecas de los datos; el supervisado ajusta una hipótesis sobre un patrón
observado y registrado previamente, mientras que el no supervisado ajusta una distribución y
asume que si muestrea de esta entonces las observaciones que obtenga serán representativas; el
supervisado busca aprender el çomportamiento”de los datos, mientras que el no supervisado
busca aprender ”la fuente”de estos. Ambos métodos son útiles para buscar patrones en los
datos y, según la interpretación de estos, se puede escoger uno u otro.

7
Figura 1: Infografı́a resumen de los conceptos
8

También podría gustarte