Machine Learning en Visión y Análisis
de Imágenes por Computador
Integrantes:
● Ccama Ccaña Jimmy Robert
● Romero Diaz Aaron Mariano
● Amaro Aguilar Leonardo Armando
● Osorio Pauca Kevin
● Moncada Vasquez Junior Eric
Reconocimiento y detección de objetos
Es el proceso de localizar y clasificar objetos en
imágenes o videos, tambien la identificación de
objetos y ubicación mediante cajas delimitadas.
Segmentacion de Imágenes
La segmentación de imágenes es una técnica en visión y
análisis de imágenes por computadora. Su objetivo es
dividir una imagen en regiones o segmentos más
pequeños que compartan ciertas características, como
color, textura o intensidad. Estos segmentos pueden
representar objetos completos o partes de objetos
dentro de una imagen.
Aplicando Machine Learning, la segmentación de
imágenes implica entrenar modelos para aprender a
identificar y separar las distintas áreas de interés dentro
de una imagen. Esto se logra mediante algoritmos que
pueden ser supervisados (cuando hay etiquetas que
guían el entrenamiento) o no supervisados (cuando no se
tienen etiquetas).
Tipos de Segmentacion de Imágenes
SEGMENTACIÓN SEMÁNTICA
Cada píxel de una imagen se clasifica
dentro de una categoría. Por ejemplo,
en una imagen de una carretera, se
podría segmentar el cielo, el asfalto, los
vehículos, etc., pero sin distinguir entre
diferentes objetos del mismo tipo (por
ejemplo, dos coches se etiquetan como
"vehículo").
Tipos de Segmentacion de Imágenes
SEGMENTACIÓN POR INSTANCIA
Además de clasificar cada píxel, se
distingue entre diferentes instancias de
los objetos. Por ejemplo, en lugar de
etiquetar todos los coches como
"vehículo", se identifican como "coche 1",
"coche 2", etc.
Tipos de Segmentacion de Imágenes
SEGMENTACIÓN PANÓPTICA
Combina la segmentación semántica
y por instancia, proporcionando una
visión más completa en la que se
identifican tanto las categorías
generales como las instancias
individuales de los objetos.
Algoritmos Comunes
a) YOLO (You Only Look Once):
Detecta objetos en tiempo real, alta
velocidad y eficiencia
b) R-CNN (Region-based CNN):
Alta precisión, más lento que YOLO, útil en
aplicaciones de alta precisión
c) SSD (Single Shot MultiBox Detector):
Combina precisión y eficiencia, similar a
YOLO para detección en tiempo real
Entrenamiento de Modelos de Detección de Objetos
Los modelos se entrenan utilizando grandes
conjuntos de datos etiquetados (por ejemplo,
COCO o PASCAL VOC) que contienen miles
de imágenes con objetos y sus cajas
delimitadoras marcadas. Durante el
entrenamiento, el modelo aprende a
detectar patrones visuales y características
que definen diferentes tipos de objetos.
Aplicaciones
Algoritmos de Reconocimiento Facial (FaceNet)
Descripción: FaceNet detecta rostros en
imágenes y reconoce características faciales
clave (ojos, nariz, boca).
Visual: Un diagrama de un rostro con puntos
faciales marcados y una breve explicación sobre
cómo se utilizan estos puntos para identificar a
las personas.
Aplicación: Seguridad en dispositivos móviles,
control de acceso, sistemas de vigilancia.
Algoritmos de Reconocimiento Facial (FaceNet)
Imagen de prueba
Detección de Caracteres (OCR)
Descripción: OCR (Reconocimiento Óptico
de Caracteres) se usa para extraer texto de
imágenes, como en el análisis de placas
vehiculares.
Visual: Imagen de una placa vehicular con
los caracteres resaltados, mostrando cómo
el sistema OCR extrae los datos.
Aplicación: Gestión de tráfico, control de
acceso, multas automáticas.
Vision en sistemas autonomos
La integración de técnicas avanzadas de
aprendizaje automático para interpretar y
analizar datos visuales, permite a los
sistemas autónomos operar en entornos
dinámicos de manera segura y eficiente.
Estos sistemas se aplican en diversas áreas,
como vehículos autónomos, aprovechando el
poder del procesamiento visual para tomar
decisiones en tiempo real.
Vision en sistemas autonomos
Permite que dispositivos perciban y comprendan su
entorno mediante la interpretación de imágenes y
datos de sensores, habilitando así funciones críticas
como la navegación, detección de obstáculos y toma
de decisiones en tiempo real. Utilizando algoritmos
avanzados de machine learning y visión por
computadora, los sistemas autónomos pueden
reconocer objetos, identificar carreteras, peatones
y señales de tráfico, y adaptarse a cambios en el
entorno
Vision en sistemas autonomos
Algoritmos de aprendizaje automático en vehículos autónomos
Detección de Objetos
YOLO y SSD detección de objetos en tiempo real
permitiendo que los vehículos localicen dichos
Aprendizaje supervisado objetos en su entorno.
fundamental en el desarrollo de sistemas de
Segmentación Semántica de la Escena
percepción y control en vehículos autónomos, ya
DeepLab la segmentación semántica para
que permite a estos sistemas aprender a partir de
clasificar cada píxel de una imagen, mejor
datos etiquetados. En este contexto, los algoritmos
comprensión del entorno
de aprendizaje supervisado aprenden a mapear
entradas (como imágenes, datos de LiDAR o Estimación de Profundidad
información de GPS) a salidas (como detección de MonoDepth aprendizaje supervisado para estimar
objetos, segmentación de escenas o decisiones de la profundidad de la escena a partir de imágenes
maniobra).
Vision en sistemas autonomos
Algoritmos de aprendizaje automático en vehículos autónomos
Agrupación de Características del Entorno
Algoritmo K-means puede usarse para agrupar
diferentes tipos de superficies de carretera (asfalto,
Aprendizaje no supervisado grava, hierba) y obstáculos en imágenes
permite que estos sistemas aprendan patrones
Segmentación Semántica de la Escena
y estructuras en los datos sin requerir etiquetas
Modelos de Mezcla de Gaussianas (GMM) y los algoritmos
explícitas, útil para tareas donde el etiquetado
de clustering espectral permiten segmentar diferentes
manual es costoso o difícil de definir. Este
regiones en una imagen de carretera.
enfoque se utiliza en áreas como la agrupación
de datos, la reducción de dimensionalidad y la Mapeo y Localización en Entornos Desconocidos
detección de anomalías, que son claves para SLAM (Simultaneous Localization and Mapping) emplea
que los vehículos autónomos comprendan técnicas como el clustering para construir mapas 3D
mejor su entorno y se adapten a condiciones
nuevas.
Mejora y Generación de imágenes con GANs
En muchos problemas de clasificación de imágenes podemos encontrarnos ante una dificultad: la escasez de las mismas, es decir, que una
o varias clases se encuentran infrarrepresentadas con respecto al resto.
Como ejemplo de esto, ponemos un caso de estudio probado de clasificación de imágenes de radiografías de pulmón, donde hay que
diagnosticar entre pulmones afectados por neumonía, por COVID-19 o sanos.
Técnicas de generación de imágenes basadas en GAN
Para solventar este problema, proponemos el uso de técnicas de generación de
imágenes basadas en GAN. GAN son las siglas de Generative Adversarial
Networks, una arquitectura de red presentada por Ian j. Goodfellow en 2014, para
generar imágenes sintéticas a partir de un ruido aleatorio. Estas redes son
conocidas por emplearse en la generación de famosos deepfakes.
La arquitectura GAN
La arquitectura GAN está constituida por dos redes neuronales: Generador (G) y
Discriminador (D). D va a ser entrenado para distinguir lo mejor posible entre
imágenes reales e imágenes generadas. Por otro lado, G tratará de generar
imágenes lo más reales posibles para así “engañar” a D. Los resultados finales
serán las imágenes que genera G.