0% encontró este documento útil (0 votos)
2 vistas49 páginas

Procesamiento de Imágenes No Estructuradas

El documento analiza el procesamiento de datos no estructurados, específicamente imágenes, y su importancia en diversas aplicaciones como la salud, la ingeniería y la seguridad. Se discuten conceptos clave como la representación digital de imágenes, el preprocesamiento, la detección de bordes y el feature engineering visual, que son esenciales para extraer información significativa de las imágenes. Además, se presentan técnicas y algoritmos utilizados para mejorar la calidad de las imágenes y facilitar su análisis mediante modelos de aprendizaje automático.

Cargado por

carlos.vergara1
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas49 páginas

Procesamiento de Imágenes No Estructuradas

El documento analiza el procesamiento de datos no estructurados, específicamente imágenes, y su importancia en diversas aplicaciones como la salud, la ingeniería y la seguridad. Se discuten conceptos clave como la representación digital de imágenes, el preprocesamiento, la detección de bordes y el feature engineering visual, que son esenciales para extraer información significativa de las imágenes. Además, se presentan técnicas y algoritmos utilizados para mejorar la calidad de las imágenes y facilitar su análisis mediante modelos de aprendizaje automático.

Cargado por

carlos.vergara1
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Análisis de Datos no

Estructurados
Universidad Tecnológica de Pereira
Especialización en Analítica y Ciencia de Datos Aplicada

Beatriz Martínez González, PhD


Julian David Echeverry Correa, PhD
GIADSc – Grupo de Investigación en Análisis de Datos y Sociología Computacional
Introducción
Las imágenes como dato no estructurado
¿Qué significa que una imagen sea un dato no
estructurado?
• Las imágenes se consideran datos no estructurados porque no presentan
una organización explícita en columnas, atributos o categorías. En lugar de
contener variables semánticamente definidas, cada imagen es una matriz
o tensor de valores numéricos que solo representan intensidades de luz o
niveles de color.

• La semántica —contornos, objetos, relaciones


espaciales— no viene dada: debe ser
descubierta mediante algoritmos de
procesamiento y modelos de aprendizaje
automático.
3
¿Qué significa que una imagen sea un dato no
estructurado?
Aunque la imagen tiene patrones visuales evidentes para
un humano, estos patrones no están explícitamente
modelados en los datos.

El computador solo observa valores numéricos vecinos


entre sí. La extracción de significado —bordes, texturas,
objetos— requiere algoritmos capaces de capturar
dependencias espaciales locales y globales, desde filtros
clásicos hasta redes convolucionales modernas.

4
¿Por qué procesar imágenes?
Aplicaciones en salud:
En medicina, el procesamiento de imágenes permite apoyar diagnósticos mediante análisis de radiografías, tomografías, resonancias y
dermatoscopia. Técnicas modernas permiten resaltar estructuras anatómicas, medir volúmenes, detectar anomalías y asistir modelos de
inteligencia artificial en la identificación temprana de patologías.

Aplicaciones en sistemas de energía:


En ingeniería eléctrica, las imágenes se emplean para inspección de líneas de transmisión, monitoreo de transformadores, análisis
termográfico y detección temprana de fallas.

Aplicaciones en industria y comercio:


En el sector comercial, las imágenes permiten automatizar procesos como reconocimiento de productos, lectura de códigos, inventario
inteligente y OCR para facturas y documentos.

Aplicaciones en seguridad:
La seguridad física y electrónica se apoya cada vez más en sistemas de procesamiento de imágenes: análisis de cámaras, detección de
intrusos, reconocimiento facial, conteo de personas y sistemas de control de acceso.

5
Consejo de estudio
Recomiendo seguir esta clase con los ejemplos de los cuadernos

<notebook_ADNE_imagenes_01.ipynb>

6
Parte I
Representación digital
**Así describe la IA de Perplexity lo que es un tensor**
Un tensor no es más que un contenedor matemático de números organizado en varias dimensiones.
Aquí tienes la explicación visual:

Imagen digital = Tensor


* Tensor 0D (Escalar): Imagina un solo punto. Es un solo número que representa el valor de un píxel.
* Tensor 1D (Vector): Imagina una fila de esos puntos. Es una lista de números.
* Tensor 2D (Matriz): Imagina una hoja de cálculo o una cuadrícula. Esto es una foto en blanco y negro (escala de grises),
donde tienes altura y anchura.
* Tensor 3D (Cubo): Aquí es donde entra el color. Imagina que apilas 3 hojas de cálculo una encima de otra: una para el
color Rojo, otra para el Verde y otra para el Azul (RGB). Ese "bloque" de datos que contiene altura, anchura y profundidad
de color es un tensor 3D.

En su forma más general, una imagen digital puede modelarse como un


tensor:

• Escala de grises: 𝐼 ∈ ℝ𝐻×𝑊

• Color RGB: 𝐼 ∈ ℝ𝐻×𝑊×3

Algunas imágenes multiespectrales o médicas: 𝐼 ∈ ℝ𝐻×𝑊×𝐶 , con 𝐶


canales adicionales.

Esta representación algebraica permite aplicar operaciones lineales,


convoluciones, transformaciones espaciales y modelos neuronales.

8
Profundidad de bits e Histograma
La profundidad de bits determina cuántos niveles de intensidad puede representar cada píxel:
8 bits → 256 niveles (imágenes estándar).
12–16 bits → imágenes médicas o científicas con mayor rango dinámico.
32 bits flotantes → aplicaciones de precisión, imágenes HDR.
Una mayor profundidad mejora la capacidad para capturar diferencias sutiles de intensidad, especialmente en
contextos técnicos.

El histograma de una imagen


describe la distribución de Imagen generada con el código del módulo 1-b
intensidades en los píxeles.
Proporciona una visión global del contraste, la iluminación y la saturación de la imagen.
Es una herramienta esencial para detectar problemas como subexposición, sobreexposición y bajo contraste, además
de ser base para técnicas de realce como la ecualización.

9
Profundidad de bits e Histograma
Imágenes generadas con el código del módulo 3-b

10
Espacios de color y formatos
Diferentes espacios de color representan la información cromática de manera distinta:
• RGB: espacio aditivo basado en luz; adecuado para visualización.
• HSV (Hue, Saturation, Value): separa tono y brillo; útil para segmentación por color.
• Lab: diseñado para aproximar la percepción humana; favorece operaciones de realce y análisis de color robusto.
La elección del espacio de color depende del problema a resolver.

Los formatos de imagen definen su estructura


interna, tipo de compresión y fidelidad:
• JPEG: compresión con pérdida; ideal para
fotografía y tamaños reducidos.
• PNG: compresión sin pérdida; conserva detalles,
útil para análisis técnico.
• TIFF: soporta alta profundidad de bits y múltiples
canales; estándar en aplicaciones médicas,
Imagen generada con el código del módulo 2-b
científicas y GIS.
• BMP: sin compresión; adecuado para operaciones donde se requiere máxima fidelidad.
La elección del formato afecta tanto la calidad del análisis como el almacenamiento y transmisión.

11
Parte II
Preprocesamiento y realce
Importancia del preprocesamiento
Antes de extraer características o entrenar modelos, es necesario “limpiar” y estandarizar la imagen.
El preprocesamiento busca reducir ruido, corregir problemas de iluminación y mejorar el contraste, de manera que la
información relevante sea más fácil de detectar.
Un buen preprocesamiento no añade información nueva, pero sí hace más explícita la estructura ya presente en la
imagen.

Ruido en las imágenes


El ruido en imágenes puede producirse por
sensores, transmisión o condiciones de
iluminación. Entre los modelos más usados en
análisis están:
Ruido gaussiano: variaciones suaves alrededor del valor
real de la intensidad.
Ruido sal y pimienta: píxeles aislados que toman valores
muy altos o muy bajos.
Ruido Poisson: típico en sistemas de conteo de fotones
(imágenes médicas).
Ruido Speckle: ruido multiplicativo que aparece como un
patrón granular en imágenes
Identificar el tipo de ruido guía la elección del filtro
adecuado. 13
Imágenes generadas con el código del módulo 4-b
Filtros en imágenes
El concepto de máscara (o kernel)
Filtros lineales: suavizado y reducción de ruido
Los filtros lineales reemplazan cada píxel por una combinación ponderada de sus vecinos, según un kernel.
• Filtro de media: promedia las intensidades locales; reduce ruido, pero también difumina bordes.
• Filtro gaussiano: aplica una ponderación según una distribución normal; suaviza preservando mejor la estructura
global.
Son útiles cuando el ruido es relativamente suave y no dominante.

Filtros no lineales: preservación de bordes


Los filtros no lineales pueden eliminar ruido sin difuminar tanto los bordes:
• Filtro de mediana: sustituye cada píxel por la mediana de sus vecinos; muy eficaz contra el ruido sal y pimienta.
• Filtros bilaterales: combinan proximidad espacial y similitud de intensidad para suavizar regiones homogéneas y
mantener bordes definidos.
Son especialmente importantes cuando el ruido afecta píxeles aislados o cuando se requiere preservar contornos.
14
Filtros en
imágenes

15
Imágenes generadas con el código del módulo 4
Realce de contraste
Ecualización de histograma

La ecualización de histograma redistribuye las


intensidades para utilizar mejor el rango dinámico
disponible.
• En imágenes con bajo contraste, la ecualización
tiende a expandir las zonas de intensidad más
frecuentes, resaltando detalles que antes eran
poco visibles.
• Es una técnica global: la misma transformación
se aplica a toda la imagen.

La ecualización adaptativa (p. ej., CLAHE) aplica la idea de la ecualización en pequeñas regiones de la
imagen, y limita la amplificación excesiva del contraste.
Es especialmente útil en imágenes médicas o de baja iluminación, donde un realce global puede introducir
artefactos o ruido. CLAHE mejora detalles locales sin saturar el ruido.
16
Realce de Imágenes generadas con el código del módulo 5

contraste
Ecualización de histograma

===============================
MÉTRICAS DE CALIDAD DE IMAGEN
===============================

[Original (Bajo Contraste)]


• Entropía (Ideal ~8.0): 7.4403
• Contraste (Std Dev): 52.27
• Rango Dinámico: 255
------------------------------
[Ecualización Global]
• Entropía (Ideal ~8.0): 7.2470
• Contraste (Std Dev): 73.34
• Rango Dinámico: 255
------------------------------
[Ecualización CLAHE]
• Entropía (Ideal ~8.0): 7.7457
• Contraste (Std Dev): 56.41
• Rango Dinámico: 255
------------------------------

INTERPRETACIÓN:

Entropía más alta: Indica mayor


riqueza de información y mejor
distribución de tonos.

Contraste más alto: Indica mayor


diferencia visual entre claros y
oscuros.

CLAHE suele tener una entropía


ligeramente menor que la Global,
pero visualmente es más natural.

17
Parte III
Feature engineering
¿Qué es el feature engineering visual?
Gradientes de intensidad

El feature engineering visual consiste en transformar una imagen en un conjunto de características


numéricas que capturan patrones relevantes como bordes, texturas, esquinas u orientación.
El objetivo es reducir la alta dimensionalidad de los píxeles crudos y obtener representaciones más
compactas y discriminativas que puedan ser usadas por modelos de clasificación, segmentación u otros
algoritmos de aprendizaje automático.

Gradientes de intensidad
El gradiente de una imagen mide el cambio de intensidad en cada dirección.
A nivel discreto, se aproxima mediante diferencias finitas, por ejemplo, en ejes 𝒙 e 𝒚.
La magnitud del gradiente es alta en regiones donde la intensidad cambia bruscamente, es decir, en
bordes o contornos.
La orientación del gradiente indica la dirección del cambio y es fundamental en descriptores como HOG
(Histogram of Oriented Gradients).

19
¿Qué es el feature engineering visual?
Detección de bordes: Sobel y Canny

La detección de bordes identifica puntos donde la intensidad cambia de forma abrupta, revelando contornos
estructurales fundamentales para la segmentación, el reconocimiento y la interpretación de la escena.
Los detectores clásicos funcionan calculando gradientes locales:

• Sobel: utiliza kernels derivados discretos para estimar los gradientes en 𝑥 e 𝑦.


Produce mapas de bordes suaves y es robusto al ruido leve, pero tiende a generar bordes gruesos.

• Canny: es un detector “óptimo” en el sentido de maximizar la detección verdadera y minimizar respuestas falsas.
Integra:
• Suavizado gaussiano para reducir ruido,
• Gradiente mediante Sobel,
• Supresión de no-máximos para adelgazar bordes,
• Umbralización con histéresis, conectando bordes débiles con bordes fuertes.
El resultado es un mapa de bordes más fino, continuo y estable ante ruido o variaciones de iluminación.

La elección del detector depende del objetivo: Sobel es rápido y útil para análisis preliminar; Canny es más costoso,
pero produce bordes significativamente más limpios.

Histogram of Oriented Gradients explained using OpenCV 20


¿Qué es el feature engineering visual?
Detección de bordes: Sobel y Canny
Imágenes generadas con el código del módulo 6

21
¿Qué es el feature engineering visual?
Puntos de interés (corners, keypoints)

Además de bordes, se buscan puntos de interés (esquinas, vértices, patrones locales distintivos) que sean fáciles de
localizar y robustos a transformaciones.
Detectores clásicos incluyen:
• Harris: mide variación de intensidad en vecindarios bidimensionales.
• FAST/ORB: diseñados para ser eficientes y aptos para tiempo real. Detectan esquinas comparando intensidades en
un patrón circular.
Estos puntos sirven como anclas para registro de imágenes, seguimiento y emparejamiento entre vistas.

Imágenes generadas con el código del módulo 7

Un keypoint es una posición en la imagen donde existe una variación significativa de intensidad en dos o más direcciones.
Eso significa:
• NO es una región plana (poca variación)
• NO es un borde (variación en una sola dirección)
• SÍ es una esquina, vértice, borde curvo fuerte, o cualquier estructura distintiva
En términos matemáticos: 22
un keypoint es un punto donde la matriz de estructura (o la respuesta de un detector) tiene autovalores grandes en dos direcciones.
¿Qué es el feature engineering visual?
Descriptores SIFT: Scale-Invariant Feature Transform
ORB: Oriented FAST and Rotated BRIEF
FAST: Features from Accelerated Segment Test
Descriptor local BRIEF: Binary Robust Independent Elementary Features
Un descriptor local resume el patrón de intensidades en torno a un punto de interés en un vector numérico.
SIFT: calcula histogramas de gradientes orientados en vecindarios; robusto a escala, rotación y cambios moderados de iluminación.
ORB: combina FAST + BRIEF con mejoras, ofreciendo descriptores binarios eficientes y libres de restricciones de patente.
Estos descriptores permiten emparejar puntos entre imágenes diferentes del mismo objeto o escena.
Descriptor global
El descriptor HOG (Histogram of Oriented Gradients) divide la imagen en celdas y, en cada una, acumula histogramas de orientaciones
de gradiente.
Este esquema captura la estructura de bordes y siluetas, siendo especialmente útil para tareas como detección de peatones u objetos.
HOG produce vectores de dimensión moderada, adecuados para clasificadores lineales o SVM.

23
Imágenes generadas con el código del módulo 7-b
¿Qué es el feature engineering visual?
Descriptores

Descriptor de textura
LBP (Local Binary Patterns) codifica la textura local comparando cada píxel con sus vecinos en un patrón binario.
El resultado se resume en histogramas de patrones frecuentes, útiles para caracterizar superficies y texturas (piel, materiales,
tejidos).
LBP es sencillo, computacionalmente eficiente y se ha utilizado extensamente en reconocimiento facial clásico y análisis de texturas.
Imágenes generadas con el código del módulo 7-c

24
Modelos basados en embeddings
Pasar una imagen por un modelo de embeddings consiste en transformarla desde su representación cruda en píxeles
hacia un vector de características generado por una red convolucional preentrenada.

Este vector captura patrones de alto nivel —texturas, formas, contornos, objetos— que la red ha aprendido a partir de
grandes bases de datos (p. ej., ImageNet).

El embedding permite representar imágenes de manera compacta, discriminativa y apta para modelos clásicos (SVM,
kNN, clustering, regresión).

¿Por qué usar redes convolucionales en embeddings?


Las CNN preentrenadas actúan como extractores universales de características. Aprovechan conocimiento aprendido en millones de
imágenes, lo que permite:
• Reducir dimensionalidad drásticamente.
• Obtener representaciones robustas a iluminación, pose, escalas y ruido.
• Evitar entrenar modelos desde cero (costoso y lento).
Los embeddings resultantes son útiles para clasificación, búsqueda por similitud, detección y análisis exploratorio.

25
Modelos basados en embeddings
Una CNN procesa la imagen mediante
capas convolucionales que extraen
patrones cada vez más complejos:
• Capas iniciales: detectan bordes y
texturas finas.
• Capas medias: combinan patrones
locales en formas y partes de
objetos.
• Capas profundas: representan
conceptos abstractos de alto nivel.
El embedding se obtiene tomando las
activaciones de una capa interna
(previa a la clasificación final),
capturando así la esencia visual más
discriminativa.

26
Modelos basados en embeddings
• Dependiendo del modelo de embedding con el que se trabaje la representación de las
imágenes puede tener distintas dimensiones resultantes.

Esta imagen representa una imagen de 227x227

Ejemplo de salida usando el modelo Inception V3 (salida de 2048 dimensiones)

27
Parte IV
Representaciones avanzadas en imágenes
Bag of Visual Words (BoVW)
Bolsa de palabras visuales

La técnica Bag of Visual Words (BoVW) representa una imagen como un histograma de “palabras visuales”
aprendidas a partir de descriptores locales.

La idea central es análoga al modelo de bolsa de palabras que veíamos en procesamiento de textos: así como un
documento se resume por la frecuencia de palabras, una imagen se resume por la frecuencia de patrones visuales
recurrentes detectados en regiones locales.

El pipeline típico de BoVW incluye tres etapas:


• Extracción de descriptores locales (SIFT, ORB, HOG por celdas).
• Agrupamiento mediante k-means para construir un diccionario de palabras visuales.
• Vectorización: cada imagen se transforma en un histograma que cuenta cuántos descriptores caen en cada palabra
visual.
Esta representación convierte imágenes complejas en un vector de dimensión fija, apto para clasificadores
tradicionales como SVM.

29
Bag of Visual Words (BoVW)
¿Qué es una palabra visual?

Una palabra visual es un centroide en el espacio de descriptores locales, obtenido por agrupamiento.
Cada centroide representa un patrón visual recurrente: esquinas, texturas, partes de objetos, bordes
característicos.
Una buena selección de palabras visuales genera representaciones compactas y discriminativas.

Para construir el diccionario:


• Se colectan miles de descriptores locales de un conjunto de imágenes.
• Se ejecuta k-means para obtener k clústeres.
Cada clúster corresponde a una palabra visual. El tamaño del diccionario (k) controla el
nivel de detalle:
valores pequeños → abstracciones generales;
valores grandes → patrones más específicos.

Para convertir una imagen en un vector:


• Se extraen sus descriptores locales.
• Cada descriptor se asigna a la palabra visual más cercana (clasificación por
proximidad al centroide).
• Se genera un histograma de frecuencias de tamaño k.
Este histograma es el embedding BoVW: una representación fija, interpretable y
eficiente.
30
Redes Neuronales Convolucionales
CNN
Las redes neuronales convolucionales (CNN) son una evolución fundamental de las redes neuronales para procesar datos con
estructura espacial, como imágenes o señales bidimensionales. A diferencia del perceptrón multicapa, donde todas las
neuronas están conectadas entre sí, las CNN usan conexiones locales mediante filtros o núcleos convolucionales, que detectan
patrones en regiones específicas manteniendo la estructura del dato.

Esta forma de conexión reduce drásticamente el número de parámetros, lo que mejora la eficiencia y el rendimiento del
entrenamiento. Además, las CNN aprovechan la invarianza traslacional de los datos visuales: un mismo patrón puede aparecer
en distintas partes de una imagen, y los filtros lo reconocerán sin redefinirlo cada vez.

La CNN aprende representaciones jerárquicas: desde bordes y texturas hasta partes y objetos completos. Permiten también
extraer embeddings de alto nivel que capturan información semántica difícil de obtener con métodos manuales.

Las CNN incorporan tres principios clave:


Localidad: cada filtro observa solo una pequeña región de la imagen.
Compartición de pesos: el mismo filtro se aplica en toda la imagen, reduciendo parámetros.
Composicionalidad: capas profundas combinan patrones simples en representaciones abstractas.

Estos principios permiten aprender características robustas y eficientes a gran escala.


Redes Neuronales Convolucionales
CNN

Una CNN combina tres componentes principales:


• Capa convolucional, que aplica los filtros.
• Función de activación (como ReLU), que introduce no linealidad.
• Capa de pooling, que reduce la dimensionalidad manteniendo la información esencial.

Tras varias etapas de extracción, los


mapas de características se aplanan y se
conectan a capas densas para generar la
salida final. Gracias a esta arquitectura,
las CNN se han convertido en el modelo
estándar para tareas de visión por
computadora, clasificación de imágenes,
detección de objetos y reconocimiento
facial.
Redes Neuronales Convolucionales
CNN

Una CNN entrenada para


reconocer números manuscritos.

Veamos los ejemplos del módulo


8 del cuaderno de python

Imágenes generadas con el código del módulo 8


Redes Neuronales Convolucionales
Transfer Learning

El transfer learning permite reutilizar CNNs entrenadas en grandes datasets:

• Se carga una red preentrenada (p. ej., ResNet50).


• Se elimina la capa final de clasificación.
• Las activaciones de la última capa convolucional se usan como embedding.

Esto permite trabajar con datasets pequeños y lograr alta precisión sin entrenar desde cero.

Veamos los ejemplos del módulo 9 del cuaderno de python

Imágenes generadas con el código del módulo 9


Parte V
OCR – Optical Character Recognition
Reconocimiento Óptico de Caracteres
¿Qué es el OCR?
El OCR (Optical Character Recognition) es el proceso mediante el cual una imagen que contiene texto —impreso,
manuscrito o digitalizado— se transforma en texto editable.
El objetivo es convertir información visual en datos estructurados, permitiendo búsquedas, minería de texto,
indexación automática y análisis documental.

Un sistema de OCR moderno puede verse como un pipeline


mixto de visión y lenguaje:

✓ Detección de regiones de texto en la imagen (localizar


dónde hay texto).
✓ Segmentación de líneas, palabras o caracteres según el
modelo.
✓ Reconocimiento: convertir los patrones visuales en
secuencias de símbolos (letras, dígitos, signos).
✓ Postprocesamiento lingüístico: corrección ortográfica,
normalización, uso de modelos de lenguaje para
desambiguar.
¿Qué es el OCR?
OCR tradicional vs OCR basado en
deep learning
OCR clásico:
✓ Basado en segmentación explícita y templates.
✓ Sensible al ruido, distorsiones y variaciones de tipografía.

OCR moderno (DL):


✓ Usa CNNs + RNN/Transformers para reconocimiento secuencial.
✓ No requiere segmentar letra por letra.
✓ Maneja mejor imágenes complejas, fuentes variadas y textos en contexto.
✓ Ejemplos actuales: Tesseract 4+, EasyOCR, PaddleOCR.
Preprocesamiento
para el OCR
OCR en el contexto de análisis de
datos no estructurados

En aplicaciones reales, el OCR rara vez es el fin del proceso: es el primer paso de una cadena de análisis
de datos no estructurados.

A partir del texto obtenido se pueden aplicar técnicas de PLN para extraer entidades nombradas
(nombres de pacientes, productos, direcciones), clasificar documentos (tipos de factura, informes
médicos), o alimentar sistemas de búsqueda y analítica.

Desde esta perspectiva, el diseño de un sistema de OCR debe considerar no solo la precisión de
carácter, sino también su integración con el pipeline de análisis textual posterior.
OCR en el contexto de análisis de
datos no estructurados
Ejemplos de reconocimiento de texto libre.
Ejemplo montado en el módulo 10 del notebook de python
Imágenes generadas con el código del módulo 10-c
Parte VI
Segmentación semántica
Segmentación semántica
La segmentación semántica asigna a cada píxel de una imagen una etiqueta de clase,
produciendo un mapa de categorías a nivel de píxel (fondo, carretera, peatón, tejido sano, tumor,
etc.).
A diferencia de la clasificación global, que responde “qué hay en la imagen”, la segmentación
semántica responde también “dónde está” cada objeto o región, permitiendo un análisis fino de
la escena y una cuantificación precisa de áreas y estructuras.

En procesamiento de imágenes se debe distinguir entre varios niveles de segmentación:


• Segmentación binaria: separar objeto vs fondo ([Link]. célula vs fondo).
• Segmentación semántica: varios objetos de la misma clase comparten una única etiqueta
(todas las carreteras → “carretera”).
• Segmentación de instancias: diferencia instancias individuales de una misma clase (coche 1,
coche 2, coche 3).
La segmentación semántica se centra en el tipo de región, no en la identidad específica de cada
objeto.
Segmentación semántica
Como problema de clasificación

Desde un punto de vista de modelado, la segmentación semántica puede verse como un problema de
clasificación multiclase por píxel.

Cada píxel (i , j) recibe una distribución de probabilidad sobre las clases 𝑪, y el modelo predice la clase
con máxima probabilidad.

Las CNN modernas implementan


esta idea mediante
arquitecturas totalmente
convolucionales que producen
mapas de salida de tamaño
similar a la imagen de entrada.
Segmentación semántica
Como problema de clasificación

La segmentación semántica es una herramienta central en:


• Salud: delimitación de tumores, órganos, lesiones en resonancias, TAC,
dermatoscopia.
• Energía y mantenimiento: detección de corrosión, vegetación invasiva, daño en
líneas o estructuras a partir de imágenes de drones.
• Transporte y robótica: percepción para vehículos autónomos (carretera, peatones,
señales).
• Documentos e imágenes técnicas: separación de texto, tablas, diagramas y fondos.

Estas máscaras permiten medir áreas, volúmenes y localizaciones con precisión,


abriendo la puerta a análisis cuantitativos automatizados.

En la práctica, la segmentación semántica enfrenta varios retos:


• Etiquetado costoso: las máscaras píxel a píxel requieren mucho esfuerzo experto.
• Clases desbalanceadas: regiones pequeñas pero críticas (lesiones, defectos) pueden
ser minoritarias.
• Variabilidad de imagen: cambios de iluminación, sensores, protocolos de
adquisición.
• Generalización: modelos entrenados en un hospital, ciudad o infraestructura
pueden no transferir bien a otros contextos.
Segmentación semántica
Como problema de clasificación
Taller 2 Componente IMÁGENES
Componente AUDIO Cada grupo debe escoger un mini-conjunto de imágenes y
plantear un problema sencillo de extracción de
Utilicen audios cortos de distintos tipos (distintas voces, distintos información.
instrumentos, sonidos de distintos animales).
Apliquen filtros, ecualización de histograma y extraigan
• Desarrollen un pipeline completo de preprocesamiento de descriptores de las imágenes.
audio y extracción de características.
Determinen si hay diferencias (visuales, estadísticas,
• Hallen los principales descriptores de los audios. analíticas) entre los descriptores de estas imágenes.
• Determinen si hay diferencias (visuales, estadísticas,
analíticas) entre estos audios.

Monten un sistema de reconocimiento automático de habla y


calculen el WER de ese sistema con tres frases de prueba (frases
cualesquiera propuestas por ustedes).
Recursos
Recursos de Aprendizaje
Libros
- Gonzalez & Woods — Digital Image Processing
- Richard Szeliski — Computer Vision: Algorithms and Applications
- Goodfellow et al. — Deep Learning
Datasets Recomendados - Adrian Rosebrock — Deep Learning for Computer Vision (PyImageSearch)

MNIST / Fashion-MNIST (link) Documentación Online


CIFAR-10 / CIFAR-100 (link) OpenCV Documentation [Link]
ImageNet (link) Keras / TensorFlow Vision Guides [Link]
COCO (Common Objects in Context) (link) PyTorch torchvision [Link]
Cityscapes (link) Papers With Code — Vision Tasks [Link]

Papers Clave
Krizhevsky et al., 2012 — AlexNet
He et al., 2015 — ResNet
Ronneberger et al., 2015 — U-Net
Long et al., 2015 — Fully Convolutional Networks for Semantic Segmentation (FCN)
Análisis de Datos no
Estructurados
Universidad Tecnológica de Pereira
Especialización en Analítica y Ciencia de Datos Aplicada

Beatriz Martínez González, PhD


Julian David Echeverry Correa, PhD
GIADSc – Grupo de Investigación en Análisis de Datos y Sociología Computacional

También podría gustarte