Reconocimiento de
Formas y Visión por
Computadora
Juan Humberto SOSSA AZUELA
E-mail: hsossa@[Link] and humbertosossa@[Link]
Contenido:
1. Comparación entre el sistema visual humano y el sistema
visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos como uno de
los problemas más importantes en visión por
computadora y también uno de los más difíciles de
resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Comparación entre
el sistema visual
humano y el
sistema visual de
una máquina
Cable
Los conos y los bastones son un tipo especial de neurona
que recibe y procesa información proveniente del mundo.
Son una extensión del cerebro.
Conos = 6 a 7millones.
Bastones = 75 a 100
millones.
Alrededor de 300 mil conos trasmiten su
información en forma directa al cerebro.
Otros 700 mil hilos combinan la
información de todos los bastones y el
resto de los conos.
¡El grosor del BUS de transmisión del
ojo al cerebro es de 1 millón de hilos!
Sensibilidad de los
conos y los bastones al
color:
Geometría de una retina típica y una retina biológica:
Proyección dentro Proyección fuera
Proyección dentro
Contenido:
1. Comparación entre el sistema visual humano y el sistema
visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes,
análisis de imágenes, visión por computadora,
reconocimiento de formas, comprensión de imágenes
y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de los
problemas más importantes en visión por computadora y
también uno de los más difíciles de resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Diferencias entre:
-tratamiento digital de imágenes,
-análisis de imágenes,
-visión por computadora,
-reconocimiento de formas,
-comprensión de imágenes,
-fotogrametría.
Tratamiento digital de imágenes:
𝒇 𝒙, 𝒚 − 𝒈(𝒙, 𝒚), una imagen.
Análisis digital de imágenes:
𝒈 𝒙, 𝒚 − 𝒔 𝒙, 𝒚 , descripción simbólica de la imagen.
Visión por computadora o visión artificial:
𝒇 𝒙, 𝒚 −parámetros de posición y movimiento.
Reconocimiento de patrones:
𝒇 𝒙, 𝒚 −detecciones, clases de pertenencia.
Comprensión o entendimiento de imágenes:
𝒇 𝒙, 𝒚 −descripciones de alto nivel dicha imagen.
Fotogrametría:
𝒇 𝒙, 𝒚 −mediciones de dimensiones, tamaños.
Cono de tratamiento y Detecciones,
análisis digital de una reconocimientos
imagen Interpretaciones
Operaciones
Alto nivel de alto nivel
Descripciones 𝒔
Análisis
𝑻(𝒈) digital de una
imagen
Imagen 𝒈
Tratamiento
𝑻(𝒇) digital de una
imagen
Imagen Píxeles
Bajo nivel
Tratamiento digital de Análisis digital de
imágenes. imágenes.
Visión por
computadora o visión Reconocimiento
artificial. de patrones.
Comprensión o
entendimiento de Fotogrametría.
imágenes.
Contenido:
1. Comparación entre el sistema visual humano y el sistema
visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de los
problemas más importantes en visión por computadora y
también uno de los más difíciles de resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Paradigmas para
el tratamiento
digital de
imágenes
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Adquisición de
imagen
Entrada
Gonzalez and Woods
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Pre-
procesamiento
Adquisición de
imagen
Entrada
Gonzalez and Woods
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Segmentación
Pre-
procesamiento
Adquisición de
imagen
Entrada
Gonzalez and Woods
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Segmentación Extracción de
rasgos
Pre-
procesamiento
Adquisición de
imagen
Entrada
Gonzalez and Woods
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Segmentación Extracción de
rasgos
Pre-
procesamiento Descripción
Adquisición de
imagen
Entrada
Gonzalez and Woods
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Segmentación Extracción de
rasgos
Pre-
procesamiento Descripción
Adquisición de
imagen Reconocimiento
Entrada Salida
Gonzalez and Woods
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Segmentación Extracción de
rasgos
Pre-
procesamiento Descripción
BASE DE
CONOCIMIENTO
Adquisición de
imagen Reconocimiento
Para un problema dado
se requiere de una base
Entrada de conocimiento Salida
Gonzalez and Woods
OTRO PARADIGMA
Imagen
Componentes de un sistema
Pre
procesador para el reconocimiento de
objetos:
Segmentador
Este paradigma es útil
para problemas que
Detector
de rasgos involucran muchas clases
rasgos
de objetos
Objetos Clase
Formador candidatos Verificación del objeto
de hipótesis de hipótesis 1000 clases – 10 clases
(reduce el espacio de búsqueda)
Banco Verificar si son estas 10
de modelos
Contenido:
1. Comparación entre el sistema visual humano y el sistema
visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de
los problemas más importantes en visión por
computadora y también uno de los más difíciles de
resolver.
5. Fundamentos.
6. Complejidad de una imagen.
El problema del
reconocimiento
de objetos:
El reconocimiento de objetos
Puede ser visto como el proceso que consiste en
asignar etiquetas a objetos sobre la base de
modelos conocidos de estos objetos.
EL PROBLEMA DEL
RECONOCIMIENTO DE OBJETOS
De manera formal: dada una imagen que contiene uno o más objetos de
interés (y el fondo de la imagen) y un conjunto de etiquetas, una para
cada modelo conocido por el sistema, el sistema debería asignar
etiquetas correctas a regiones, o a conjuntos de regiones en la imagen.
¿ 𝐂ó𝐦𝐨 𝐬𝐞 𝐫𝐞𝐚𝐥𝐢𝐳𝐚 𝐝𝐢𝐜𝐡𝐚 𝐚𝐬𝐢𝐠𝐧𝐚𝐜𝐢ó𝐧?
El problema del
reconocimiento de objetos
como uno de los problemas
más importantes en visión
por computadora y también
uno de los más difíciles de
resolver
Contenido:
1. Comparación entre el sistema visual humano y el sistema
visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de los
problemas más importantes en visión por computadora y
también uno de los más difíciles de resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Fundamentos
FUNDAMENTOS
IMAGEN DIGITAL E IMAGEN BINARIA
1 2 3 4 5 6 𝑓(𝑥, 𝑦) 1 2 3 4 5 6
1 1 0 1 3 1 2 4
2 2 1 2 5 2 0 3
3 3 2 2 6 4 5 2
4 4 4 6 3 3 3 2
5 5 0 3 0 2 7 4
6 6 1 2 4 5 6 7
1 2 3 4 5 6 𝑏(𝑥, 𝑦) 1 2 3 4 5 6
1 0 1 3 1 2 4 1 0 0 0 0 0 1
2 1 2 5 2 0 3 2 0 0 1 0 0 0
3 2 2 6 4 5 2 3 0 0 1 1 1 0
4 4 6 3 3 3 2 4 1 1 0 0 0 0
5 0 3 0 2 7 4 5 0 0 0 0 1 1
6 1 2 4 5 6 7 6 0 0 1 1 1 1
FUNDAMENTOS
AL IGUAL QUE UNA SEÑAL COTÍNUA PUEDE SER
DIGITALIZADA PARA OBTENER UNA SEÑAL DIGITAL, UNA
IMAGEN DIGITAL PUEDE SER OBTENIDA MEDIANTE UN
PROCESO DE DIGITALIZACIÓN:
UNO DE DISCRETIZACIÓN
DIGITALIZACIÓN
UNO DE CUANTIZACIÓN
EL PROCESO DE DIGITALIZACIÓN
Una señal continua 𝑥(𝑡) puede ser muestreada mediante un
tren de impulsos o función comb:
es el periodo de muestreo.
tasa de muestreo o frecuencia de muestreo.
El proceso de muestreo viene dado por:
es el tren de pulsos modulado por la señal 𝑥(𝑡).
En una dimensión:
En dos dimensiones:
EL PROCESO DE ADQUISICIÓN
CÁMARA
IMAGEN
EL PROCESO DE DIGITALIZACIÓN
IMAGEN IMAGEN DIGITAL
PIXEL
ESCALA DE GRISES
Efecto de la resolución:
(a) Una imagen monocromática. (b) versión muestreada de
(a) a 3232 muestras, y (c) versión muestreada de (a) a
1616 muestras.
Efectos del cambio de resolución y de niveles de
cuantización
La calidad de una imagen para una aplicación
dada viene dada por el nivel de resolución o
discretización de la imagen y el nivel de
cuantización:
Nivel de
cuantización Alto consumo
de memoria y de
cómputo
¿Para un problema
dado, qué niveles de
resolución y
cuantización usar?
Nivel de
resolución
DOS IMÁGENES DIGITALES Y SUS CORRESPONDIENTES
IMÁGENES BINARIAS
Se preservó la
forma de los
objetos
Se perdió la
forma de los
objetos
4-VECINOS Y 8-VECINOS DE UN PÍXEL
4-VECINOS Y 8-VECINOS DE UN PÍXEL
4-VECINOS Y 8-VECINOS DE UN PÍXEL
1 2 3 4 5 6
1 0 1 3 1 2 4
2 1 2 5 2 0 3
3 2 2 6 4 5 2
4 4 6 3 3 3 2
5 0 3 0 2 7 4
6 1 2 4 5 6 7
1 2 3 4 5 6 1 2 3 4 5 6
1 0 1 3 1 2 4 1 0 1 3 1 2 4
2 1 2 5 2 0 3 2 1 2 5 2 0 3
3 2 2 6 4 5 2 3 2 2 6 4 5 2
4 4 6 3 3 3 2 4 4 6 3 3 3 2
5 0 3 0 2 7 4 5 0 3 0 2 7 4
6 1 2 4 5 6 7 6 1 2 4 5 6 7
CONECTIVIDAD
CAMINOS ENTRE PÍXELES
X X
REGIONES CONECTADAS
¿Cuántas regiones 8-
conexas observa?
Respuesta: 1
¿Cuántas regiones 4-
conexas ve?
Respuesta: 3
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
Suponga primero el caso 4-conectado:
1 2 3 4 5 6 7 8
1 0 0 0 0 0 0 0 0
2 0 1 1 1 0 0 0 0
3 0 1 1 1 0 0 1 0
4 0 1 0 1 0 0 1 0
5 0 0 0 0 1 1 0 0
6 0 0 0 0 1 1 1 0
7 0 0 0 0 1 1 0 0
8 0 0 0 0 0 0 0 0
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
Considerar las siguiente máscaras:
1 0 1 1 1 0
# ,# ,#
0 0 1 0 0 1
1 2 3 4 5 6 7 8
1 0 0 0 0 0 0 0 0
2 0 1 1 1 0 0 0 0
3 0 1 1 1 0 0 1 0
4 0 1 0 1 0 0 1 0
5 0 0 0 0 1 1 0 0
6 0 0 0 0 1 1 1 0
7 0 0 0 0 1 1 0 0
8 0 0 0 0 0 0 0 0
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
Considerar las siguiente máscaras:
1 0 1 1 1 0
# ,# ,#
0 0 1 0 0 1
1 2 3 4 5 6 7 8
1 0 0 0 0 0 0 0 0
2 0 1 1 1 0 0 0 0
3 0 1 1 1 0 0 1 0
4 0 1 0 1 0 0 1 0
5 0 0 0 0 1 1 0 0
6 0 0 0 0 1 1 1 0
7 0 0 0 0 1 1 0 0
8 0 0 0 0 0 0 0 0
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
Considerar las siguiente máscaras:
1 0 1 1 1 0
# ,# ,#
0 0 1 0 0 1
0 0 0 0 0 0 0 0 1 0 1 1 1 0
𝑁𝑂 = # −# +#
0 0 1 0 0 1
0 1 1 1 0 0 0 0
0 1 1 1 0 0 1 0 =4−2+1=3
0 1 0 1 0 0 1 0
0 0 0 0 1 1 0 0
Esta ecuación siempre funciona para
0 0 0 0 1 1 1 0 objetos 4-conectados sin huecos.
0 0 0 0 1 1 0 0
¿Qué forma toma la misma ecuación
0 0 0 0 0 0 0 0
para el caso 8-conectado?
C1=C2=C3=0;
For i=1 to n-1
For j=1 to m-1
If hay coincidencia entre los píxeles de la m1
y los valores de la imagen then C1=C1+1;
If hay coincidencia entre los píxeles de la m2
y los valores de la imagen then C2=C2+1;
If hay coincidencia entre los píxeles de la m3
y los valores de la imagen then C3=C3+1;
}
}
NO=C1-C2+C3;
bit-quads:
0 0 0
0
, , 0 0 , 0 0 ,…, 1 1 .
0 0 0 1 1 0 1 1 1 1
0 0 0 0 0 0 0 0
0 1 1 0 0 0 0 0
0 1 0 0 0 0 1 0
0 0 0 0 0 1 1 0
0 0 0 0 0 0 0 0
0 1 1 1 0 1 1 0
0 0 0 0 0 1 0 0
0 0 0 0 0 0 0 0
1 0 1 1 1 0
𝑁𝑂 = # −# +#
0 0 1 0 0 1
=6−2+0=4
REGIONES SIMPLEMENTE Y MÚLTIPLEMENTE
CONECTADAS
¿Cómo se puede determinar el número de huecos de
una región 4(8) conectada?
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
0 1 1 1 0 0 0 0 0 1 1 1 1 1 0 0
0 1 1 1 0 0 1 0 0 1 1 1 0 1 1 0
0 1 0 1 0 1 1 0 0 1 0 1 0 1 1 0
0 0 0 1 1 1 0 0 0 1 0 1 1 1 0 0
0 0 0 0 1 1 1 0 0 1 0 0 1 1 1 0
0 0 0 0 1 1 0 0 0 1 1 1 1 1 0 0
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
0 huecos 2 huecos
¿Cómo determinar si una región es simplemente o
múltiplemente conectada?
¿Cómo se puede determinar el número de huecos de
una región 4(8) conectada?
1 0 1 1 1 0
𝑁𝐻 = 1 − # −# +#
0 0 1 0 0 1
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
0 1 1 1 0 0 0 0 0 1 1 1 1 1 0 0
0 1 1 1 0 0 1 0 0 1 1 1 0 1 1 0
0 1 0 1 0 1 1 0 0 1 0 1 0 1 1 0
0 0 0 1 1 1 0 0 0 1 0 1 1 1 0 0
0 0 0 0 1 1 1 0 0 1 0 0 1 1 1 0
0 0 0 0 1 1 0 0 0 1 1 1 1 1 0 0
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
Simplemente conectada Múltiplemente conectada
𝑁𝐻 = 1 − 4 − 3 = 0 𝑁𝐻 = 1 − 3 − 4 = 2
¿Cómo se puede determinar si una región 4(8)
conectada es simplemente conectada o múltiplemente
conectada?
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
0 1 1 1 0 0 0 0 0 1 1 1 1 1 0 0
0 1 1 1 0 0 1 0 0 1 1 1 0 1 1 0
0 1 0 1 0 1 1 0 0 1 0 1 0 1 1 0
0 0 0 1 1 1 0 0 0 1 0 1 1 1 0 0
0 0 0 0 1 1 1 0 0 1 0 0 1 1 1 0
0 0 0 0 1 1 0 0 0 1 1 1 1 1 0 0
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
Simplemente conectada Múltiplemente conectada
CONTORNO DE UNA REGIÓN
HISTOGRAMA DE UNA IMAGEN
ℎ 𝑟1 + ⋯ + ℎ 𝑟𝐿−1 = 1.0
HISTOGRAMA DE UNA IMAGEN
Ejemplo: 𝐿 = 8
30
0 0 0 0 0 0 0 0
0 1 1 1 1 1 1 0
0 1 3 3 3 3 1 0 20
0 1 5 7 7 6 1 0
0 2 5 7 7 6 2 0
0 2 4 4 4 4 2 0
10
0 2 2 2 2 2 2 0
0 0 0 0 0 0 0 0
0 1 2 3 4 5 6 7
La suma de los tamaños de todas las barras es igual a 𝑁
Si el histograma está normalizado, la suma es igual a 1.0
HISTOGRAMA DE UNA IMAGEN
Ecualización de una imagen
Otros ejemplos:
Bajo expuesto Sobre
expuesto
Hecho: Dos imágenes con el mismo histograma no
necesariamente tienen el mismo contenido.
Demostrar esto.
¿Para una imagen dada, cuántas posibles imágenes con el
mismo histograma existen?
Suponga una imagen de 2x2 píxeles como se muestra:
11 10 10
00 10 01…
¡El número de imágenes con un tamaño dado y el mismo
histograma crece combinatorialmente!
Si f1 y f2 son 2 imágenes y h1 y h2 sus histogramas,
entonces aunque h1=h2, no necesariamente f1=f2.
COMPLEJIDAD DE UNA IMAGEN
Se define como el nivel de detalle o intrincación en una
imagen.
Denótese la complejidad de una imagen, 𝐼 como 𝐶(𝐼).
Si se pudiera estimar la complejidad, 𝐶(𝐼), de una imagen,
se podría estimar la similitud entre imágenes.
𝑑 𝐶 𝐼1 − 𝐶 𝐼2 ≤𝜖
Nota: Esta medida general no existe.
Lo más cercano es la complejidad de Kolmogorov.
La complejidad de Kolmogórov es una medida de la
cantidad de recursos computacionales necesarios para
describir una cierta cantidad de información.
La complejidad de Kolmogórov también se denomina
complejidad descriptiva o complejidad de Kolmogoróv-
Chaitin, complejidad estocástica, o entropía algorítmica.
[Link]
Ejemplos:
abababababababababababababababababababababababab
abababababababab
4c1j5b2p0cv4w1x8rx2y39umgw5q85s7traquuxdppa0q7nieie
qe9noc4cvafzf
La primera cadena se forma de 32 veces la palabra ab.
La segunda cadena con tiene una descripción NO sencilla.
function GenerateString1()
return "ab" × 16
function GenerateString2()
return "4c1j5b2p0cv4w1x8rx2y39umgw5q85s7"
La complejidad de una cadena es la longitud de la
descripción más pequeña posible de la cadena para un
lenguaje de descripción universal.
Ejemplos de lenguajes: LISP, PASCAL, JAVA, etc.
SI 𝑃 es un programa que despliega una cadena 𝑠, entonces
𝑃 es una descripción de 𝑠.
La longitud de la descripción es la longitud de 𝑃, como una
cadena de caracteres multiplicada por el número de bits en
un carácter (7 en ASCII).
Si una descripción de 𝑠, 𝑑(𝑠) es de longitud mínima, se llama
descripción mínima de 𝑠.
La longitud de 𝑑(𝑠) en caracteres es la complejidad de
Kolmogorov:
𝐾(𝑠) = |𝑑(𝑠)|.
Teorema. Hay una constante 𝑐 tal que: ∀𝑠 𝐾 𝑠 ≤ 𝑠 + 𝑐.
Teorema. 𝐾 no es una función computable.
Conclusión. Desde este punto de vista, no es posible
calcular la complejidad de una imagen.
Sin embargo:
J. Perkiö and A. Hyvärinen. Modelling image complexity by
independent component analysis, with application to content-
based image retrieval. ICANN '09 Proceedings of the 19th
International Conference on Artificial Neural Networks: Part II
Pages 704 - 714 .
M. Perreira Da Silva, V. Courboulay, P. Estraillieru. IMAGE
COMPLEXITY MEASURE BASED ON VISUAL ATTENTION.
2011 IEEE International Conference on Image Processing.
Solomonoff, Ray (February 4, 1960). A Preliminary Report on
a General Theory of Inductive Inference.
Solomonoff, Ray (March 1964). A Formal Theory of Inductive
Inference Part I". Information and Control. 7 (1): 1–22.
DOI:10.1016/S0019-9958(64)90223-2.
Solomonoff, Ray (June 1964). A Formal Theory of Inductive
Inference Part II. Information and Control. 7 (2): 224–254.
DOI:10.1016/S0019-9958(64)90131-7.
Kolmogorov, A.N. (1965). Three Approaches to the Quantitative Definition
of Information. Problems Inform. Transmission. 1 (1): 1–7.
Chaitin, Gregory J. (1969). On the Simplicity and Speed of Programs for
Computing Infinite Sets of Natural Numbers. Journal of the ACM. 16 (3):
407–422. CiteSeerX [Link].3821. DOI:10.1145/321526.321530.
Kolmogorov, A. (1968). Logical basis for information theory and
probability theory. IEEE Transactions on Information Theory. 14 (5): 662–
664. DOI:10.1109/TIT.1968.1054210.
Li, Ming; Vitányi, Paul (2008). Preliminaries. An Introduction to
Kolmogorov Complexity and its Applications. Texts in Computer Science.
pp. 1–99. DOI:10.1007/978-0-387-49820-1_1. ISBN 978-0-387-33998-6.
Burgin, M. (1982), Generalized Kolmogorov complexity and duality in
theory of computations, Notices of the Russian Academy of Sciences,
v.25, No. 3, pp. 19–23.
Reconocimiento de
Formas y Visión por
Computadora
Juan Humberto SOSSA AZUELA
E-mail: hsossa@[Link] and humbertosossa@[Link]
Contenido:
1. Pretratamiento o acondicionado de una imagen
2. Acondicionado de una imagen
3. Ruido en imágenes
4. Manera de generar ruido en una imagen
5. Filtrado en el dominio de la frecuencia
6 Filtrado en el dominio espacial o de los píxeles
Pretratamiento o
acondicionado de
una imagen
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Segmentación Extracción de
rasgos
g(𝑥, 𝑦)
Pre-
procesamiento Descripción
BASE DE
𝑓(𝑥, 𝑦) CONOCIMIENTO
Adquisición de
imagen Reconocimiento
Entrada Salida
Gonzalez and Woods
PRETRATAMIENTO
ACONDICIONADO DE UNA IMAGEN
ACONDICIONADO DE UNA IMAGEN
PREPROCESAMIENTO: PROCESAR UNA IMAGEN DE
ENTRADA DE TAL FORMA QUE LA NUEVA IMAGEN
TENGA UNA MEJOR APARIENCIA VISUAL O PERMITA A
UN SISTEMA PARA EL RECONOCIMIENTO DE OBJETOS
ENTREGAR MEJORES RESULTADOS.
ACONDICIONADO DE UNA IMAGEN: PROCESAR UNA
IMAGEN DE ENTRADA CON EL OBJETIVO DE QUE LOS
SIGUIENTES MÓDULOS DE UN SISTEMA PARA EL
ANÁLISIS DE IMÁGENES OFREZCAN MEJORES
RESULTADOS.
ACONDICIONADO DE UNA IMAGEN
ACONDICIONADO DE UNA IMAGEN
FILTRADO
RUIDO EN IMÁGENES
f x, y
RUIDO EN IMÁGENES
𝑓ሚ = 𝑓 + 𝑟
RUIDO DE ADQUISICIÓN
Cualquiera de las imágenes la podemos como una variable aleatoria.
La imagen 𝜎 𝑥, 𝑦 debería ser oscura.
Si tomamos todos los valores de intensidad de 𝜎 𝑥, 𝑦 , los elevamos
al cuadrado y los sumamos, obtendremos una valor superior a cero.
RUIDO DE ADQUISICIÓN
Entrecruce de información
OTRAS CAUSAS DEL RUIDO
OTRAS CAUSAS DEL RUIDO
TIPOS DE RUIDO
MANERAS DE GENERAR IMÁGENES CON RUIDO
−1
MANERAS DE GENERAR IMÁGENES CON RUIDO
TIPOS DE RUIDO
TIPOS DE RUIDO
TIPOS DE RUIDO
TIPOS DE RUIDO
Filtrado de una imagen:
En el dominio de la frecuencia.
En el dominio de los píxeles.
Filtrado de el dominio de la frecuencia:
Calcular la transformada de Fourier F(u,v) de f(x,y).
Diseñar filtro G(u,v).
Multiplicar F(u,v) por el filtro G(u,v).
Calcular la transformada de Fourier inversa f*(x,y).
Obtener la parte real f(x,y).
F(u,v) x =
f*(x,y) y parte
real
F(u,v)
Filtrado local de la FFT
Picos de ruido
removidos
Transformada
inversa
Aplicación de la FFT:
Filtrado en el dominio frecuencias: Convolución:
Imagen: 𝐼[𝑚, 𝑛]
Transformada de Fourier: 𝐹[𝑢, 𝑣]
Diseño de filtro: 𝐻[𝑢, 𝑣]
Aplicación de filtro: 𝐻[𝑢, 𝑣] · 𝐹[𝑢, 𝑣]
Transformada de
Fourier inversa: 𝐹𝐹𝑇 −1 {𝐻[𝑢, 𝑣] · 𝐹[𝑢, 𝑣]}
Imagen mejorada: 𝐼’[𝑚, 𝑛]
Reconocimiento de texturas:
Pretratamiento o
acondicionado
de una imagen
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS
Segmentación Extracción de
𝑠 𝑥, 𝑦 rasgos
𝑔 𝑥, 𝑦
Pre-
procesamiento Descripción
BASE DE
𝑓 𝑥, 𝑦 CONOCIMIENTO
Adquisición de
imagen Reconocimiento
Entrada Salida
Gonzalez and Woods
FILTRADO EN EL DOMINIO DE LOS PÍXELES
FILTRADO LINEAL
FILTRADO LINEAL
PRINCIPIO DE
APLICACIÓN DE UNA
MÁSCARA DE
FILTRADO
FILTRADO LINEAL
𝑝1 𝑝2 𝑝3 𝑓1 𝑓2 𝑓3
𝑝4 𝑝5 𝑝6 𝑓4 𝑓5 𝑓6
𝑝7 𝑝8 𝑝9 𝑓7 𝑓8 𝑓9
1 2 1 2 1 5
2 3 2 4 5 3 49
1 2 1 2 3 3
(a) (b) (c)
Pesos de la máscara asociada al operador T. (b) Valores debajo de
esta máscara. (c) Resultado.
0 0 0 0 0
2 1 1 0 2 1 1 0
1 3 1 Padding (rellenado)=1 0 1 3 1 0
1 1 2 0 1 1 2 0
0 0 0 0 0
-1 0 1 0 0 0 0 0
-1 0 1 0 2 1 1 0 −1 × 0 + 0 × 0 + 1 × 0 +
−1 × 0 + 0 × 2 + 1 × 1 +
-1 0 1 0 1 3 1 0
−1 × 0 + 0 × 1 + 1 × 3 = 4
0 1 1 2 0
0 0 0 0 0
Stride (paso)=1
-1 0 1 0 0 0 0 0
-1 0 1 0 2 1 1 0 −1 × 0 + 0 × 0 + 1 × 0 +
−1 × 2 + 0 × 1 + 1 × 1 +
-1 0 1 0 1 3 1 0
−1 × 1 + 0 × 3 + 1 × 1 = −1
0 1 1 2 0
0 0 0 0 0
4 -1 x
x x x
x x x
Filtrado pasa bajas:
Si los valores
de mi mascara
son positivos,
la mascara
estará
ejecutando un
filtrado pasa-
bajo.
En una imagen sería reducir la influencia del ruido
asociado a las altas frecuencias de la señal.
FILTRADO PROMEDIO ARITMÉTICO:
0 0 0 0 0 𝑠 0 0 0 0 0
0 2 1 1 0 1 0 x x X 0
= (2 + 1 + 1 + 1 + 3
0 1 3 1 0 9 0 X 1 X 0
0 1 1 2 0 0 x X x 0
0 0 0 0 0 0 0 0 0 0
FILTRADO PROMEDIO ARITMÉTICO:
0 0 0 0 0 0 0 0 0 0
0 2 1 1 0 1 1 1 0 x x X 0
0 1 3 1 0 ∗ 1 1 1 = 0 X 1 X 0
0 1 1 2 0 1 1 1 0 x x x 0
0 0 0 0 0 0 0 0 0 0
𝑠
1
= (1 × 2 + 1 × 1 + 1 × 5 + 1 × 4 + 1 × 5 + 1 × 3 + 1 × 2 + 1 × 3
9
Efecto de aplicar el filtro
de promediado aritmético
de varios tamaños sobre
una imagen. (a) 3x3, (b)
5x5, (c) 7x7, (d) 9x9, (e)
11x11 y (f) 13x13.
¿Qué notamos?
R: La imagen se va
haciendo más difusa
(desenfocada) conforme
el tamaño de la máscara
crece.
¿A qué equivale en el
dominio de la
frecuencia crecer la
máscara?
Conforme se crece el tamaño de la máscara, es como si la frecuencia
de corte Fc del filtro se moviera hacia la izquierda.
Se deja pasar menos información de alta frecuencia (detalle).
La transformada de Fourier del núcleo promedio aritmético 1-D viene
dada por la parte real de la función SINC.
La transformada de Fourier del núcleo Gaussiano 1-D es otra
Gaussiana
Separabilidad lineal del filtro Gaussiano:
fG G f
h m2 k m2
Gh, k f i h, j k
h m2 k m2
h m2 k m2 h2 k 2
e 2 2
f i h, j k
h m2 k m2
h m2 h2 k m2 k2
2
e 2 2
e 2
f i h, j k
h m2 k m2
Separabilidad lineal del filtro Gaussiano:
Separabilidad lineal del filtro Gaussiano:
Separabilidad lineal del filtro Gaussiano:
Diseño de núcleos Gaussianos:
n n n 2 n n
1 x n
x x x
0 1 2 n
1
1 1
1 2 1
1 3 3 1
1 4 6 4 1 1 4 6 4 1
1 5 10 10 5 1
1 6 15 20 15 6 1
-3 -2 -1 0 1 2 3
-3 0.011 0.039 0.082 0.105 0.082 0.039 0.011
-2 0.039 0.135 0.287 0.368 0.287 0.135 0.039
-1 0.082 0.287 0.606 0.779 0.606 0.287 0.082
0 0.105 0.368 0.779 1.0 0.779 0.368 0.105
1 0.082 0.287 0.606 0.779 0.606 0.287 0.082
2 0.369 0.135 0.387 0.368 0.387 0.135 0.039 h n2 k n2
3 0.011 0.039 0.082 0.105 0.182 0.039 0.011
c Gh, k 1115
h n2 k n2
1 4 7 10 7 4 1 1 4 7 10 7 4 1
4 12 26 33 26 12 4 4 12 26 33 26 12 4
7 26 55 71 55 26 7 2 2 1
7 26 55 71 55 26 7
10 33 71 91 71 33 10 1115 10 33 71 91 71 33 10
7 26 55 71 55 26 7 n7 7 26 55 71 55 26 7
4 12 26 33 26 12 4 4 12 26 33 26 12 4
1 4 7 10 7 4 1 1 4 7 10 7 4 1
(a) Una imagen
contaminada con
ruido Gaussiano. (b)
Imagen filtrada con
un filtro promedio
aritmético. (c)
Imagen filtrada con
núcleo Gaussiano.
OTROS FILTROS LINEALES
FILTRO PROMEDIO ARMÓNICO.
FILTRO PROMEDIO CONTRA-ARMÓNICO.
FILTRO PROMEDIO GEOMÉTRICO.
FILTRO YP.
FILTRO PROMEDIO ARMÓNICO:
n2
f ph
1
x , y V f x, y
0 0 0 0 0
0 2 1 1 0
9
0 1 3 1 0 𝑠=1 1 1 =?
+
2 1 +⋯ 2
0 1 1 2 0
0 0 0 0 0
Efecto de aplicar el filtro
promedio armónico
sobre una imagen
contaminada con
diversos tipos de ruido:
sal y pimienta.
3×3
5×5
FILTRO PROMEDIO CONTRA-ARMÓNICO:
f x, y
R
x , y V
f ca
f x, y
R 1
x , y V
R<0, el filtro elimina ruido tipo sal.
R>0, el filtro elimina ruido tipo pimienta.
Efecto de aplicar el filtro
contra-armónico sobre
una imagen contaminada
ya sea con ruido tipo sal o
tipo pimienta.
FILTRO PROMEDIO GEOMÉTRICO:
f x, y n
1
f pg 2
x , y V
1 1 1
0 0 0 0 0 𝑠= 29 × 19 × ⋯× 29
0 2 1 1 0
0 1 3 1 0 ¿Qué pasa si uno de los valores de intensidad
es “0”?
0 1 1 2 0
0 0 0 0 0 R: 0.
Efecto de aplicar el
filtro promedio
geométrico sobre una
imagen contaminada
con diversos tipos de
ruido.
3×3
5×5
FILTRO Yp :
1
f x, y
p p
f Yp 2
x , y V n
p<0, el filtro remueve ruido tipo sal.
p>0, el filtro remueve ruido tipo pimienta.
Efecto de aplicar el filtro
Yp sobre una imagen
contaminada con
diversos tipos de ruido:
sal y pimienta.
3×3
5×5
Filtros resaltadores:
0 -1 0 1 -2 1
-1 5 -1 -2 5 -2
0 -1 0 1 -2 1
Las máscaras contienen valores positivos, negativos y “0” y además
la suma de los pesos es ligeramente positivo.
Filtros enfatizadores de altas frecuencias ''High-Boost'‘:
f a f fb
fe A f fb A=1, da como resultado la
versión pasa-alto estándar.
fe A f fb
A>1, parte de la información
A 1 f f f b de la imagen original es
A 1 f f a
adicionada a la imagen filtrada
en sus altas frecuencias.
Filtros enfatizadores de altas frecuencias ''High-Boost'‘:
Al deslizar la
mascara, si su suma
-1 -1 -1 es “0” y si los valores
1
9 -1 P -1 en la imagen son
-1 -1 -1 semejantes, entonces,
el resultado tiende a
ser “0”.
P 9 A 1
Si 𝐴 = 1, 𝑃 = 8.
fe A f fb
A 1 f f f b
A 1 f f a
Efecto de
aplicar el
filtro
emfatizador
sobre una
imagen:
A=1.01,
A=1.05,
A=1.1.