0% encontró este documento útil (0 votos)
101 vistas148 páginas

Reconocimiento de Objetos en Visión Artificial

Este documento discute 1) las diferencias entre el sistema visual humano y el sistema visual de una máquina, 2) las diferencias entre varios conceptos relacionados con el procesamiento de imágenes como tratamiento digital de imágenes, análisis de imágenes, visión por computadora, reconocimiento de formas y comprensión de imágenes, 3) paradigmas comunes para el tratamiento digital de imágenes, y 4) que el reconocimiento de objetos es uno de los problemas más importantes pero también más difíciles de resolver en visión por computadora.

Cargado por

Luis Daniel
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
101 vistas148 páginas

Reconocimiento de Objetos en Visión Artificial

Este documento discute 1) las diferencias entre el sistema visual humano y el sistema visual de una máquina, 2) las diferencias entre varios conceptos relacionados con el procesamiento de imágenes como tratamiento digital de imágenes, análisis de imágenes, visión por computadora, reconocimiento de formas y comprensión de imágenes, 3) paradigmas comunes para el tratamiento digital de imágenes, y 4) que el reconocimiento de objetos es uno de los problemas más importantes pero también más difíciles de resolver en visión por computadora.

Cargado por

Luis Daniel
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Reconocimiento de

Formas y Visión por


Computadora

Juan Humberto SOSSA AZUELA


E-mail: hsossa@[Link] and humbertosossa@[Link]
Contenido:

1. Comparación entre el sistema visual humano y el sistema


visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos como uno de
los problemas más importantes en visión por
computadora y también uno de los más difíciles de
resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Comparación entre
el sistema visual
humano y el
sistema visual de
una máquina
Cable
Los conos y los bastones son un tipo especial de neurona
que recibe y procesa información proveniente del mundo.

Son una extensión del cerebro.


Conos = 6 a 7millones.

Bastones = 75 a 100
millones.
Alrededor de 300 mil conos trasmiten su
información en forma directa al cerebro.

Otros 700 mil hilos combinan la


información de todos los bastones y el
resto de los conos.

¡El grosor del BUS de transmisión del


ojo al cerebro es de 1 millón de hilos!
Sensibilidad de los
conos y los bastones al
color:
Geometría de una retina típica y una retina biológica:

Proyección dentro Proyección fuera

Proyección dentro
Contenido:

1. Comparación entre el sistema visual humano y el sistema


visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes,
análisis de imágenes, visión por computadora,
reconocimiento de formas, comprensión de imágenes
y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de los
problemas más importantes en visión por computadora y
también uno de los más difíciles de resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Diferencias entre:

-tratamiento digital de imágenes,


-análisis de imágenes,
-visión por computadora,
-reconocimiento de formas,
-comprensión de imágenes,
-fotogrametría.
Tratamiento digital de imágenes:

𝒇 𝒙, 𝒚 − 𝒈(𝒙, 𝒚), una imagen.

Análisis digital de imágenes:

𝒈 𝒙, 𝒚 − 𝒔 𝒙, 𝒚 , descripción simbólica de la imagen.

Visión por computadora o visión artificial:

𝒇 𝒙, 𝒚 −parámetros de posición y movimiento.


Reconocimiento de patrones:

𝒇 𝒙, 𝒚 −detecciones, clases de pertenencia.

Comprensión o entendimiento de imágenes:

𝒇 𝒙, 𝒚 −descripciones de alto nivel dicha imagen.

Fotogrametría:

𝒇 𝒙, 𝒚 −mediciones de dimensiones, tamaños.


Cono de tratamiento y Detecciones,
análisis digital de una reconocimientos
imagen Interpretaciones
Operaciones
Alto nivel de alto nivel

Descripciones 𝒔

Análisis
𝑻(𝒈) digital de una
imagen
Imagen 𝒈

Tratamiento
𝑻(𝒇) digital de una
imagen
Imagen Píxeles
Bajo nivel
Tratamiento digital de Análisis digital de
imágenes. imágenes.

Visión por
computadora o visión Reconocimiento
artificial. de patrones.

Comprensión o
entendimiento de Fotogrametría.
imágenes.
Contenido:

1. Comparación entre el sistema visual humano y el sistema


visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de los
problemas más importantes en visión por computadora y
también uno de los más difíciles de resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Paradigmas para
el tratamiento
digital de
imágenes
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Adquisición de
imagen

Entrada

Gonzalez and Woods


UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Pre-
procesamiento

Adquisición de
imagen

Entrada

Gonzalez and Woods


UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Segmentación

Pre-
procesamiento

Adquisición de
imagen

Entrada

Gonzalez and Woods


UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Segmentación Extracción de
rasgos

Pre-
procesamiento

Adquisición de
imagen

Entrada

Gonzalez and Woods


UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Segmentación Extracción de
rasgos

Pre-
procesamiento Descripción

Adquisición de
imagen

Entrada

Gonzalez and Woods


UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Segmentación Extracción de
rasgos

Pre-
procesamiento Descripción

Adquisición de
imagen Reconocimiento

Entrada Salida

Gonzalez and Woods


UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Segmentación Extracción de
rasgos

Pre-
procesamiento Descripción

BASE DE
CONOCIMIENTO

Adquisición de
imagen Reconocimiento

Para un problema dado


se requiere de una base
Entrada de conocimiento Salida

Gonzalez and Woods


OTRO PARADIGMA
Imagen
Componentes de un sistema
Pre
procesador para el reconocimiento de
objetos:

Segmentador

Este paradigma es útil


para problemas que
Detector
de rasgos involucran muchas clases
rasgos
de objetos
Objetos Clase
Formador candidatos Verificación del objeto
de hipótesis de hipótesis 1000 clases – 10 clases
(reduce el espacio de búsqueda)

Banco Verificar si son estas 10


de modelos
Contenido:

1. Comparación entre el sistema visual humano y el sistema


visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de
los problemas más importantes en visión por
computadora y también uno de los más difíciles de
resolver.
5. Fundamentos.
6. Complejidad de una imagen.
El problema del
reconocimiento
de objetos:
El reconocimiento de objetos

Puede ser visto como el proceso que consiste en


asignar etiquetas a objetos sobre la base de
modelos conocidos de estos objetos.
EL PROBLEMA DEL
RECONOCIMIENTO DE OBJETOS

De manera formal: dada una imagen que contiene uno o más objetos de
interés (y el fondo de la imagen) y un conjunto de etiquetas, una para
cada modelo conocido por el sistema, el sistema debería asignar
etiquetas correctas a regiones, o a conjuntos de regiones en la imagen.
¿ 𝐂ó𝐦𝐨 𝐬𝐞 𝐫𝐞𝐚𝐥𝐢𝐳𝐚 𝐝𝐢𝐜𝐡𝐚 𝐚𝐬𝐢𝐠𝐧𝐚𝐜𝐢ó𝐧?
El problema del
reconocimiento de objetos
como uno de los problemas
más importantes en visión
por computadora y también
uno de los más difíciles de
resolver
Contenido:

1. Comparación entre el sistema visual humano y el sistema


visual de una máquina.
2. Diferencias entre tratamiento digital de imágenes, análisis
de imágenes, visión por computadora, reconocimiento de
formas, comprensión de imágenes y fotogrametría.
3. Paradigmas para el tratamiento digital de imágenes.
4. El problema del reconocimiento de objetos es uno de los
problemas más importantes en visión por computadora y
también uno de los más difíciles de resolver.
5. Fundamentos.
6. Complejidad de una imagen.
Fundamentos
FUNDAMENTOS

IMAGEN DIGITAL E IMAGEN BINARIA


1 2 3 4 5 6 𝑓(𝑥, 𝑦) 1 2 3 4 5 6
1 1 0 1 3 1 2 4
2 2 1 2 5 2 0 3
3 3 2 2 6 4 5 2
4 4 4 6 3 3 3 2
5 5 0 3 0 2 7 4
6 6 1 2 4 5 6 7

1 2 3 4 5 6 𝑏(𝑥, 𝑦) 1 2 3 4 5 6
1 0 1 3 1 2 4 1 0 0 0 0 0 1
2 1 2 5 2 0 3 2 0 0 1 0 0 0
3 2 2 6 4 5 2 3 0 0 1 1 1 0
4 4 6 3 3 3 2 4 1 1 0 0 0 0
5 0 3 0 2 7 4 5 0 0 0 0 1 1
6 1 2 4 5 6 7 6 0 0 1 1 1 1
FUNDAMENTOS

AL IGUAL QUE UNA SEÑAL COTÍNUA PUEDE SER


DIGITALIZADA PARA OBTENER UNA SEÑAL DIGITAL, UNA
IMAGEN DIGITAL PUEDE SER OBTENIDA MEDIANTE UN
PROCESO DE DIGITALIZACIÓN:

UNO DE DISCRETIZACIÓN
DIGITALIZACIÓN
UNO DE CUANTIZACIÓN
EL PROCESO DE DIGITALIZACIÓN

Una señal continua 𝑥(𝑡) puede ser muestreada mediante un


tren de impulsos o función comb:

es el periodo de muestreo.
tasa de muestreo o frecuencia de muestreo.
El proceso de muestreo viene dado por:

es el tren de pulsos modulado por la señal 𝑥(𝑡).


En una dimensión:
En dos dimensiones:
EL PROCESO DE ADQUISICIÓN

CÁMARA
IMAGEN
EL PROCESO DE DIGITALIZACIÓN

IMAGEN IMAGEN DIGITAL

PIXEL

ESCALA DE GRISES
Efecto de la resolución:

(a) Una imagen monocromática. (b) versión muestreada de


(a) a 3232 muestras, y (c) versión muestreada de (a) a
1616 muestras.
Efectos del cambio de resolución y de niveles de
cuantización
La calidad de una imagen para una aplicación
dada viene dada por el nivel de resolución o
discretización de la imagen y el nivel de
cuantización:
Nivel de
cuantización Alto consumo
de memoria y de
cómputo

¿Para un problema
dado, qué niveles de
resolución y
cuantización usar?

Nivel de
resolución
DOS IMÁGENES DIGITALES Y SUS CORRESPONDIENTES
IMÁGENES BINARIAS

Se preservó la
forma de los
objetos

Se perdió la
forma de los
objetos
4-VECINOS Y 8-VECINOS DE UN PÍXEL
4-VECINOS Y 8-VECINOS DE UN PÍXEL
4-VECINOS Y 8-VECINOS DE UN PÍXEL
1 2 3 4 5 6
1 0 1 3 1 2 4
2 1 2 5 2 0 3
3 2 2 6 4 5 2
4 4 6 3 3 3 2
5 0 3 0 2 7 4
6 1 2 4 5 6 7

1 2 3 4 5 6 1 2 3 4 5 6
1 0 1 3 1 2 4 1 0 1 3 1 2 4
2 1 2 5 2 0 3 2 1 2 5 2 0 3
3 2 2 6 4 5 2 3 2 2 6 4 5 2
4 4 6 3 3 3 2 4 4 6 3 3 3 2
5 0 3 0 2 7 4 5 0 3 0 2 7 4
6 1 2 4 5 6 7 6 1 2 4 5 6 7
CONECTIVIDAD
CAMINOS ENTRE PÍXELES

X X
REGIONES CONECTADAS

¿Cuántas regiones 8-
conexas observa?
Respuesta: 1

¿Cuántas regiones 4-
conexas ve?
Respuesta: 3
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?

Suponga primero el caso 4-conectado:

1 2 3 4 5 6 7 8
1 0 0 0 0 0 0 0 0
2 0 1 1 1 0 0 0 0
3 0 1 1 1 0 0 1 0
4 0 1 0 1 0 0 1 0
5 0 0 0 0 1 1 0 0
6 0 0 0 0 1 1 1 0
7 0 0 0 0 1 1 0 0
8 0 0 0 0 0 0 0 0
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
Considerar las siguiente máscaras:

1 0 1 1 1 0
# ,# ,#
0 0 1 0 0 1
1 2 3 4 5 6 7 8
1 0 0 0 0 0 0 0 0
2 0 1 1 1 0 0 0 0
3 0 1 1 1 0 0 1 0
4 0 1 0 1 0 0 1 0
5 0 0 0 0 1 1 0 0
6 0 0 0 0 1 1 1 0
7 0 0 0 0 1 1 0 0
8 0 0 0 0 0 0 0 0
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
Considerar las siguiente máscaras:

1 0 1 1 1 0
# ,# ,#
0 0 1 0 0 1
1 2 3 4 5 6 7 8
1 0 0 0 0 0 0 0 0
2 0 1 1 1 0 0 0 0
3 0 1 1 1 0 0 1 0
4 0 1 0 1 0 0 1 0
5 0 0 0 0 1 1 0 0
6 0 0 0 0 1 1 1 0
7 0 0 0 0 1 1 0 0
8 0 0 0 0 0 0 0 0
¿Cómo se puede determinar cuántas regiones 4(8)
conectadas, sin huecos, hay en una imagen?
Considerar las siguiente máscaras:

1 0 1 1 1 0
# ,# ,#
0 0 1 0 0 1

0 0 0 0 0 0 0 0 1 0 1 1 1 0
𝑁𝑂 = # −# +#
0 0 1 0 0 1
0 1 1 1 0 0 0 0
0 1 1 1 0 0 1 0 =4−2+1=3
0 1 0 1 0 0 1 0
0 0 0 0 1 1 0 0
Esta ecuación siempre funciona para
0 0 0 0 1 1 1 0 objetos 4-conectados sin huecos.
0 0 0 0 1 1 0 0
¿Qué forma toma la misma ecuación
0 0 0 0 0 0 0 0
para el caso 8-conectado?
C1=C2=C3=0;
For i=1 to n-1
For j=1 to m-1
If hay coincidencia entre los píxeles de la m1
y los valores de la imagen then C1=C1+1;
If hay coincidencia entre los píxeles de la m2
y los valores de la imagen then C2=C2+1;
If hay coincidencia entre los píxeles de la m3
y los valores de la imagen then C3=C3+1;
}
}
NO=C1-C2+C3;
bit-quads:
0 0 0
0
, , 0 0 , 0 0 ,…, 1 1 .
0 0 0 1 1 0 1 1 1 1
0 0 0 0 0 0 0 0
0 1 1 0 0 0 0 0
0 1 0 0 0 0 1 0
0 0 0 0 0 1 1 0
0 0 0 0 0 0 0 0
0 1 1 1 0 1 1 0
0 0 0 0 0 1 0 0
0 0 0 0 0 0 0 0

1 0 1 1 1 0
𝑁𝑂 = # −# +#
0 0 1 0 0 1

=6−2+0=4
REGIONES SIMPLEMENTE Y MÚLTIPLEMENTE
CONECTADAS
¿Cómo se puede determinar el número de huecos de
una región 4(8) conectada?

0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
0 1 1 1 0 0 0 0 0 1 1 1 1 1 0 0
0 1 1 1 0 0 1 0 0 1 1 1 0 1 1 0
0 1 0 1 0 1 1 0 0 1 0 1 0 1 1 0
0 0 0 1 1 1 0 0 0 1 0 1 1 1 0 0
0 0 0 0 1 1 1 0 0 1 0 0 1 1 1 0
0 0 0 0 1 1 0 0 0 1 1 1 1 1 0 0
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0

0 huecos 2 huecos
¿Cómo determinar si una región es simplemente o
múltiplemente conectada?
¿Cómo se puede determinar el número de huecos de
una región 4(8) conectada?

1 0 1 1 1 0
𝑁𝐻 = 1 − # −# +#
0 0 1 0 0 1
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
0 1 1 1 0 0 0 0 0 1 1 1 1 1 0 0
0 1 1 1 0 0 1 0 0 1 1 1 0 1 1 0
0 1 0 1 0 1 1 0 0 1 0 1 0 1 1 0
0 0 0 1 1 1 0 0 0 1 0 1 1 1 0 0
0 0 0 0 1 1 1 0 0 1 0 0 1 1 1 0
0 0 0 0 1 1 0 0 0 1 1 1 1 1 0 0
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
Simplemente conectada Múltiplemente conectada
𝑁𝐻 = 1 − 4 − 3 = 0 𝑁𝐻 = 1 − 3 − 4 = 2
¿Cómo se puede determinar si una región 4(8)
conectada es simplemente conectada o múltiplemente
conectada?

0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
0 1 1 1 0 0 0 0 0 1 1 1 1 1 0 0
0 1 1 1 0 0 1 0 0 1 1 1 0 1 1 0
0 1 0 1 0 1 1 0 0 1 0 1 0 1 1 0
0 0 0 1 1 1 0 0 0 1 0 1 1 1 0 0
0 0 0 0 1 1 1 0 0 1 0 0 1 1 1 0
0 0 0 0 1 1 0 0 0 1 1 1 1 1 0 0
0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0

Simplemente conectada Múltiplemente conectada


CONTORNO DE UNA REGIÓN
HISTOGRAMA DE UNA IMAGEN

ℎ 𝑟1 + ⋯ + ℎ 𝑟𝐿−1 = 1.0
HISTOGRAMA DE UNA IMAGEN
Ejemplo: 𝐿 = 8

30
0 0 0 0 0 0 0 0
0 1 1 1 1 1 1 0
0 1 3 3 3 3 1 0 20
0 1 5 7 7 6 1 0
0 2 5 7 7 6 2 0
0 2 4 4 4 4 2 0
10
0 2 2 2 2 2 2 0
0 0 0 0 0 0 0 0

0 1 2 3 4 5 6 7

La suma de los tamaños de todas las barras es igual a 𝑁


Si el histograma está normalizado, la suma es igual a 1.0
HISTOGRAMA DE UNA IMAGEN
Ecualización de una imagen
Otros ejemplos:

Bajo expuesto Sobre


expuesto
Hecho: Dos imágenes con el mismo histograma no
necesariamente tienen el mismo contenido.
Demostrar esto.
¿Para una imagen dada, cuántas posibles imágenes con el
mismo histograma existen?
Suponga una imagen de 2x2 píxeles como se muestra:
11 10 10
00 10 01…

¡El número de imágenes con un tamaño dado y el mismo


histograma crece combinatorialmente!
Si f1 y f2 son 2 imágenes y h1 y h2 sus histogramas,
entonces aunque h1=h2, no necesariamente f1=f2.
COMPLEJIDAD DE UNA IMAGEN

Se define como el nivel de detalle o intrincación en una


imagen.
Denótese la complejidad de una imagen, 𝐼 como 𝐶(𝐼).

Si se pudiera estimar la complejidad, 𝐶(𝐼), de una imagen,


se podría estimar la similitud entre imágenes.

𝑑 𝐶 𝐼1 − 𝐶 𝐼2 ≤𝜖

Nota: Esta medida general no existe.

Lo más cercano es la complejidad de Kolmogorov.


La complejidad de Kolmogórov es una medida de la
cantidad de recursos computacionales necesarios para
describir una cierta cantidad de información.

La complejidad de Kolmogórov también se denomina


complejidad descriptiva o complejidad de Kolmogoróv-
Chaitin, complejidad estocástica, o entropía algorítmica.

[Link]
Ejemplos:

abababababababababababababababababababababababab
abababababababab

4c1j5b2p0cv4w1x8rx2y39umgw5q85s7traquuxdppa0q7nieie
qe9noc4cvafzf

La primera cadena se forma de 32 veces la palabra ab.

La segunda cadena con tiene una descripción NO sencilla.

function GenerateString1()
return "ab" × 16

function GenerateString2()
return "4c1j5b2p0cv4w1x8rx2y39umgw5q85s7"
La complejidad de una cadena es la longitud de la
descripción más pequeña posible de la cadena para un
lenguaje de descripción universal.

Ejemplos de lenguajes: LISP, PASCAL, JAVA, etc.

SI 𝑃 es un programa que despliega una cadena 𝑠, entonces


𝑃 es una descripción de 𝑠.

La longitud de la descripción es la longitud de 𝑃, como una


cadena de caracteres multiplicada por el número de bits en
un carácter (7 en ASCII).
Si una descripción de 𝑠, 𝑑(𝑠) es de longitud mínima, se llama
descripción mínima de 𝑠.

La longitud de 𝑑(𝑠) en caracteres es la complejidad de


Kolmogorov:

𝐾(𝑠) = |𝑑(𝑠)|.
Teorema. Hay una constante 𝑐 tal que: ∀𝑠 𝐾 𝑠 ≤ 𝑠 + 𝑐.

Teorema. 𝐾 no es una función computable.

Conclusión. Desde este punto de vista, no es posible


calcular la complejidad de una imagen.

Sin embargo:

J. Perkiö and A. Hyvärinen. Modelling image complexity by


independent component analysis, with application to content-
based image retrieval. ICANN '09 Proceedings of the 19th
International Conference on Artificial Neural Networks: Part II
Pages 704 - 714 .

M. Perreira Da Silva, V. Courboulay, P. Estraillieru. IMAGE


COMPLEXITY MEASURE BASED ON VISUAL ATTENTION.
2011 IEEE International Conference on Image Processing.
Solomonoff, Ray (February 4, 1960). A Preliminary Report on
a General Theory of Inductive Inference.

Solomonoff, Ray (March 1964). A Formal Theory of Inductive


Inference Part I". Information and Control. 7 (1): 1–22.
DOI:10.1016/S0019-9958(64)90223-2.

Solomonoff, Ray (June 1964). A Formal Theory of Inductive


Inference Part II. Information and Control. 7 (2): 224–254.
DOI:10.1016/S0019-9958(64)90131-7.
Kolmogorov, A.N. (1965). Three Approaches to the Quantitative Definition
of Information. Problems Inform. Transmission. 1 (1): 1–7.

Chaitin, Gregory J. (1969). On the Simplicity and Speed of Programs for


Computing Infinite Sets of Natural Numbers. Journal of the ACM. 16 (3):
407–422. CiteSeerX [Link].3821. DOI:10.1145/321526.321530.

Kolmogorov, A. (1968). Logical basis for information theory and


probability theory. IEEE Transactions on Information Theory. 14 (5): 662–
664. DOI:10.1109/TIT.1968.1054210.

Li, Ming; Vitányi, Paul (2008). Preliminaries. An Introduction to


Kolmogorov Complexity and its Applications. Texts in Computer Science.
pp. 1–99. DOI:10.1007/978-0-387-49820-1_1. ISBN 978-0-387-33998-6.

Burgin, M. (1982), Generalized Kolmogorov complexity and duality in


theory of computations, Notices of the Russian Academy of Sciences,
v.25, No. 3, pp. 19–23.
Reconocimiento de
Formas y Visión por
Computadora

Juan Humberto SOSSA AZUELA


E-mail: hsossa@[Link] and humbertosossa@[Link]
Contenido:

1. Pretratamiento o acondicionado de una imagen

2. Acondicionado de una imagen

3. Ruido en imágenes

4. Manera de generar ruido en una imagen

5. Filtrado en el dominio de la frecuencia

6 Filtrado en el dominio espacial o de los píxeles


Pretratamiento o
acondicionado de
una imagen
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Segmentación Extracción de
rasgos

g(𝑥, 𝑦)

Pre-
procesamiento Descripción

BASE DE
𝑓(𝑥, 𝑦) CONOCIMIENTO

Adquisición de
imagen Reconocimiento

Entrada Salida

Gonzalez and Woods


PRETRATAMIENTO

ACONDICIONADO DE UNA IMAGEN


ACONDICIONADO DE UNA IMAGEN

PREPROCESAMIENTO: PROCESAR UNA IMAGEN DE


ENTRADA DE TAL FORMA QUE LA NUEVA IMAGEN
TENGA UNA MEJOR APARIENCIA VISUAL O PERMITA A
UN SISTEMA PARA EL RECONOCIMIENTO DE OBJETOS
ENTREGAR MEJORES RESULTADOS.
ACONDICIONADO DE UNA IMAGEN: PROCESAR UNA
IMAGEN DE ENTRADA CON EL OBJETIVO DE QUE LOS
SIGUIENTES MÓDULOS DE UN SISTEMA PARA EL
ANÁLISIS DE IMÁGENES OFREZCAN MEJORES
RESULTADOS.
ACONDICIONADO DE UNA IMAGEN
ACONDICIONADO DE UNA IMAGEN
FILTRADO

RUIDO EN IMÁGENES

f x, y 
RUIDO EN IMÁGENES

𝑓ሚ = 𝑓 + 𝑟
RUIDO DE ADQUISICIÓN

Cualquiera de las imágenes la podemos como una variable aleatoria.


La imagen 𝜎 𝑥, 𝑦 debería ser oscura.
Si tomamos todos los valores de intensidad de 𝜎 𝑥, 𝑦 , los elevamos
al cuadrado y los sumamos, obtendremos una valor superior a cero.
RUIDO DE ADQUISICIÓN
Entrecruce de información
OTRAS CAUSAS DEL RUIDO
OTRAS CAUSAS DEL RUIDO
TIPOS DE RUIDO
MANERAS DE GENERAR IMÁGENES CON RUIDO

−1
MANERAS DE GENERAR IMÁGENES CON RUIDO
TIPOS DE RUIDO
TIPOS DE RUIDO
TIPOS DE RUIDO
TIPOS DE RUIDO
Filtrado de una imagen:

En el dominio de la frecuencia.

En el dominio de los píxeles.


Filtrado de el dominio de la frecuencia:

Calcular la transformada de Fourier F(u,v) de f(x,y).

Diseñar filtro G(u,v).

Multiplicar F(u,v) por el filtro G(u,v).

Calcular la transformada de Fourier inversa f*(x,y).

Obtener la parte real f(x,y).


F(u,v) x =

f*(x,y) y parte
real
F(u,v)

Filtrado local de la FFT

Picos de ruido
removidos

Transformada
inversa
Aplicación de la FFT:
Filtrado en el dominio frecuencias: Convolución:

Imagen: 𝐼[𝑚, 𝑛]

Transformada de Fourier: 𝐹[𝑢, 𝑣]

Diseño de filtro: 𝐻[𝑢, 𝑣]

Aplicación de filtro: 𝐻[𝑢, 𝑣] · 𝐹[𝑢, 𝑣]

Transformada de
Fourier inversa: 𝐹𝐹𝑇 −1 {𝐻[𝑢, 𝑣] · 𝐹[𝑢, 𝑣]}

Imagen mejorada: 𝐼’[𝑚, 𝑛]


Reconocimiento de texturas:
Pretratamiento o
acondicionado
de una imagen
UN PARADIGMA PARA
EL RECONOCIMIENTO DE OBJETOS

Segmentación Extracción de
𝑠 𝑥, 𝑦 rasgos

𝑔 𝑥, 𝑦
Pre-
procesamiento Descripción

BASE DE
𝑓 𝑥, 𝑦 CONOCIMIENTO

Adquisición de
imagen Reconocimiento

Entrada Salida

Gonzalez and Woods


FILTRADO EN EL DOMINIO DE LOS PÍXELES
FILTRADO LINEAL
FILTRADO LINEAL

PRINCIPIO DE
APLICACIÓN DE UNA
MÁSCARA DE
FILTRADO
FILTRADO LINEAL

𝑝1 𝑝2 𝑝3 𝑓1 𝑓2 𝑓3
𝑝4 𝑝5 𝑝6 𝑓4 𝑓5 𝑓6
𝑝7 𝑝8 𝑝9 𝑓7 𝑓8 𝑓9
1 2 1 2 1 5
2 3 2 4 5 3  49
1 2 1 2 3 3

(a) (b) (c)

Pesos de la máscara asociada al operador T. (b) Valores debajo de


esta máscara. (c) Resultado.
0 0 0 0 0
2 1 1 0 2 1 1 0
1 3 1 Padding (rellenado)=1 0 1 3 1 0
1 1 2 0 1 1 2 0
0 0 0 0 0
-1 0 1 0 0 0 0 0
-1 0 1 0 2 1 1 0 −1 × 0 + 0 × 0 + 1 × 0 +
−1 × 0 + 0 × 2 + 1 × 1 +
-1 0 1 0 1 3 1 0
−1 × 0 + 0 × 1 + 1 × 3 = 4
0 1 1 2 0
0 0 0 0 0

Stride (paso)=1

-1 0 1 0 0 0 0 0
-1 0 1 0 2 1 1 0 −1 × 0 + 0 × 0 + 1 × 0 +
−1 × 2 + 0 × 1 + 1 × 1 +
-1 0 1 0 1 3 1 0
−1 × 1 + 0 × 3 + 1 × 1 = −1
0 1 1 2 0
0 0 0 0 0
4 -1 x
x x x
x x x
Filtrado pasa bajas:

Si los valores
de mi mascara
son positivos,
la mascara
estará
ejecutando un
filtrado pasa-
bajo.

En una imagen sería reducir la influencia del ruido


asociado a las altas frecuencias de la señal.
FILTRADO PROMEDIO ARITMÉTICO:

0 0 0 0 0 𝑠 0 0 0 0 0
0 2 1 1 0 1 0 x x X 0
= (2 + 1 + 1 + 1 + 3
0 1 3 1 0 9 0 X 1 X 0
0 1 1 2 0 0 x X x 0
0 0 0 0 0 0 0 0 0 0
FILTRADO PROMEDIO ARITMÉTICO:

0 0 0 0 0 0 0 0 0 0
0 2 1 1 0 1 1 1 0 x x X 0
0 1 3 1 0 ∗ 1 1 1 = 0 X 1 X 0
0 1 1 2 0 1 1 1 0 x x x 0
0 0 0 0 0 0 0 0 0 0

𝑠
1
= (1 × 2 + 1 × 1 + 1 × 5 + 1 × 4 + 1 × 5 + 1 × 3 + 1 × 2 + 1 × 3
9
Efecto de aplicar el filtro
de promediado aritmético
de varios tamaños sobre
una imagen. (a) 3x3, (b)
5x5, (c) 7x7, (d) 9x9, (e)
11x11 y (f) 13x13.

¿Qué notamos?

R: La imagen se va
haciendo más difusa
(desenfocada) conforme
el tamaño de la máscara
crece.
¿A qué equivale en el
dominio de la
frecuencia crecer la
máscara?
Conforme se crece el tamaño de la máscara, es como si la frecuencia
de corte Fc del filtro se moviera hacia la izquierda.

Se deja pasar menos información de alta frecuencia (detalle).


La transformada de Fourier del núcleo promedio aritmético 1-D viene
dada por la parte real de la función SINC.

La transformada de Fourier del núcleo Gaussiano 1-D es otra


Gaussiana
Separabilidad lineal del filtro Gaussiano:

fG  G f
h  m2 k  m2

   Gh, k  f i  h, j  k 
h   m2 k   m2
h  m2 k  m2 h2 k 2

  e 2 2
f i  h, j  k 
h   m2 k   m2
h  m2 h2 k  m2 k2
  2
 e 2 2
e 2
f i  h, j  k 
h   m2 k   m2
Separabilidad lineal del filtro Gaussiano:
Separabilidad lineal del filtro Gaussiano:
Separabilidad lineal del filtro Gaussiano:
Diseño de núcleos Gaussianos:

n n n 2 n n


1  x n
      x    x      x
 0 1  2 n

1
1 1
1 2 1
1 3 3 1
1 4 6 4 1 1 4 6 4 1
1 5 10 10 5 1
1 6 15 20 15 6 1
-3 -2 -1 0 1 2 3
-3 0.011 0.039 0.082 0.105 0.082 0.039 0.011
-2 0.039 0.135 0.287 0.368 0.287 0.135 0.039
-1 0.082 0.287 0.606 0.779 0.606 0.287 0.082
0 0.105 0.368 0.779 1.0 0.779 0.368 0.105
1 0.082 0.287 0.606 0.779 0.606 0.287 0.082
2 0.369 0.135 0.387 0.368 0.387 0.135 0.039 h  n2 k  n2
3 0.011 0.039 0.082 0.105 0.182 0.039 0.011
c   Gh, k   1115
h   n2 k   n2

1 4 7 10 7 4 1 1 4 7 10 7 4 1
4 12 26 33 26 12 4 4 12 26 33 26 12 4
7 26 55 71 55 26 7 2 2 1
7 26 55 71 55 26 7
10 33 71 91 71 33 10 1115 10 33 71 91 71 33 10
7 26 55 71 55 26 7 n7 7 26 55 71 55 26 7
4 12 26 33 26 12 4 4 12 26 33 26 12 4
1 4 7 10 7 4 1 1 4 7 10 7 4 1
(a) Una imagen
contaminada con
ruido Gaussiano. (b)
Imagen filtrada con
un filtro promedio
aritmético. (c)
Imagen filtrada con
núcleo Gaussiano.
OTROS FILTROS LINEALES

FILTRO PROMEDIO ARMÓNICO.


FILTRO PROMEDIO CONTRA-ARMÓNICO.
FILTRO PROMEDIO GEOMÉTRICO.
FILTRO YP.
FILTRO PROMEDIO ARMÓNICO:

n2
f ph 
1

 
x , y V f  x, y 

0 0 0 0 0
0 2 1 1 0
9
0 1 3 1 0 𝑠=1 1 1 =?
+
2 1 +⋯ 2
0 1 1 2 0
0 0 0 0 0
Efecto de aplicar el filtro
promedio armónico
sobre una imagen
contaminada con
diversos tipos de ruido:
sal y pimienta.

3×3

5×5
FILTRO PROMEDIO CONTRA-ARMÓNICO:

 f  x, y 
R

 
x , y V
f ca 
 f  x, y 
R 1

 
x , y V

R<0, el filtro elimina ruido tipo sal.

R>0, el filtro elimina ruido tipo pimienta.


Efecto de aplicar el filtro
contra-armónico sobre
una imagen contaminada
ya sea con ruido tipo sal o
tipo pimienta.
FILTRO PROMEDIO GEOMÉTRICO:

  f x, y n
1
f pg  2

 x , y V

1 1 1
0 0 0 0 0 𝑠= 29 × 19 × ⋯× 29
0 2 1 1 0
0 1 3 1 0 ¿Qué pasa si uno de los valores de intensidad
es “0”?
0 1 1 2 0
0 0 0 0 0 R: 0.
Efecto de aplicar el
filtro promedio
geométrico sobre una
imagen contaminada
con diversos tipos de
ruido.

3×3

5×5
FILTRO Yp :

1
 f  x, y  
p p
f Yp   2 
 x , y V n 

p<0, el filtro remueve ruido tipo sal.

p>0, el filtro remueve ruido tipo pimienta.


Efecto de aplicar el filtro
Yp sobre una imagen
contaminada con
diversos tipos de ruido:
sal y pimienta.

3×3

5×5
Filtros resaltadores:

0 -1 0 1 -2 1
-1 5 -1 -2 5 -2
0 -1 0 1 -2 1

Las máscaras contienen valores positivos, negativos y “0” y además


la suma de los pesos es ligeramente positivo.
Filtros enfatizadores de altas frecuencias ''High-Boost'‘:

f a  f  fb

fe  A  f  fb A=1, da como resultado la


versión pasa-alto estándar.
fe  A  f  fb
A>1, parte de la información
  A  1 f  f  f b de la imagen original es

 A  1 f  f a
adicionada a la imagen filtrada
 en sus altas frecuencias.
Filtros enfatizadores de altas frecuencias ''High-Boost'‘:

Al deslizar la
mascara, si su suma
-1 -1 -1 es “0” y si los valores
1
9 -1 P -1 en la imagen son
-1 -1 -1 semejantes, entonces,
el resultado tiende a
ser “0”.
P  9  A 1
Si 𝐴 = 1, 𝑃 = 8.
fe  A  f  fb
  A  1 f  f  f b
  A  1 f  f a
Efecto de
aplicar el
filtro
emfatizador
sobre una
imagen:

A=1.01,
A=1.05,
A=1.1.

También podría gustarte