0% encontró este documento útil (0 votos)
3 vistas44 páginas

Visión 3D: Estereoscopía y Modelos de Cámara

Vision 3D por computador

Cargado por

fibec66073
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas44 páginas

Visión 3D: Estereoscopía y Modelos de Cámara

Vision 3D por computador

Cargado por

fibec66073
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

3 Visión 3D estereoscópica

3.1 Preámbulo

La extracción de información tridimensional de una imagen es una de las tareas más importantes de la Visión
artificial y uno de los temas más investigados por científicos de todo el mundo dedicados a la visión por
computador. No cabe duda que, el dotar de visión a una máquina para que ésta pueda desenvolverse en un entorno
3D, es una tarea que suscita muchísimo interés por las innumerables aplicaciones de todo tipo que conllevaría.

Sin embargo la obtención de la información métrica de una imagen no es una tarea sencilla. En la figura 3.1
se aprecia como en una proyección de perspectiva no se conservan las distancias, ni los ángulos ni incluso el
paralelismo. La técnica estereoscópica fue comentada en el capítulo 2, (véase [Link] Estéreo) como una de las

Figura 3.1: Pérdida de la información geométrica en una proyección de perspectiva.

UPM-DISAMT-2000.31v1.0 43
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

múltiples posibilidades, de los denominados métodos pasivos, que emplea la visión artificial 3D, para la
reconstrucción y medición de escenas tridimensionales. En este caso, da título a un capítulo completo de la presente
tesis doctoral, ya que algunas de las aportaciones originales de ésta, no se podrían entender sin entrar con
detenimiento en los detalles que describen la estereoscopía, como; el modelo de cámara, la estimación del modelo
asociado a una sola cámara y la geometría epipolar. El problema de la correspondencia, asociado a dos o más
cámaras, o a dos o más vistas realizadas con la misma cámara, será dejado para el próximo capítulo.

El modelo de cámara es fundamental para entender el proceso de medición de puntos tridimensionales en el


espacio a partir de sus proyecciones en planos sensores. Se comenzará con una introducción necesaria para entender
los mecanismos de formación de la imagen en una cámara oscura, tanto el modelo geométrico como el radiométrico.
Seguidamente se entrará en detalle en los distintos modelos sin distorsión, todos ellos simplificaciones que se
pueden efectuar bajo unas condiciones determinadas. Para alcanzar más precisión se suelen emplear modelos con
distorsión, teniéndose en cuenta las distintas aberraciones que las lentes introducen con frecuencia. Por último se
entra en los modelos reales, habitualmente utilizados, advirtiendo que éstos no dejan de ser más que buenas
aproximaciones a cada caso particular.

El objetivo de la estimación del modelo es dotar al sistema de Visión artificial de habilidad para realizar
medidas 3D y asegurar cierta precisión. Una vez elegido el modelo de la cámara que mejor se adapte a cada caso
concreto, es preciso calcular cada uno de los parámetros que lo describen. Para ello se entra en el proceso
denominado estimación del modelo, o vulgarmente conocido en la comunidad científica de visión artificial, como
calibración de cámaras, apelativo este que se empleará con cierta frecuencia en la presente tesis. Conviene remarcar
que el término “calibración” tiene un significado muy distinto en metrología, y es la determinación de la
incertidumbre que proporciona un aparato medidor (véase Apéndice E, definiciones en metrología).

La geometría epipolar es la que describe el proceso de recuperación de las dimensiones tridimensionales de


una escena con sus proyecciones en planos sensores. Ya que en el proceso de proyección de un punto 3D a un plano,
se reduce en uno la dimensión. Si se desea realizar el proceso inverso, es decir recuperar el punto 3D a partir de la
medición del punto 2D, entonces habrá que ayudarse de otra cámara.

3.2 El modelo de cámara

3.2.1 Introducción
En este punto se pretende explicar el proceso de formación de la imagen por una cámara. Para ello, en
primer lugar se va a hacer una discusión de los distintos modelos. La utilización de uno u otro será función de la
aplicación particular que se esté realizando. Por último se añadirán al modelo los parámetros de distorsión propios
de cualquier óptica comercial y se realizará su
estimación.

[Link] Modelo fotométrico o radiométrico

Al estudiar el comportamiento de una cámara


existen dos modelos básicos a analizar; el modelo
fotométrico y el modelo geométrico. El primero de ellos
se basa en la naturaleza de la luz y su dualidad onda-
corpúsculo, teniendo en cuenta sus propiedades
fundamentales de propagación como son interferencia,
(interacción de dos o más ondas de luz que producen
una irradiancia resultante que puede ser positiva o
negativa), difracción (desviación del frente de onda al
ser obstruido por un objeto), y la polarización
(propiedad del campo eléctrico asociado a la
propagación de la luz, de vibrar en cualquier plano
perpendicular al eje axial) [HECHT y ZAJAC, 1974].
Figura 3.2: Concepto básico de radiometría
En fotogrametría se suele emplear el modelo geométrico,
sin embargo se tendrá presente el modelo fotométrico en
algunas de las conclusiones y aportaciones originales de
esta tesis.

44 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Así la radiometría es la parte esencial en la formación de una imagen y tiene que ver con las relaciones
entre las cantidades de energía emitidas por las fuentes de luz, es decir, reflejadas por las superficies, y las
cantidades de energía registradas por los sensores. Se emplean los conceptos de radiometría para resolver dos
problemas:
1. Modelar cuanta luz de la iluminación es reflejada por las superficies.
2. Modelar cuanta de la luz reflejada alcanza el plano sensor de la cámara.
La ley fundamental de la formación de imágenes radiométricas está expresada en la ecuación (3.1), y
explicada por la figura 3.2 . Dice que la iluminación de la imagen decrece con la cuarta potencia del coseno del
ángulo formado por el rayo principal y el eje óptico [TRUCCO y VERRI, 1998]. L(P) representa la radiancia de la
escena según el modelo Lambertiano [PLATERO, 1998] y E(p) es la irradiancia de la imagen. Notesé que a más
focal se obtiene menor energía en la cámara, al igual que ocurre cuando los rayos atraviesan con un gran ángulo
respecto al eje óptico. [TAREL, 1996] Propone un modelo físico basado en la respuesta radiométrica de una lente
para realizar correcciones en la imagen antes de realizar procesamiento subpíxel.
2
πd
E ( p ) = L( P)   cos4 α (3.1)
4 f 

[Link] Modelo Geométrico

Sin embargo en la literatura tradicional se suele utilizar un segundo modelo, el modelo geométrico basado
en las leyes de la reflexión y la refracción. Aunque la reflexión fue descubierta en 1611 por KEPLER (1571-1630),
no fue hasta el 1621 que SNELL (1591-1626) descubriera de forma empírica la ley de la refracción, abriéndose la
puerta de la óptica moderna. Posteriormente Rene DESCARTES (1596-1650) publicó su formulación, así como la
de la reflexión. En 1690 el físico Holandés Christian HUYGENS (1629-1695) descubrió la teoría ondulatoria,
concluyendo que la luz disminuía su velocidad al entrar en medios más densos, llegando también a deducir de esta
forma las leyes de la reflexión y la refracción. Su investigación se resume en el denominado principio de Huygens
que en 1690 escribió en el Traité de la Lumiére “cada punto de un frente de onda primario sirve como fuente de
pequeñas ondas esféricas secundarias tales que el frente de onda primario un momento más tarde es la envolvente
de estas pequeñas ondas“, este principio, después de trescientos años, se sigue aplicando en óptica cuántica.

En la presente tesis se utilizará el elegante tratamiento de reflexión y refracción en la frontera que fijó el
físico inglés Sir George Gabriel STOKES (1819-1903), y que se utiliza principalmente para explicar el modelo
geométrico. No se dejará de lado completamente el modelo fotométrico y será tenido muy en cuenta a la hora de
estudiar las distorsiones y las aberraciones en las lentes. Las ecuaciones que describen este modelo se verán más
adelante. En el punto 3.2.2. se analizan los modelos geométricos sin distorsión, partiendo del modelo estenoscópico
o proyección perspectiva, y pasando por distintas simplificaciones. En el punto 3.2.3. se modelizan las distorsiones
producidas por la no homogeneidad de las lentes.

[Link] La cámara oscura

La cámara oscura, denominada también de agujero, pin-hole o cámara estenoscópica, representada en la


figura 3.3, no es más que una cavidad estanca a la luz que posee un pequeño agujero en una pared delgada. La luz
que entra por el orificio forma una imagen invertida
de la escena exterior. El principio de su
funcionamiento era conocido ya por ARISTÓTELES
(s IV A.C.) y sus observaciones fueron preservadas
por los pensadores árabes a través de la Edad media.
En el 1130, ALHAZEN la utilizó para examinar
indirectamente los eclipse solares. En uno de los
manuscritos sin fecha, Leonardo DA VINCI (1452-
1519) describía así el fenómeno: “Cuando las
imágenes de objetos iluminados entran en una
habitación muy oscura por un orificio muy pequeño y
van a parar a un papel blanco, a cierta distancia del
agujero, todos los objetos sobre el papel se ven con
sus propias formas y colores estos objetos
aparecerán invertidos por la intersección de los
rayos” [CLERC, 1975]. Sin embargo, el primer
Figura 3.3: Formación de la imagen en una cámara de agujero
tratamiento detallado aparece en el Magia naturalis
UPM-DISAMT-2000.31v1.0 45
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

(Magia Natural) por Giovanni DELLA PORTA (1535-1615) [HECHT y ZAJAC, 1974]. La cámara oscura mejoró
mucho en la segunda parte del siglo XVI con la adopción de una lente biconvexa en la abertura. Johannes KEPLER
(1571-1630), el renombrado astrónomo, tenía una versión portátil que usaba mientras viajaba por Austria. A
principios del siglo XVIII se convirtió en un instrumento portátil similar a las cámaras actuales. La primera
fotografía permanente la hizo en 1826 el francés Joseph Nicéphore NIÉPCE (1765-1833) usando una cámara de
cajón con una pequeña lente convexa, una placa de peltre sensibilizada y aproximadamente ocho horas de
exposición. Es una escena de azoteas, tomada desde la ventana de su cuarto de trabajo en residencia cerca de
Châton-sur-Saône.

La cámara de agujero sin lente, o cámara pin-hole, aun se utiliza para ciertas aplicaciones. Es con mucho el
sistema más simple para captar imágenes, y sin embargo tiene varias virtudes ciertamente notables. Puede formar
una imagen bien definida y, prácticamente sin distorsión, de objetos sobre una campo angular extremadamente
ancho (debido a la gran profundidad de foco) y sobre un gran rango de distancias (gran profundidad de campo). Si
inicialmente la pupila de entrada es muy grande no se forma una imagen nítida. Conforme se disminuye en
diámetro, la imagen se forma y se define más. Después de cierto punto, una mayor reducción en el tamaño del
agujero, aparece el efecto de difracción de la luz, haciendo que la imagen se haga borrosa de nuevo. Aunque el
tamaño del agujero es función de la distancia del objeto y del tamaño de la caja oscura, en general con una abertura
de 0,5 mm situado a 25 cm de la película se trabaja bien. En la mayor parte de las situaciones prácticas el problema
más importante es que es muy lento (aproximadamente f /500). Esto significa que los tiempos de exposición
generalmente serán extremadamente largos, aun con las películas más sensibles. Otra posibilidad es iluminar
fuertemente el objeto a captar. Pese a esto, su campo de aplicación se extiende a objetos estáticos. En [TRUCCO y
VERRI, 1998] se explica como construir una cámara pin-hole.

3.2.2 Modelos geométricos sin distorsión


En este punto se van a explicar los modelos matemáticos que se aproximan al proceso de formación de una
imagen en una cámara oscura. En la realidad se suelen emplear lentes, que hacen de amplificador de luz, y por tanto,
en una cámara real no se necesita tanto tiempo de exposición como en la cámara oscura vista anteriormente. En este
punto, la lente se supone ideal, es decir, no presenta distorsiones ni aberraciones ópticas, que serán tratadas en el
punto 3.2.3. Por tanto, los modelos matemáticos que se verán en este apartado son válidos para la cámara
estenoscópica. Los parámetros que describen el modelo de la cámara se denominan parámetros intrínsecos o
parámetros de la geometría interna. Los parámetros extrínsecos son los que determinan la posición de la cámara
respecto a un sistema de coordenadas del mundo, es por ello que se denominan también como geometría externa, o
simplemente la posición de la cámara.

[Link] Modelo estenoscópico, proyección perspectiva

Es el modelo de cámara más empleado debido fundamentalmente a su sencillez y a su buen ajuste con la
realidad. En la literatura tradicional es referido como modelo pin-hole o modelo de lente delgada. La cámara
estenoscópica tradicional representada en la figura 3.4 (derecha), es básicamente una cámara oscura en la que en el
plano focal F se realiza un diminuto orificio en C, llamado foco. En su interior se sitúa un material sensible a la luz,
que es colocado en el denominado plano de imagen I, que es paralelo al plano focal. La distancia entre estos dos
planos se denomina distancia focal y se representa por f. La línea perpendicular a I que pasa por F es el eje óptico, y
su intersección con I en el punto c es el punto principal o centro de la imagen. Los dos sistemas de coordenadas
representados son; el sistema de coordenadas del plano de imagen (c,x,y), y el sistema del mundo tridimensional
(C,X,Y,Z), denominándose sistema de coordenadas estándar o simplemente sistema de coordenadas de la cámara.

Se realiza una proyección perspectiva o cónica, estableciendo una correspondencia entre los puntos del
espacio, tridimensionales, y los puntos de la imagen, bidimensionales. Así un punto P, con coordenadas de la
cámara (X,Y,Z) se proyecta en el plano de imagen como p, con coordenadas de la imagen (x,y), ya que de los
infinitos rayos de luz emitidos por P, sólo consigue alcanzar el plano de imagen, los que caben por el orificio del
foco (idealmente uno sólo). Nótese que un punto p podría tratarse de la proyección de P, pero también de P’, en
realidad de cualquier punto que este sobre la línea CP. Ésta es una característica de la cámara estenoscópica y es que
tiene una profundidad de campo infinita, es decir, cualquier punto situado en la línea CP aparecería representado en
el plano de imagen con nitidez. Aplicando relación entre triángulos semejantes en la figura 3.11, se podría llegar a la
ecuación fundamental de este modelo, representada en la ecuación (3.2), donde además se ha puesto de forma
matricial.

46 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Figura 3.4: Modelo geométrico de la cámara estenoscópica (izquierda), con imagen virtual (derecha)

 X  X 
0  c 
X Y f → nX  1 0 0
 Yc
f 0 0 0  c 
= =  
nY = 0 1 0 ⋅   ≅ 0 f 0 0 ⋅  
Yc (3.2)
  
0
X c Yc Z c Z     Zc 
 n  0 0 1 0  c   0 0 1 0  
 f   1 
1

Esta misma ecuación es verificada por el modelo representado en la figura 3.4 (derecha), ya que no hay
ninguna diferencia en situar el plano de imagen por una imagen virtual situada en el otro lado del plano focal. De
esta manera se consiguen que los ejes de ambos sistemas involucrados vayan en la misma dirección y es la forma en
que se encuentra representado en la bibliografía habitual, y es la que se utilizará en la presente tesis.

Como se puede deducir de la ecuación (3.2), la proyección de perspectiva es una proyección no lineal que
como se verá posteriormente conducirá a resolución de mínimos cuadrados con matrices mal condicionadas,
haciendo el resultado bastante sensible a la precisión del computador [DE LA FUENTE, 1993]. Esto se verá
agravado cuando los efectos de perspectiva sean pequeños frente a otros como distorsiones o aberraciones de las
lentes. Algunas veces, cuando se cumplen algunas circunstancias como que el campo de vista sea pequeño y el
tamaño del objeto sea pequeño respecto a la distancia desde el plano focal al objeto, la proyección puede
aproximarse a un mapeado lineal. Esta aproximación conduce a una gran reducción en la complejidad del cálculo
computacional. Como se verá en los siguientes apartados, para ciertas condiciones, el modelo se podrá simplificar
notablemente.

[Link] Proyección ortográfica

Es una simplificación del modelo de perspectiva, que


se puede emplear en determinadas circunstancias o con
determinado tipo de lentes, y que convierte las ecuaciones en
lineales. Bajo este modelo se ignora completamente la
información de profundidad, ya que se supone que los rayos
inciden perpendicularmente al plano de la imagen, paralelos
todos ellos al eje óptico. Este tipo de proyección se da en
varias circunstancias de la vida real, como por ejemplo en
imágenes aéreas tomadas por un avión o satélite o el caso de
lentes telecéntricas que será descrito en el punto [Link].
Además existen evidencias de que cerca de la fovea del ojo
humano los objetos se proyectan ortográficamente [HORN,
1986]. Por ello, este tipo de proyección solo podrá usarse en
ciertos casos y bajo determinadas condiciones. La proyección
ortográfica hace que un mismo objeto situado a distintas
distancias Zc se proyecte como el mismo cuerpo sobre el
sensor. Según esto, la ecuación (3.2) se ve transformada en
(3.3), tal y como se puede ver en la figura 3.5. Existen ópticas,
como las lentes telecéntricas [WATANABE y NAYAR.,
1995] que producen proyecciones ortográficas. Figura 3.5: Modelo de proyección ortográfica.

UPM-DISAMT-2000.31v1.0 47
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

(3.3)

(ecu 3030)

Figura 3.6: Comparativa entre una proyección perspectiva y una ortográfica.

 Xc 
X = Xc nX   f 0 0 0  
→  nY  =  0 0 ⋅ c 
Y (3.3)
Y = Yc f 0
    Z 
 n   0 0 0 f   c 
1

[Link] Proyección débil

Es otra simplificación bastante empleada. Se denomina también proyección ortográfica escalada. Se supone
que el objeto está a una distancia fija y determinada Zo (distancia al plano intermedio). Para que esta aproximación
sea válida, se supone que el objeto es
suficientemente pequeño con respecto
de la distancia a la cámara Z. Esto es
razonable por ejemplo en imágenes
aéreas. En este caso la ecuación (3.2)
se ve transformada en (3.4). Notesé
que cuando Zo es igual a f no hay
diferencia con la proyección
ortográfica. Como se puede apreciar
en la figura 3.7, se denomina
proyección ortográfica escalada por
que es como si la proyección se
descompusiera en dos pasos. En
primer lugar una proyección
ortográfica a un plano de profundidad
media virtual y en segundo lugar un
Figura 3.7: Modelo de proyección de perspectiva débil escalado con factor de escala f/Zo.

X Xc Xc
= nX   f 0 0 0  
→  nY  =  0 0 ⋅  c 
f Zo Y (3.4)
f 0
Y Yc     Z 
=  n   0 0 0 Z o   c 
f Zo 1

[Link] Proyección paraperspectiva

Bajo la proyección de perspectiva débil, un punto del mundo se proyecta primero sobre el plano de
profundidad media, usando los rayos paralelos al eje óptico, como se puede ver en la figura 3.7. Esto causa un error
de aproximación cuando un objeto dista del eje óptico, es decir, la relación X/Z y Y/Z es grande. La proyección

48 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

paraperspectiva minimiza este error,


haciendo que los rayos sean paralelos
al denominado rayo de proyección
central, CG en la figura 3.8, donde G
es el centroide del objeto. De forma
similar al modelo de proyección débil,
la proyección paraperspectiva emplea
un plano de profundidad media, como
se puede ver en la figura 3.8. Hasta
este plano los rayos de todos los
puntos se proyectan paralelos al rayo
de proyección central CG.
Posteriormente los puntos se
proyectarán del plano de profundidad
media al plano de imagen de forma
perspectiva. Figura 3.8: Modelo de proyección paraperspectiva.

Así pues, siendo las coordenadas del centroide [Xo , Yo , Zo]T , un punto del mundo P = [Xc , Yc , Zc ]T , se
proyectará paralelo al rayo de proyección central CG hasta el plano de profundidad media con coordenadas [Xc-
Xo/Yo Zc+Xo , Yc- Yo/Yo Zc+Yo , Zo]T . Finalmente este punto se proyectará sobre el plano de imagen con el modelo
proyectivo, quedando la ecuación tal y como se expresa en 3.5.

f X X f 0 − Xo X o  X c 
X= X c − o2 Z c + o nX   Zo   
Zo Zo Zo →  nY  =   Yc
0 f − Yo Yo  ⋅   (3.5)
f Y Y   Zo  zc 
Y = Yc − o2 Z c + o  n  0 0 0 Zo   
Zo Zo Zo   1
 

En [XU y ZHANG, 1996] se realiza un interesante estudio de los distintos modelos vistos, cuantificando el
error que se comete en cada uno de ellos. Así la proyección débil puede verse como una aproximación de orden cero
al modelo perspectivo, mientras el modelo paraperspectivo sería una aproximación de orden uno. Una mejor
aproximación sería el denominado modelo ortoparaperspectivo. La diferencia de éste respecto al paraperspectivo es
que el plano de profundidad media no se toma paralelo al plano de imagen, sino perpendicular al rayo de proyección
central (el que conecta el centro óptico C con el centroide G del objeto).

[Link] Proyección afín

Si se examinan las matrices de proyección para los modelos ortográficos, perspectivo débil y
paraperspectivo, ecuaciones (3.3), (3.4) y (3.5), se observa que todos tienen la misma forma, ecuación (3.6). Según
cada modelo, existen algunas restricciones sobre los elementos de la matriz, excepto para P31, P32, P33, que son
iguales a cero. Si se ignoran estas restricciones sobre la matriz PA, ésta se convierte en la llamada cámara afín,
entelequia introducida por MUNDY y ZISSERMAN en 1992.

 P11 P12 P13 P14 


PA =  P21 P22 P23 P24  (3.6)
 
 0 0 0 P34 

p = M A P + TA
con :
 m11 m12 m13   P11 P34 P12 P34 P13 P34  (3.7)
MA =  =
 m21 m22 m23  P P
 21 34 P22 P34 P23 P34 
TA = [P14 P34 P24 P34 ]
T

Así en una cámara afín la proyección de un punto espacial P = [Xc , Yc , Zc]T se transformará en p = [X , Y ]T
según la ecuación (3.7), donde proyección afín se descompone en una proyección lineal y en una traslación pura.
Las ventajas de la proyección afín son las siguientes:

UPM-DISAMT-2000.31v1.0 49
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

1. Preserva paralelismos. Líneas paralelas en el mundo, siguen siendo paralelas en la imagen, lo cual no se cumple
en una proyección perspectiva
2. El centroide de un conjunto de puntos 3D, al proyectarlo, coincide con el centroide de los puntos 3D
proyectados. Esto tampoco es cierto en el caso de proyección perspectiva.
Conviene resaltar que el modelo de cámara afín es una aproximación a la cámara real y que es válido solamente
cuando la variación de profundidad del objeto de interés es muy pequeña comparada con la distancia del objeto a la
cámara.

[Link] Geometría proyectiva

La geometría proyectiva es la que mejor describe, y de forma más intuitiva el proceso de formación de una
imagen en una cámara estenoscópica. El proceso de proyección central que se produce en una cámara oscura, es una
transformación geométrica proyectiva, es decir, no
es una transformación euclídea, en la que se
conservan las distancias, ni es una transformación
afín, en la que se conserva el paralelismo. El
reconocimiento de formas del ser humano se basa
en parte también en características proyectivas
invariantes. El uso de la geometría proyectiva
aporta numerosas ventajas frente a la utilización de
otra herramienta matemática, entre la que cabe
destacar que suministra un modelo lineal, siempre y
cuando no se trabaje con distorsiones. Cualidad
ésta muy utilizada en las técnicas de
autocalibración (véase 3.4.6). En la figura 3.9 se
puede ver una comparativa de las distintas
transformaciones estudiadas hasta ahora y las
magnitudes que se preservan en cada una de ellas. Figura 3.9: Comparativa entre las distintas transformaciones
En el apéndice A se incluye un resumen de los geométricas y magnitudes que permanecen invariantes ante la
principales teoremas de geometría proyectiva. transformación.

[Link] Rectificación

Ya que en una transformación proyectiva se deforman las imágenes, y lo que interesa en fotogrametría es
medir sobre ellas, se suele emplear la rectificación. La rectificación es un proceso por el cual se transforma la
imagen de proyección perspectiva a ortográfica. Aunque en una proyección ortográfica se conserva el paralelismo,
aunque no los ángulos, en determinadas circunstancias, como en fotogrametría aérea o en fotogrametría
arquitectónica, el ver las imágenes proyectadas ortográficamente, simplifica mucho el trabajo de medición, ya que
salvo el factor de escala, se puede medir directamente sobre la foto. En la figura 2.17 se aprecia la rectificación
producida con imágenes aéreas tomadas con un CCD lineal, en función de los movimientos que ha causado el avión
en el momento de la
adquisición. En la figura 3.10
se aprecia la rectificación
producida sobre la fachada de
un edificio. Para este tipo de
rectificación se necesita
conocer los parámetros internos
de la cámara.

3.2.3 Modelos con


distorsión
Una lente es una masa
de vidrio sometida a sucesivas
operaciones de moldeo,
rectificado y pulido. El empleo
de una óptica en una cámara
estenoscópica, hace que el Figura 3.10: Imagen original y rectificada. Cortesía Rollei Photometrics.
tiempo de exposición para

50 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

capturar una imagen tenga que ser muchísimo menor, normalmente controlado por un obturador mecánico o
electrónico. Sin embargo tiene como contrapartida la introducción de aberraciones ópticas que distorsionan la
proyección, deformándola, haciendo que ésta no sea una proyección perspectiva. Convendría distinguir las
aberraciones ópticas, inherentes a la propia lente, de las imperfecciones que se producen en la lente durante el
proceso de fabricación. Las aberraciones son causadas por la naturaleza del medio óptico, ya que este puede
presentar distintos comportamiento a los fenómenos de refracción (cambio de la dirección de un rayo al pasar de un
medio óptico a otro) y dispersión (el ángulo de refracción difiere para distintas longitudes de onda) en función de la
longitud de onda. Las imperfecciones de la lente tienen su origen en diversas causas; enfriamiento excesivamente
rápido, materiales no homogéneos, mala colocación de las lentes y defectos en la geometría de éstas, entre muchos
otros. Distorsiones y aberraciones pueden estudiarse en la literatura [HECHT y ZAJAC, 1974], [MAHAJAN, 1998]
y [WALKER, 1998]. En cualquier caso la distorsión va a introducir nuevos parámetros intrínsecos para la
descripción del modelo interno de la cámara.

[Link] Tipos de aberraciones ópticas

El término aberraciones designa las imperfecciones introducidas en la imágenes por los sistemas ópticos.
Son de dos clases: cromáticas y geométricas. La primera de ellas se manifiesta en el campo paraxial, las geométricas
aparecen al apartarse de él, es decir, si los haces luminosos (supuestos monocromáticos) tienen una abertura
importante y proceden de puntos situados fuera del eje de la lente. Las cinco aberraciones geométricas primarias o
aberraciones de SEIDEL, en honor al investigador que las clasificó, son; esférica, coma, astigmatismo, curvatura de
campo y distorsión. Las primeras cuatro afectan a la nitidez de la imagen y la quinta a la forma de ésta.
Seguidamente se tratan cada una de estas.

[Link].1 Aberración cromática

Se debe al diferente índice de refracción de un rayo luminoso según su longitud de onda. Existen dos tipos
de aberraciones cromática, la longitudinal y la lateral. La primera de ellas provoca que los rayos de distintas
longitudes de onda procedentes de un punto sobre el eje óptico de la lente se enfoque sobre diferentes planos de
imagen. La aberración cromática lateral ocurre debido a que la magnificación de la lente cambia según la longitud
de onda del rayo, se produce un desplazamiento lateral de los puntos de convergencia de los rayos de diferente
longitud de onda. El empleo de luz estructurada en fotogrametría hace que sea más sencillo compensar esta
aberración, ya que solo es necesario para una única longitud de onda, debido a la monocromaticidad de la luz láser.

[Link].2 Aberración esférica

Del haz de rayos que parten de un punto del objeto situado sobre el eje de la lente, aquellos que entran en la
lente a una mayor altura sobre dicho eje son refractados a diferentes puntos sobre el eje óptico, produciéndose un
desplazamiento del foco. La aberración esférica puede ser paliada mediante la apertura del diafragma, cuanto menor
sea esta apertura menos será la distancia posible de los rayos que llegan a la lente del eje óptico, reduciéndose así
esta aberración.

[Link].3 Coma

Los rayos que inciden con un cierto ángulo sobre el eje, no son enfocados sobre el plano de imagen, sino
que forman una imagen similar a una cometa con una cola. La cola tiene el aspecto de círculos que permanecen
siempre tangentes a dos rectas que forman entre sí un ángulo de 60º. Esta cola puede apuntar en la dirección al
centro de la imagen o en la opuesta, originando la coma entrante o la coma saliente. Un objeto que contenga curvas
concéntricas al eje óptico sufrirá un gran desenfoque a lo largo de un borde de cada curva concéntrica. Si una lente
no está corregida contra la coma el contraste en los bordes de la imagen será malo. La coma puede ser corregida
dando una menor apertura al diafragma.

[Link].4 Astigmatismo

Una lente corregida contra la aberración esférica y contra la coma todavía no enfocará un punto lejano al
eje óptico sobre un punto de la imagen En lugar de eso la imagen aparecerá con forma oval o consistirá en una
imagen de un par de líneas llamadas las líneas focales. Esta aberración que impide enfocar un punto del objeto sobre
un punto de la imagen se conoce como astigmatismo. Si el plano de enfoque se mueve hacia delante o hacia atrás, se
encontrará un punto en el que la imagen aparece nítida sobre el centro del plano, pero lejos del centro el punto de
enfoque nítido no es único. Disminuyendo la apertura del diafragma, y por tanto aumentando la profundidad de
campo, se consigue paliar el astigmatismo hasta un cierto punto, pero no se elimina completamente.

UPM-DISAMT-2000.31v1.0 51
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

[Link].5 Curvatura de campo

Representa la incapacidad de una lente para enfocar un objeto plano sobre un plano de imagen. Si el centro
del objeto está perfectamente enfocado, los bordes aparecerán desenfocados y viceversa. Como en el astigmatismo,
la curvatura de campo puede ser paliada disminuyendo la apertura del diafragma para aumentar la profundidad de
campo.

[Link].6 Distorsión

Mientras que las aberraciones descritas hasta ahora se relacionan con la nitidez del enfoque de la imagen, la
distorsión afecta a la forma que toma el conjunto de la misma. Se acostumbra a expresar la distorsión como un
porcentaje entre la altura ideal de la imagen y la distancia que los puntos se desvían de su posición en la imagen
ideal. La distorsión destruye la perfecta semejanza entre el objeto y su imagen, dando o bien un efecto de cojín
(distorsión positiva) o bien un efecto de barril (distorsión negativa). Cómo afectan las principales distorsiones a la
formación de las imágenes y su formulación matemática se estudiará en el siguiente punto.

[Link] Proyección perspectiva con distorsión

Debido que el mercado de óptica tiene como principales clientes empresas dedicadas al cine, televisión y
fotografía profesional, las ópticas comerciales corrigen aberraciones que son especialmente sensibles o detectables
por el ojo humano. Para ello lo que se suele hacer es emplear lentes compuestas que minimicen estas aberraciones.
Sin embargo, se descuida bastante la distorsión, ya que esta aberración es especialmente complicada de corregir.
Debido a que el ojo humano no es demasiado preciso para medir distancias, el no corregir la distorsión, no tiene un
efecto apreciable en el aspecto, siempre y cuando esta distorsión no sea exagerada. En Fotogrametría, sin embargo,
si lo tiene en cuenta y mucho. La ecuación (3.2) que representaba matemáticamente el modelo de la figura 3.11 ya
no sirve si se quiere tener considerar las distorsiones.

El nuevo modelo que mejor


se adapta a las deformaciones en la
imagen provocadas por las lentes se
refleja en la figura 3.11, donde un
punto P que se debería proyectar en
un punto p si no existiera distorsión,
realmente lo hace en p´. La
distorsión modifica en cierta medida
la posición de los puntos en la
imagen, de tal modo que estos
realmente no se encuentran donde
señalan las ecuaciones de
proyección, sino algo desplazados.
Este desplazamiento es función
además de la posición en la que se
encuentre el punto p´ en el plano de
imagen. Según la nomenclatura de la
figura 3.11 si se designan las
coordenadas en la imagen de los
puntos sin distorsión como Xu e Yu, y
Figura 3.11: Proyección perspectiva con distorsión las coordenadas de estos mismos
puntos teniendo en cuenta la
distorsión como Xd e Yd, la relación entre estas dos coordenadas viene dada por la ecuación (3.8). Los términos Dx y
DY resumen la distorsión de forma genérica, la cual puede modelarse de distintas formas, según el tipo de distorsión
predominante. Estos términos se expresan en función de las coordenadas con distorsión, puesto que serán los datos
que se dispondrán habitualmente para realizar la estimación del modelo. En general, estos términos se
descompondrán en tres actuaciones con distinto significado físico, distorsiones radial, descentral y prismática, que
se estudiarán a continuación.

X u = X d + D X ( X d , Yd )
(3.8)
Yu = Yd + DY ( X d , Y d )

52 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

[Link].1 Distorsión radial

La distorsión radial obedece a una expresión del tipo d pr = k1ρ 3 + k2 ρ 5 + k3 ρ 7 +.... donde ρ es la distancia
según el radio entre el punto y el centro de la imagen y k1, k2, k3, etc. son los coeficientes de distorsión radial,
desconocidos y que son los que se quieren estimar. Expresado en función de las coordenadas cartesianas la
distorsión radial quedaría tal como se refleja en la ecuación 3.9.

[
d Xr = k1 X d ( X d2 + Yd2 ) + O ( X d , Yd )
5
] (3.9)
2 2
[
dYr = k1Yd ( X d + Yd ) + O ( X d , Yd )
5
]
[Link].2 Distorsión descentral

Se debe a defectos en la alineación de los centros ópticos de las lentes que conforman la óptica de la cámara
y causa desplazamientos radiales y tangenciales. La imagen tendrá un eje para el que la distorsión tangencial sea
nula (eje libre de distorsión) y otro eje para el que esta distorsión sea máxima. Esta distorsión responde a una
expresión con dos parámetros p1 y p2 que se refleja en la ecuación (3.10).

( ) [
d Xd = p1 3 X d2 + Yd2 + 2 p2 X d Yd + O ( X d , Yd ) ] 4

) + O[( X ,Y ) ]
(3.10)
(
d Yd = 2 p1 X d Yd + p 2 X d2 + 3Yd2 d d
4

[Link].3 Distorsión axial o prismática

Se origina por imperfecciones en la fabricación y montaje de las lentes y provoca desplazamientos radiales
y tangenciales. Se modela con una expresión en la que aparecen dos parámetros s1 y s2 y se representa en la ecuación
(3.11).

[ ]
d Xp = s1 ( X d2 + Yd2 ) + O ( X d , Yd )
4

(3.11)
dYp = s2 ( X d2 + Y ) + O[( X , Y ) ]
2 4
d d d

[Link].4 Distorsión total

Las distorsiones descentral y prismática tienen unos coeficientes similares, pero son modelos de
distorsiones diferentes y tienen distintos ejes de máxima distorsión. La distorsión total se puede expresar como suma
de estos tres tipos, tal y como se expresa en la ecuación (3.12) en las que se han agrupado los efectos vistos teniendo
solo en cuenta las componentes de primer orden.

DX ( X d , Yd ) = s1 (X d2 + Yd2 ) + 3 p1 X d2 + p1Yd2 + 2 p 2 X d Yd + k1 X d ( X d2 + Yd2 ) (3.12)


DY ( X d , Yd ) = s 2 ( X d2 + Yd2 ) + 2 p1 X d Yd + p2 X d2 + 3 p2Yd2 + k1Yd ( X d2 + Yd2 )

Es costumbre bastante extendida agrupar las


distorsiones en radiales y tangenciales. De las
expresiones conocidas se deducen la ecuación (3.13).
Éstas son las ecuaciones que se van a utilizar como
caso más general de distorsión. En ellas aparecen dos
coeficientes k1 y k2 para la distorsión radial y otros dos
p1 y p2 para la tangencial. Estos cuatro coeficientes son
típicamente suficientes para describir la distorsión y
son los que se van a calibrar aunque existen referencias
bibliográficas de autores que emplean más parámetros,
[BEYER, 1992] o incluso modelos distintos
[ATKINSON, 1996]. En la figura 3.12 se puede
apreciar los efecto de la distorsión radial y tangencial.
En estos casos se han dado valores exagerados a los
parámetros. No es normal encontrar ópticas con una
distorsión tan alta.
Figura 3.12: Efectos de la distorsión total en sus componentes
radial y descentral.

UPM-DISAMT-2000.31v1.0 53
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

(
d Xr = X d k1rd2 + k 2rd4 )
(
d Yr = Yd k r + k r
1 d
2
) 2 d
4

= 2 p X Y + p (2 X + r ) 2 2 (3.13)
d Xt 1 d d 2 d d

d Yt = p (r + 2Y ) + 2 p X Y
1 d
2
d
2
2 d d

rd = (X 2
d + Yd2 )

3.2.4 Aproximación al modelo real.

[Link] Lente delgada

Los sistemas ópticos reales son bastante complejos, sin embargo, se puede entender su funcionamiento con un
sistema óptico simple como es la lente delgada. Aunque el modelo pin-hole se ajusta bastante bien al
comportamiento de las cámara que se emplean en fotogrametría, dista mucho del empleado en la realidad, sin
embargo sirve para comprender sistemas más complejos. Difiere de los sistemas reales por dos razones principales:

Figura 3.13: Lente delgada Figura 3.14: Formación de una imagen en una lente delgada

1. Una cámara estenoscópica que tenga una apertura infinitesimal no captaría suficiente cantidad de luz para
producir una imagen de brillo o imagen de irradiancia mensurable. Para la utilización de un sensor de luz real
haría falta un tiempo de exposición infinito.
2. Al ser la luz una radiación ondulatoria, en el borde del orificio de entrada se produce el fenómeno de difracción
y la luz se extendería sobre todo el plano sensor. Cuanto más pequeño se haga dicho orificio, mayor es la
difracción y la luz entrante más se alejará de los rayos de entrada.

Para evitar estos dos problemas, un sistema real utiliza lentes con una apertura finita. Así se produce una
amplificación y focalización de los rayos emitidos en un solo punto y se minimiza el efecto de la difracción. En las
figuras 3.13 y 3.14 se puede apreciar el comportamiento óptico de una lente delgada, en la que a los puntos Fi y Fd
se les denomina foco izquierdo y derecho, el eje que une dichos puntos se denomina eje óptico y el punto medio de
la lente que corta con este (punto O) se denomina centro de la lente. Notesé que en principio la lente tiene dos
distancias focales diferentes, ya que las curvaturas de las dos superficies podrían ser distintas. Las propiedades
básicas de una lente delgada fueron descritas por Gauss y son las siguientes:

1. Cualquier rayo que entre paralelo al eje óptico en una cara, sale a través del foco de la otra cara.
2. Cualquier rayo que pase por el foco de una cara, sale paralelo al eje óptico por la otra.
3. Cualquier rayo que entre por el centro de la lente no altera su trayectoria.
En la figura 3.14 se puede observar el proceso de formación de la imagen en una lente delgada, para lo cual se
proyecta un punto P, que dista D del centro de la lente O, sobre el plano sensor, como p. El cálculo de la distancia d
desde la lente al plano sensor viene determinada de forma unívoca por la intersección del rayo PQFcp, que cumple
la propiedad 1, con el POp que verifica la propiedad 3. Esto puede expresarse de forma matemática por la ecuación
fundamental de una lente delgada, o ecuación de Gauss (3.14).

54 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

1 1 1 (3.14)
+ =
d D f

Si se coloca el plano de imagen a otra distancia distinta de d la imagen aparecerá desenfocada, ya que el
punto P será proyectado como un círculo denominado círculo de confusión. Sin embargo al tener una apertura finita
aparece un problema nuevo y es que disminuye la profundidad de campo, ya que el objeto estará enfocado sobre el
plano.

[Link] Óptica con zoom

El empleo de una lente motorizada,


normalmente con zoom, enfoque e iris ajustable,
añade nuevas posibilidades al sistema óptico, pero
también más parámetros a controlar y por tanto
mayor complejidad. En el caso de metrología visual
es muy interesante incorporar ópticas motorizadas, ya
que éstas amplían el rango de tamaños que pueden
ser medidos. Sin embargo, algunas consideraciones
han de ser tenidas en cuenta a la hora de emplear este
tipo de lentes.
Figura 3.15: Modelo de lente gruesa.
Una óptica motorizada está compuesta de
numerosas lentes que se desplazan de forma conjunta para poder ajustar la magnificación o zoom y el enfoque,
véase [HECHT y ZAJAC, 1974] y [WALKER, 1998]. La aproximación más simple es considerar para cada una de
estas posiciones un modelo diferente de lente delgada, con parámetros intrínsecos diferentes. Reg WILLSON, en su
magnífica tesis doctoral, [WILLSON, 1994] construye unas tablas de estimación del modelo para cada valor de
enfoque, magnificación y también la apertura. Aunque el iris no debiera influir en la variación de los parámetros
intrínsecos, si lo hace, ya que al cerrarlo, se está empleando la parte más central de la lente, que es la que puede
tener menos imperfecciones. También se consigue un aumento de la profundidad de campo, es decir mayor rango en
el que permanecen los objetos enfocados. Otros autores emplean el modelo de lente gruesa que aparece en la figura
3.15, e incluso otros modelos. Como paso previo a la calibración geométrica de una lente con zoom, [TAREL, 1996]
emplea un modelo radiométrico para compensar las diferencias entre píxeles y propone aplicaciones de este modelo
a la detección de bordes y a otras técnicas 3D como shape from shading y reconstrucción 3D por correlación.

[Link] Óptica telecéntrica

Las lentes telecéntricas se describen con el


modelo de proyección ortográfica descrito en [Link]. En
[RODENSTOCK, 1998] se explica las características y
peculiaridades de este tipo de lentes para su utilización con
CCD. Su aplicación principal es para la medición directa
sin escala e inspección sin contacto, ya que reproduce los
objetos sin deformación de perspectiva, debido a que sólo
atraviesan los rayos que son paralelos al eje óptico. Debido
a esto último, las lentes tienen que ser tan grandes como
las piezas a observar. La profundidad de campo depende
de la apertura y debe seleccionarse en función de la
aplicación que se va a realizar. Debe tenerse muy en
cuenta la distancia al objeto a inspeccionar, ya que el
fenómeno de telentricidad se produce a una distancia muy
precisa.

Las lentes telecéntricas pueden ser internas o


externas. En la primera de ellas se consigue que se
proyecten los rayos paralelos al eje óptico colocando un
pin-hole justo a la distancia focal interna, es decir en el
foco. La lente telecéntrica externa se puede conseguir con Figura 3.16: Sistema de inspección basado en lentes
una óptica convencional colocando una apertura en el telecéntricas. Cortesía Zeiss.
exterior de la lente, de forma que se consiga que sólo

UPM-DISAMT-2000.31v1.0 55
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

entren los rayos paralelos al eje óptico [WATANABE y NAYAR., 1995]. En [GEAR 1998] utiliza el modelo de
lente telecéntrica para la realización de un algoritmo de correspondencia entre puntos de una secuencia de imágenes
en movimiento.

[Link] Óptica métrica

Son las empleadas en fotogrametría, se caracterizan por la gran pureza del cristal y su gran homogeneidad,
conseguido mediante un proceso de fabricación muy cuidadoso en el que el enfriamiento se ha realizado durante un
largo periodo de tiempo. En general, las ópticas métricas se comercializan junto con la cámara métrica, y el
fabricante se compromete a unas tolerancias determinadas mediante un certificado de calibración que se realiza en
un laboratorio. Esta calibración lo que determina son los parámetros intrínsecos de la cámara y la óptica. La
orientación externa de la misma la tendrá que determinar el usuario mediante puntos de control. La principal
clasificación de estas cámaras se realiza según la distancia a la que se encuentra el objeto a medir, dividiéndose en
cámaras métricas aéreas y cámaras métricas terrestres. En [GEARING, 1993] se explican los procedimientos
habituales para la medición de los parámetros de una óptica con elevada precisión.

[Link].1 Cámara métrica aérea

Los dos objetivos principales de la fotografía aérea son la fotogrametría y la fotointerpretación. Para lo
segundo, el principal requerimiento es la calidad de detalle de la reproducción, así que la nitidez y la resolución son
factores muy a tener en cuenta. En fotogrametría, sin embargo lo más importante es que tengan una geometría
precisa libre de distorsiones. Las cámaras aéreas deben montarse en una aeronave y debe por tanto soportar
condiciones duras de funcionamiento, frío o calor intenso, vibraciones, golpes, etc.

Se debe tener algunas consideraciones durante el momento de la captura de imágenes; el rumbo debe
determinarse con antelación, también deben programarse las pasadas que realizará el avión para determinar el
solapamiento que se producirá entre imágenes. Recuérdese que para obtener la tercera dimensión, cada detalle a
medirse debe aparecer al menos en dos imágenes.

[Link].2 Cámara métrica terrestre

Son las que se emplean en fotogrametría


de rango cercano. Al igual que las aéreas, su
geometría interna está calibrada en laboratorio,
mientras que la orientación externa hay que
determinarla mediante calibración [KRAUS,
1993]. Las tradicionales cámaras métricas que
aun se emplean por algunos nostálgicos utilizan
película fotográfica.

En [GODDING et al., 1997] se usa una


cámara métrica ROLLEI RSC de 4.500 por 4.500
pixeles para controlar la dinámica de un robot en
un volumen de trabajo de 3 m3 con una precisión
mayor de 0,1 mm.
Figura 3.17: Cámara métricas digitales. Cortesía Rollei.
[Link] Ópticas experimentales

Algunos investigadores intentan aportar mejoras en el tiempo de procesamiento de las imágenes actuando
sobre la óptica. Con este fin en mente, algunos han intentado imitar el comportamiento del ojo humano, que es un
ejemplo vivo de un sistema óptico, con un gran campo de vista y una retina de resolución variable en el espacio. El
ojo proporciona además una gran resolución en zona central o fovea y baja resolución en la periferia. El
proporcionar un gran ángulo de vista permite la localización de objetos y la determinación de trayectorias por flujo
óptico. No es necesario tener gran resolución para saber si un objeto se aleja o se acerca, si se desplaza para un lado
u otro. Sin embargo si lo es para determinar su posición.

Esta tarea es resuelta por el cerebro humano por fijación, es decir midiendo el desplazamiento que realizan
los músculos del globo ocular para situar el objeto en el centro de la mirada. En [KUNIYOSHI et al., 1995] se
describen unas lentes experimentales que proporcionan un gran campo de visión, y alta resolución en la fovea. Estas
lentes son empleadas para visión activa para robótica móvil en tiempo real en el Humanoid Interaction Lab del

56 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

E.T.L en Tsukuba, Japón. La determinación precisa de los objetos


se determina por fijación, al igual que en el ojo humano, para lo
cual se emplea un par estereoscópico como el Escher
[KUNIYOSHI et al., 1995].

A la hora de realizar mediciones tridimensionales por


fotogrametría, muchos son los investigadores que intentan eliminar
a toda costa la segunda cámara empleando diversos métodos.
Algunos emplean técnicas de visión artificial como las descritas en
el punto 2.4. Otros sin embargo han desarrollado curiosas y
originales ópticas experimentales o complejos sistemas de espejos
que hacen que la segunda cámara no sea necesario en determinadas
circunstancias. En [AHMED y AFIFI, 1999] se describe un nuevo
modelo de lente en anillo, figura 3.19, capaz de realizar
proyecciones sobre un único CCD como si se tratara de un par
estereoscópico. Con la sección transversal de esta lente se puede
apreciar que la lente se comporta como dos lentes delgadas,
produciendo en el mismo CCD dos proyecciones de un mismo
objeto. Figura 3.18: Imagen de Yasuo KUNIYOSHI
captada con la lente de su invención.

Figura 3.19: Planta y alzado de las lentes de [AHMED y AFIFI, 1999], izquierda. Proceso de formación de la imagen
estereoscópica con esta lente, derecha

3.3 Estimación del modelo

3.3.1 Introducción
El proceso de estimación del modelo del sensor es conocido habitualmente como método de calibración,
aunque en metrología esto se refiere a algo completamente diferente (véase el preámbulo de este capítulo). El
objetivo de este proceso es la determinación de los parámetros que definen el modelo y que se estudiaron en el punto
anterior. Este proceso de estimación se divide en tres etapas; la primera es la elección del modelo físico y por tanto
la determinación de las ecuaciones matemáticas que lo describen en 3.3.2. La segunda etapa es el trabajo de campo,
punto 3.3.3, por el cual se realiza una captura de imágenes proyectando puntos, cuya situación espacial es conocida
con elevada precisión, sobre el plano sensor, estableciendo una correspondencia unívoca entre puntos 3D del mundo
y puntos 2D sobre el plano sensor. En tercer y último lugar se realiza la estimación resolviendo un sistema de
ecuaciones por mínimos cuadrados no lineales, y tomando como objetivo minimizar el error cuadrático medio,
punto 3.3.4. El conocimiento de los parámetros de dos o más cámaras, permitirá la determinación de puntos
tridimensionales a partir de las medidas de los puntos correspondientes sobre los planos sensores. Esto último se
verá en 3.4.

En cualquier proceso de calibración de cámaras analógicas o digitales, se dispone de un objeto patrón, o


elemento de calibración o de referencia, del cual se conocen las coordenadas tridimensionales de algunos de sus
puntos. Estos se denominan puntos de calibración o puntos de control . Una vez elegido el modelo hay que estimar
los parámetros incógnitas. Para ello hay que capturar imágenes de un elemento de dimensiones conocidas, que tenga
UPM-DISAMT-2000.31v1.0 57
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

unos puntos bien definidos cuyas características se


puedan extraer de una forma sencilla. El proceso
global de estimación del modelo queda definido en
la figura 3.20, en la que se distinguen dos fases, la
primera es la extracción del denominado fichero de
calibración como resultado del trabajo de campo y
la segunda es la estimación de los parámetros.

El primer paso consiste en obtener los


ficheros de puntos de control tomando algunas
imágenes de este elemento. Al tomar una imagen,
se realiza una proyección perspectiva que
convierten las coordenadas 3D del mundo en
coordenadas 2D de la cámara. El objetivo de esta
primera etapa es obtener mediante métodos
Figura 3.20: Tareas a realizar en el trabajo de campo y estimación
del modelo
computacionales de Visión artificial las
coordenadas 2D de la cámara y obtener unos
ficheros de puntos de control. Estos ficheros contienen datos numéricos dispuestos en cinco columnas y tantas filas
como puntos de control haya. Las tres primeras columnas corresponden a las coordenadas (Xw,Yw,Z w) o coordenadas
del mundo de cada uno de los puntos de control, mientras que las dos últimas corresponden a las coordenadas en la
cámara (Xd,Yd).

El segundo paso del proceso de calibración consiste en calcular los parámetros intrínsecos y extrínsecos
del conjunto cámara, óptica y digitalizador. Tal y como se verá en [Link], se emplean las ecuaciones de
colinealidad, y ya que, debido a las distorsiones, estas ecuaciones son no lineales, deben ser linealizadas, y mediante
métodos de mínimos cuadrados lineales, obtener una solución. Esta manera de resolver las ecuaciones tiene todos
los problemas inherentes a la resolución por mínimos cuadrados como son la dificultad de obtener una solución
robusta debido a que el problema suele estar mal condicionado. Una solución adecuada se obtiene realizando una
optimización de los residuos, siendo el método más empleado el de LEVENBERG-MARQUARDT descrito en [DE
LA FUENTE, 1993].

A este método de resolución de los parámetros intrínsecos y extrínsecos a partir de los puntos de control se
le suele denominar en la bibliografía sajona "Bundle Adjust Method" o método de ajuste del haz luminoso, ya que
en sus orígenes, la fotogrametría sólo era aplicada a cámaras fotográficas, se decía que había que ajustar el haz de
luz al camino que teóricamente debería recorrer en la óptica, y que no lo hacía debido a las distorsiones de ésta. Se
pretendía mediante métodos matemáticos corregir estas desviaciones intentando modelar la óptica de la mejor forma
posible.

Figura 3.21: Modelo Pin-hole y nomenclatura de ejes empleados.

3.3.2 Formulación y parámetros del modelo


Los parámetros que definen el proceso de transformación de una imagen y por tanto el modelo elegido, se
clasifican en parámetros intrínsecos y extrínsecos. Los intrínsecos representan el comportamiento interior de una

58 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

cámara u otra, mientras que los parámetros extrínsecos, son los que determinan la posición de la cámara respecto de
un sistema de coordenadas del mundo.

[Link] Parámetros intrínsecos

Como se ha venido diciendo reiteradas veces, el modelo pin-hole con distorsión ofrece un buen ajuste con
la realidad en la mayor parte de los casos. Este modelo, representado en la figura 3.11, queda definido básicamente
por las ecuación (3.2), que se reescribe de acuerdo a las figura 3.11 en la ecuación (3.15), donde (xc ,yc ,zc)
representa el punto del mundo en coordenadas de la cámara y (xu ,yu) es la proyección de dicho punto en
coordenadas descentrales del sensor sin distorsión.

x 
nx u  f 0 0 0  c 
ny  = 0 (3.15)
0 0 ⋅  c 
y
f
 u    zc 
 n   0 0 1 0  
1

En esta ecuación solamente se tiene un único parámetro de la geometría interna de la cámara, que es la
distancia focal f. Sin embargo hay otros parámetros internos de interés, como son los introducidos en la ecuación
(3.16). Suponiendo que no se tiene distorsión alguna, las coordenadas de puntos medidos en una imagen se dan en
coordenadas laterales (xf ,yf), véase la figura 3.11 y 3.21. Las coordenadas laterales se dan además en pixeles, por lo
que hay que multiplicar por un factor de escala kx y ky para convertir de píxeles a milímetros. Lógicamente estos
factores de escala se pueden calcular a partir de la información del fabricante del CCD. Si se dispone de ella, ya que
esta información suele ser muy precisa, estos dos parámetros se puede dejar como constante. Posteriormente se
realiza una traslación sobre el plano del sensor desde la esquina hasta el centro de la imagen o punto principal,
determinado por las coordenadas (Cx ,Cy). Este suele no coincidir con el centro geométrico del sensor debido,
principalmente al desalineamiento del acoplamiento de la óptica con el sensor. Téngase en cuenta que el punto
principal es la intersección del eje óptico con el plano sensor.

x f = k x xu + Cx (3.16)
y f = k y yu + C y

Algunos autores suponen que el CCD no es rectangular sino trapezoidal, e introducen como parámetro el
seno del ángulo superior izquierdo, que en cualquier caso es próximo a 90º. Algunos justifican la introducción de
este parámetro adicional para evitar inestabilidades en el proceso de ajuste.

[Link] Parámetros extrínsecos

Finalmente los objetos del mundo suelen estar referidos a un centro de coordenadas del mundo fijo,
representado por (Xw ,Yw ,Zw ). Téngase en cuenta que en el caso de imágenes aéreas, cada toma es realizada desde un
punto distinto en el espacio por una misma cámara, así que hay que referir el centro de coordenadas de la cámara (Xc
,Yc ,Zc) al centro de coordenadas del mundo para cada imagen. Para ello hay que resolver, lo que se denomina la
geometría externa, es decir, calcular los parámetros extrínsecos, que no es más que calcular las tres rotaciones y las
tres traslaciones necesarias entre dos sistemas de referencia. La matriz de transformación, viene representada en la
ecuación (3.17), donde existe una dependencia entre los seis parámetros de rotación, realmente solo se tienen seis
incógnitas, no nueve.

 xc   r11 r12 r13 t x   xw 


 y  r r r23 t y   yw 
 c  =  21 22 ⋅ (3.17)
 zc  r31 r32 r33 t z   zw 
     
1   0 0 0 1  1 

Finalmente combinando las ecuaciones (3.15), (3.16) y (3.17) se llega a la ecuación (3.18), donde se calcula
la matriz de proyección M4x3 , que transforma un punto espacial en coordenadas del mundo, a un punto sobre el
sensor en coordenadas laterales en pixeles. Para estimar estos parámetros se emplean métodos de resolución de
mínimos cuadrados que se describen en 3.3.4

UPM-DISAMT-2000.31v1.0 59
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

 xw   r11 r12 r13 tx   x w   xw 


nx f    kx f 0  m11 m12 m13 m14   
t y   yw 
0 Cx
ny  = M  yw  =  0 ky f Cy 0 ⋅  21
r r22 r23
⋅  = m m22 m 23 m 24  ⋅  w 
y
(3.18)
 f  zw    r r32 r33 tz   z w   21  z 
 n     0 0 1 0  31    m 31 m32 m 33 m34   w 
1 0 0 0 1  1  1

[Link] Parámetros con distorsión

En el caso de considerar las distorsiones, se tendrá en cuenta la ecuación (3.8). Además la ecuación (3.16)
quedará como se expresa en (3.19). Ahora la ecuación (3.18) se verá modificada por la fuerte no linealidad que
introducen la distorsión y se suele expresar según las ecuaciones (3.20), que en el mundo de la fotogrametría son
conocidas como ecuaciones de colinealidad. Téngase en cuenta que los términos Dx y Dy pueden ser los de la
ecuación (3.12) o el de otros modelos de distorsión publicados por otros autores [BEYER, 1992].

x f = kx xd + C x
y f = k y yd + C y
(3.19)

r11 x w + r12 y w + r13 z w + t x


x f = C x + k x Dx + k x f
r31 xw + r32 y w + r33 z w + t z
(3.20)
r21x w + r22 y w + r23 z w + t y
y f = C y + kyDy + ky f
r31 x w + r32 y w + r33 z w + t z

3.3.3 Trabajo de campo


En fotogrametría se suele entender como trabajo de campo las tareas realizadas previamente al hecho de
medir. En el caso de fotogrametría aérea, lógicamente, este trabajo consistirá exclusivamente en la captura de las
imágenes por una aeronave (véase [Link]). Los puntos de control se tomarán de puntos geodésicos o de puntos
conocidos que deberán superponerse en varias imágenes.

Para el caso de
fotogrametría cercana el trabajo de
campo, además de realizar la captura
de las imágenes, habrá que situar en
el objeto a medir una serie de
elementos cuya posición espacial se
pueda determinar por otros medios.
Habitualmente se emplea un
teodolito para marcar la posición de
los puntos de control necesarios para
estimar el modelo de la cámara.
Suelen emplearse pegatinas con
formas varias, véase figura 3.22. En
el capítulo 5 de la presente tesis se
Figura 3.22: Izquierda. Elementos empleados habitualmente en fotogrametría describe un trabajo de fotogrametría
cercana para marcar los puntos de control. Derecha, elemento empleado en cercana aplicado a la medición de
proyecto fotogramétrico descrito en el punto 5.6.2 de la presente tesis
grandes piezas industriales

En fotogrametría industrial en línea, en realidad no se va a medir piezas, es más correcto decir que se va a
monitorizar ciertas dimensiones de las piezas que se están produciendo. El trabajo de campo se puede entender
como todo lo que se realice previamente a este proceso de monitorización. Las tareas a realizar están representadas
de forma esquemática en la figura 3.20.

[Link] Elementos de referencia

El elemento de referencia es una pieza clave a la hora de obtener resultados precisos en la medida. Es
habitualmente un elemento tridimensional, en el cual destacan una serie de puntos, de los cuales se conoce su
posición espacial. Estos se denominan puntos de control. Al captar el elemento en una imagen, un algoritmo de
extracción de características localiza los puntos y los reconoce, estableciendo una asociación entre coordenadas del
mundo (xw, yw, zw) y coordenadas de la imagen (xf, yf) para cada uno de los puntos.

60 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Además de la importancia de ser capaz de extraer los puntos de control con precisión subpíxel, también es
importante que el elemento de calibración esté construido con buena precisión. Tanto las incertidumbres de las
coordenadas del mundo como las del algoritmo de extracción de características, afectarán al cálculo de los
parámetros intrínsecos y extrínsecos con fidelidad, y estos a su vez en la precisión total a la hora de medir con un
sistema de metrología visual.

Aunque normalmente en un ambiente industrial no se va a tener una gran estabilidad en los factores
externos, sin embargo, para conseguir una buena precisión es importante que el trabajo de campo se realice en un
ambiente controlado con humedad y temperatura estables. Tanto las cámaras como el elemento de calibración
deberían estar aislados de cualquier vibración, por pequeña que está sea, así que idealmente se deberían colocar
todos estos elementos en una mesa antivibración.

El elemento de calibración deberá


construirse con un material de bajo coeficiente de
dilatación y ser lo más robusto posible para que
no sufra deformaciones en su manipulación. Lo
más común es que el elemento de calibración lo
forme uno o varios planos sobre los cuales se
serigrafía figuras geométricas de forma conocida.
Como puntos de control se suelen tomar los
vértices o los baricentros de estas figuras
geométricas. Sin embargo, en [HEIKKILÄ y
SILVEN, 1997] se demuestra que el centro de
gravedad de una figura geométrica plana no es un
invariante ante una transformación proyectiva, y
por tanto no debe emplearse, ya que se introduce
un error considerable en su localización subpíxel.
Si es recomendable emplear los vértices de
polígonos como cuadrados, ya que estos definen
claramente un punto que por su propia definición
es invariante al proyectarse. Figura 3.23: Elemento de calibració[Link]ía Photomodeler
EOS-SYSTEM.
[FAN y YUAN, 1993] emplea un
elemento plano construido en mármol sobre el cual están pegados paralelepípedos de distintas alturas pero de
idéntica base, construidos también en mármol. Sobre la cima de cada paralelepípedo tiene serigrafiado un cuadrado.
Sin embargo, los puntos de control los forman los centros de los cuadrados obtenidos como la intersección de las
diagonales de cada cuadrado. De este modo no se tienen el problema que se comentó anteriormente.

[Link] Elemento de referencia empleado

Consiste en un elemento físico con una serie de puntos característicos cuyas coordenadas referenciadas a un
punto concreto son conocidas y muy precisas. Así mismo, en la fabricación de un elemento de calibración debe
tenerse muy en cuenta que tanto el origen de coordenadas como los puntos de control puedan detectarse de manera
más o menos sencilla y con bastante precisión por métodos de visión artificial

Por ejemplo, en la figura 3.24 se puede apreciar el elemento de calibración en forma de cubo empleado en
la presente tesis doctoral. Éste es el que comúnmente se emplea en el laboratorio. Las cuatro esquinas de cada uno
de los cuadrados negros que tiene cada cara, son los puntos de control. En este caso con las tres caras se obtienen
300 puntos. De todos ellos es conocida las coordenadas (Xw,Yw ,Zw ) o coordenadas del mundo, referenciadas por el
triedro ortonormal
directo centrado en el
vértice del cubo. Así
tomando como origen
de coordenadas este
vértice, el eje Xw iría
hacia abajo, Yw hacia
la izquierda y Zw hacia
la derecha.

Figura 3.24: Elemento de calibración y extracción de puntos de control.

UPM-DISAMT-2000.31v1.0 61
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

[Link] Procesamiento de las imágenes

El procesamiento que se aplique dependerá principalmente del diseño del elemento de calibración que se
haya elegido. Además, otros factores deben ser tenidos en cuenta como iluminación y situación del cubo, así como
factores que afecten a la estabilidad. Para la presente tesis se ha elegido el cubo blanco con cuadrados negros de la
figura 3.24. Para el cálculo de los puntos de control se tratará de obtener las esquinas de los cuadrados negros con la
mayor precisión posible. Para ello se emplearán una técnica subpíxel descrita en [GARCÍA, 1994].

Las técnicas subpíxel, como su propio nombre indica, permite obtener puntos característicos de una imagen
con mayor resolución de la que dispone el propio CCD. Así, si un borde se encuentra entre dos pixeles, haciendo
una interpolación de los niveles de gris se obtendría la situación real del mismo. Esto es una simplificación de lo
que podría ser una técnica subpíxel. En realidad se ha escrito mucho, y existen infinidad de métodos para todo tipo
de casos. En la tesis doctoral [REINOSO, 1996] se realiza un profundo estudio de técnicas subpixel.

En la figura 3.24 se aprecia un ejemplo de procesamiento de imágenes con el fin de obtener los puntos de
control. En la figura central se ha realizado una segmentación y en la derecha una búsqueda de esquinas. Esto
proporciona las coordenadas 2D de los puntos pero de manera poco precisa. Sin embargo, estos valores son una
buena semilla para realizar una interpolación subpíxel en la imagen original.

Una vez obtenidos los puntos, hay que realizar un etiquetado de estos y referenciar todos ellos al origen de
coordenadas que también debe buscarse por métodos adecuados a cada caso. Una vez hecho esto, la siguiente tarea
será la de asociar las coordenadas del mundo de cada punto de control con las coordenadas 2D en la imagen. Para
ello, el método utiliza información que se le debe haber introducido previamente sobre las dimensiones físicas del
elemento de calibración.

[Link] Generación del fichero de calibración

Ésta es la finalidad en la primera fase de la estimación del modelo. Ya se tienen todos los puntos de control,
ahora, ¿cómo se almacenan para su interpretación en la siguiente fase? Se ha dispuesto un sencillo formato para el
almacenamiento de esta gran cantidad de datos de forma ordenada. Todos los métodos de cálculo de parámetros de
calibración utilizan como entrada los puntos de control dispuestos en este formato.

Figura 3.25: Porción fichero calibración.

En la figura 3.25 se puede apreciar una parte de un fichero de calibración. Cada fila indica un punto de
control. De izquierda a derecha, las tres primeras columnas corresponden a las coordenadas del mundo (Xw,Yw ,Zw ),
mientras que las dos últimas corresponden a las coordenadas en la cámara (Xd,Yd).

Mientras que las coordenadas del mundo se expresan en milímetros, las de la cámara son expresadas en
pixeles. Como se puede apreciar en la tabla, estas se obtiene con precisión subpíxel. La posición 3D de los puntos de
control se obtiene del conocimiento previo del elemento de calibración. La tarea más importante del programa de
generación de los ficheros de calibración es la de asociar correctamente cada punto de control real al de la figura en
la imagen, ya que de otra forma no tendría validez alguna el fichero.

3.3.4 Métodos de estimación


Se denomina método de estimación al algoritmo de recuperación de los parámetros que definen el proceso
de formación de una imagen, definido por el modelo de proyección elegido y descrito con todo detalle en el punto
3.2. El objetivo final de la calibración es localizar puntos en el espacio 3D, que se proyectan sobre la superficie 2D
de la cámara. Se pretende así la recuperación de la escena tridimensional, para poder realizar tareas de medición o
reconocimiento. Las técnicas de recuperación de la escena 3D se verán en el punto 3.4.

62 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Conviene señalar que la palabra “calibración” tiene un significado muy distinto en metrología dimensional,
donde calibrar se refiere a la corrección que se debe realizar a un mensurando para llevarlo lo más próximo a su
valor real. Lógicamente la calibración debe realizarse por un laboratorio de certificación o por un aparato de mejor
calidad, con menor incertidumbre, y ésta se deberá propagar en el resultado final. Sin embargo, se empleará la
palabra “calibración”, refiriéndose a ajuste del modelo (metrológicamente hablando) por ser así referido en la
bibliografía universal de Fotogrametría y Visión artificial.

El problema de calibrar una cámara se reduce a la resolución de un sistema de ecuaciones no lineales


compatible y sobredeterminado, sobre el cual hay que aplicar ciertas restricciones para poder obtener una solución
coherente. No es un problema sencillo, ya que por lo general se tienen sistemas de ecuaciones mal condicionados.
Aun, actualmente este tema da lugar a numerosas publicaciones y artículos en revistas científicas. Fue investigado
inicialmente en Fotogrametría, desde que ésta comenzó a dar sus primeros pasos el siglo pasado (véase 2.3.1:
Historia de la Fotogrametría), pero no fue hasta los años 80 que despertó la atención de la comunidad científica
dedicada a la investigación de los temas de Robótica y Visión artificial.

Así en estas últimas dos décadas se han desarrollado numerosas técnicas que se pueden clasificar en dos
categorías; los métodos basados en el modelo, con significado físico y los métodos basados en el modelo,
únicamente con significado matemático. La formulación matemática de estos métodos, así como una comparativa en
cuanto a su precisión puede encontrarse en el proyecto fin de carrera desarrollado en DISAM [GONZÁLEZ, 1994].

Los métodos de calibración empleados en Robótica y Automatización son métodos rápidos y autónomos, y
deben ser capaces de compensar muchos factores que de forma sistemática causan errores como son los
convertidores A/D y las inconsistencias de los elementos de la matriz de CCD. Las técnicas de calibración que han
sido desarrolladas pueden clasificarse en dos categorías: las que pretenden resolver el sistema que se obtiene al
considerar un modelo de la cámara con significado físico y la que plantea un sistema basado en un modelo con
significado matemático.

Las técnicas basadas en un modelo con significado físico son las que se van a emplear. Utilizan el modelo
pin-hole de cámara descrito en el punto 3.2, y persiguen obtener el valor de una serie de parámetros con significado
físico como son; la distancia focal, el centro óptico y la orientación y posición de la cámara. Los algoritmos
desarrollados pueden a su vez ser clasificados en:

Transformación Lineal Directa (DLT) y Transformación de Matriz de Perspectiva (PTM). Estos métodos
realizan la calibración en dos pasos. En primer lugar se calculan los elementos de la Matriz de Perspectiva M, matriz
que relaciona las coordenadas 3D de un punto en el sistema de coordenadas del mundo (WCS) con las coordenadas
2D en pixeles de la proyección de ese punto en el plano de la imagen. A partir de esta matriz se obtienen los
parámetros intrínsecos y extrínsecos. Puede ser resuelto mediante ecuaciones lineales, y puede adoptar diferentes
modelizaciones para la distorsión y el error.

Restricción de Alineamiento Radial (RAC). Este método incorpora únicamente la Distorsión Radial, de
forma que aunque el punto que se obtiene en la imagen esté distorsionado se mantiene la relación de la ecuación
(3.21) en la cual se basa para realizar los cálculos. Se necesita conocer inicialmente una serie de parámetros. Se
obtienen el resto de parámetros de forma lineal, para luego optimizar a partir de estos datos con métodos no lineales.
Los inconvenientes más destacables de este método son; sólo se puede modelar la distorsión radial y la necesidad de
un conocimiento previo de parte de los parámetros intrínsecos. Uno de estos métodos es el conocido método de
TSAI.

Xu Xd (3.21)
=
Yu Yd

Puntos de Desvanecimiento (Vanishing-Point). Esta técnica utiliza la información que sobre la proyección
efectuada, tienen los puntos de la imagen que se corresponden con los puntos impropios de tres juegos de rectas
paralelas y ortogonales entre sí en el espacio. La ventaja de este método es que se calculan separadamente los
parámetros intrínsecos y los extrínsecos. A partir de los parámetros obtenidos se puede realizar una optimización no
lineal en la que se puede incorporar cualquier modelo de distorsión. El principal inconveniente es la necesidad de
que los puntos de calibración sean tomados con exactitud para realizar una buena estimación de los puntos de
desvanecimiento.

UPM-DISAMT-2000.31v1.0 63
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

En este punto se hace un recorrido histórico en los últimos años de los métodos de estimación del modelo.
Seguidamente se habla de las técnicas basadas en modelo físico y las técnicas basadas en el modelo matemático.
Finalmente se describe el método de TSAI y el DLT, que son los dos métodos tradicionalmente más utilizados en
calibración. Tras ellos se analiza el llamado método en dos pasos, que primero utiliza el procedimiento DLT para
obtener una primera estimación de los parámetros y, a continuación, realiza una optimización no lineal mediante el
método de Levenberg-Marquardt. Este último es el empleado en la presente tesis doctoral.

[Link] Evolución histórica en la estimación del modelo

[MAGEE y AGGARWAL, 1984] describe un algoritmo para la determinación de los puntos de


desvanecimiento una vez que se hayan determinado los segmentos de una imagen. El planteamiento es muy
interesante por no tener casos degenerados y las operaciones a efectuar son muy sencillas. Además se elimina la
necesidad de conocer la distancia focal, eliminando tediosos procedimientos de calibración.

[TSAI y LENZ, 1989] describe una interesante técnica para realizar la calibración extrínseca de una cámara
que cambia su posición. Para ello calcula la situación espacial y orientación de una cámara solidaria a la pinza de un
robot manipulador. Este método fue más simple y rápido de los existentes en la época empleando cámaras
convencionales.

[WANG y TSAI, 1991] se plantea un nuevo método de calibración empleando las líneas de
desvanecimientos. Se emplea un hexágono como elemento de calibración para generar una línea de desvanecimiento
sobre el plano de tierra de la imagen proyectada. La simplicidad del elemento de calibración hace que el proceso de
extracción de características sea simple.

[CHEN y JIANG, 1991] describen un procedimiento de calibración de cámaras basado en el método de los
puntos de desvanecimiento. No se precisa conocimiento de la localización precisa del objeto de calibración.

[BEYER, 1992] describe el proceso de calibración desde un punto de vista fotogramétrico. Para ello
propone un modelo de distorsión muy complejo, con tres parámetros para la distorsión radial y dos para la
descentral, que permite alcanzar una precisión de 1/46 del tamaño del pixel, trazado mediante la utilización de un
teodolito.

[WENG et al.,1992] propone un método de calibración en dos pasos, un primer paso lineal y un segundo
mediante una optimización no lineal en el que se tienen en cuenta las distorsiones radiales y descentrales.

[TAN et al., 1992] ataca a FAUGERAS y TOSCANI por las críticas realizadas contra los métodos de
calibración PTM (Perspective Transformation Matrix) por producir soluciones insatisfactorias y a veces absurdas.
Demuestra que el método tradicional es superior en inmunidad ante el ruido y coste computacional. Para realizar la
comparación somete a los dos sistemas a una simulación con el método de Monte Carlo.

[ZHANG et al.,1992] plantea una variante PTM y realiza un interesante estudio de la propagación de la
incertidumbre con el fin de estimar el error de medida de un sistema fotogramétrico.

[LAI, 1992] demuestra teóricamente y mediante simulación que, tanto la estimación del centro de la
imagen como la distorsión, no afecta significativamente a la precisión de las medidas.

[CHETTRI, 1992] emplea el método DLT (Direct Linear Transformation) para resolver la calibración por
mínimos cuadrados lineales. Realiza una comparación entre varios métodos analizando su precisión

[TARABANI et al.. 1992] Plantea un sistema de metrología visual adaptativo, empleando una cámara con
óptica motorizada y recuperando los parámetros de calibración para distintas configuraciones de zoom, apertura y
enfoque.

[PÖLZLEITNER y ULM, 1993] trabajan con una secuencia de imágenes tomadas por un satélite para
estimar la posición de éste, ayudándose de ciertas marcas en tierra. Se expone un nuevo método para estimar la
posición de la cámara o calibración extrínseca, y éste es comparado con otros 12 métodos existentes, siendo el
método propuesto el que da una mejor convergencia, mejor precisión y resultando solamente un poco más costoso
computacionalmente, que el de FAUGERAS y TOSCANI.

[FAN y YUAN, 1993] describen un nuevo método de calibración, el DLTEA-II basado en el método DLT.
En este método emplea un polinomio de grado tres para compensar el error debido a la no-linealidad que introducen
64 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

las distorsiones. En experimentos realizados, se demuestra que un sistema estéreo de cámaras comerciales de 512 x
512 calibradas mediante este algoritmo consiguen una precisión de 1/10.000 en un campo de vista de 300 x 300 mm
y sobre una profundidad de 0,8 a 0.9 m. Realiza una comparativa con otros métodos obteniendo mejores resultados.

[MASHMOUDI et al., 1993] presenta un método de calibración en dos pasos con un tercer paso de
optimización con el conjunto de parámetros para intentar minimizar el error cuadrático medio.

[WILLSON y SHAFER, 1993] Realiza la calibración de lo que él denomina cámara dinámica , es decir una
cámara con óptica motorizada. Para ello emplea el método de calibración en dos pasos utilizado por TSAI y
construye una tabla de calibración para diversas posiciones del zoom, enfoque e iris. Explica un procedimiento
empírico para recuperar los parámetros de calibración de posiciones intermedias.

[LAVEST et al., 1993] realiza la recuperación de la escena tridimensional con una única cámara fija dotada
de óptica motorizada. Para ello emplea el modelo de lente gruesa en vez del tradicional modelo pin-hole,
demostrando mediante resultados experimentales que este modelo es más adecuado para este tipo de ópticas. Sin
embargo, se destaca que el modelo pin-hole puede emplearse para una óptica motorizada siempre y cuando la
distancia entre el objeto y la imagen se considere fija.

[MENTES y ROI, 1993] Acoplan a un teodolito motorizado una cámara CCD con óptica motorizada con la
que realizan medidas precisas 3D. Realizan experimentos de precisión sobre patrones compuestos por círculos y
cruces situados a distancias de entre 6 y 30 m. Las medidas se realizan a cielo abierto. Se orienta el teodolito de
forma manual con una palanca de control de forma que el objeto al que se apunta quede justo en una cruz situada en
el centro de la imagen. La incertidumbre alcanzada no es muy alta, tan solo de 0,1 mm, pero puede ser suficiente
para un gran número de aplicaciones.

[WALLNER et al., 1993] presenta un método de calibración para un cabezal estereoscópico, basado en la
observación de un objeto conocido mientras se modifica la posición de la cámara o de las lentes.

En fotogrametría se suelen situar marcas sobre el objeto a medir con el fin de localizarlas fácilmente y
buscar puntos correspondientes. [CHEN et al., 1993] desarrollan un algoritmo para realizar la correspondencia de
estas marcas entre dos o más imágenes. Se emplea la restricción que plantea el plano epipolar, en lugar de la típica
restricción de la línea epipolar.

[HECKEL, 1993] Presenta un escáner láser de digitalización por punto para medir el ángulo en el proceso
de fabricación de perfiles metálicos. El haz es desplazado por dos galvanómetros en configuración x-y. Se hace un
interesante estudio de las consideraciones sobre la sincronización entre la cámara, el sistema de adquisición de
imágenes y el servo de los galvanómetros. También se propone un método para localizar la traza láser con precisión
subpíxel. La precisión alcanzada en la medida de los ángulos de los perfiles es de ±0,03°.

[LI et al., 1994] Realiza un interesante estudio sobre la calibración cinemática de un cabezal estéreo con
óptica motorizada de 12 grados de libertad. Realiza una comparación de los métodos existentes, plantea la
formulación matemática necesaria y propones nuevas soluciones.

[WILLSON, 1994] En su magistral tesis doctoral hace un completo estudio de la calibración de una cámara
con óptica motorizada, a través de una tabla de consulta. En esta obra se plasman algunos de las conclusiones
alcanzadas en una publicación anterior [WILLSON y SHAFER, 1993]. Además realiza un análisis detallado del
error alcanzado con esta configuración.

[TARABANI et al. 1994] Realiza la calibración cinemática de una cámara con óptica motorizada en
configuración brazo-ojo. Calcula tablas de consulta para recuperar los parámetros intrínsecos y extrínsecos del
sistema de visión en función de la posición de los motores paso a paso. Diseña una serie de experimentos para
determinar la geometría interna de la óptica motorizada y calcular sus parámetros, considerando para ello el modelo
de lente gruesa.

[MASHMOUDI et al., 1995] propone un método de calibración de cámaras teniendo en cuenta las
distorsiones radiales, tangenciales y descentrales. Aplica una ponderación del tipo factor de olvido en la función a
minimizar, obteniendo de forma experimental un valor adecuado para dicho parámetro. Aplica la calibración al par
estereoscópico HINESIVE, construido en la universidad de Valladolid.

UPM-DISAMT-2000.31v1.0 65
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

[Link] Técnicas basadas en el modelo físico

Por lo general estos métodos emplean el modelo pin-hole derivado de la óptica geométrica, o alguna de las
simplificaciones vistas en el capítulo anterior, donde los parámetros tienen significado físico, como la distancia focal
o el centro de la imagen.

[Link].1 Métodos clásicos

Son los empleados en fotogrametría basados en las ecuaciones de colinealidad y resueltas mediante el
método denominado ajuste del bloque del haz luminoso (Bundle Block Adjustment) [ATKINSON, 1996], [KRAUS,
1993]. Se suelen proponer complejos sistemas de ecuaciones no lineales para modelar las distorsiones. Se necesita
por tanto una optimización no lineal, pero se necesita un valor inicial bastante aproximado. Esto es posible en
fotogrametría por que se tiene conocimiento de la geometría interna de las cámaras métricas, pero en Visión
artificial esto es un problema, y estos métodos son bastante inestables, conduciendo a soluciones erróneas.

[Link].2 DLT y PTM

[ABDEL-AZIZ y KARARA, 1971] desarrollaron por primera vez el método DLT o Transformación Lineal
Directa (Direct Linear Transformation). Los parámetros a determinar no son los intrínsecos y extrínsecos sino la
combinación de los dos, denominados “parámetros L” que pueden calcularse por una ecuación lineal.
Posteriormente [KARARA, 1979] amplió el método teniendo en cuenta las distorsiones ópticas. El método PTM es
muy similar al DLT, pero tienen muchas ventajas computacionales. Debido a simplicidad de estos métodos y al
razonable buen resultado que se alcanza, han sido empleados con éxito por un gran número de investigadores (en
[Link] se citan algunos). Como en los métodos clásicos, es posible aplicar diferentes modelos de distorsión y
compensación de error del algoritmo.

[Link].3 Métodos en dos pasos

La principal idea de este tipo de métodos es evitar la inestabilidad de la optimización global de los métodos
clásicos, dividiendo el cálculo en dos pasos. El método más representativo es la técnica de Tsai “Two-stage” (dos
pasos) basada en la restricción de alineamiento radial (RAC) [TSAI, 1986]. En este algoritmo se calcula una
solución de forma directa por ecuaciones lineales y posteriormente se realiza un ajuste fino mediante iteraciones. El
método es eficiente pero algunas de sus desventajas son que la solución no es óptima, solamente se tiene en cuenta
la distorsión radial y el método es demasiado dependiente de la semilla inicial del factor de escala.

[Link].4 Punto de desvanecimiento

Ya que los puntos de desvanecimiento contienen la información de la proyección perspectiva, se pueden


calcular la geometría interna de la cámara por restricciones basadas en estos, obtenidos de conjuntos ortogonales de
líneas paralelas. La ventaja de este método es que se separa el cálculo de los parámetros intrínsecos de los
extrínsecos. Sin embargo la precisión es baja (1/500 – 1/1000) debido principalmente a que tanto el cálculo de los
puntos de desvanecimiento como las ecuaciones de restricción son dependientes de la forma del objeto de
calibración y muy sensibles al ruido en la imagen. Además las distorsiones ópticas son difíciles de aplicar

[Link] Técnicas basadas en el modelo matemático

En esta categoría no existe un modelo matemático, todos los parámetros solamente tienen significado
matemático. [MARTINS et al., 1991] presenta un método de este tipo denominado el método de los dos planos, en
el que la idea básica es que los puntos del espacio y sus correspondientes en el plano de la imagen, no están unidos
entre sí por el haz proyectivo, sino por dos planos de calibración basados en una interpolación matemática. De esta
forma se consigue que el procedimiento de cálculo sea lineal y las distorsiones se compensan por interpolación. Sin
embargo, mucho otros problemas de errores sistemáticos son difíciles de incorporar a la interpolación global.

[Link] Método TSAI, método de la restricción radial

Este método, desarrollado en [TSAI, 1986], emplea un modelo de distorsión que sólo tiene en cuenta la
distorsión radial, de tal modo que las coordenadas de la imagen con distorsión (Xd, Yd) permanecen alineadas con las
coordenadas de la imagen sin distorsión (Xu, Yu) y con el punto principal, como se observa en la figura 3.11.

El modelo de distorsión empleado combina la ecuación (3.8) con (3.22):

66 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Dx = X d (k 1r 2 + k 2 r 4 + ....)
D y = Yd (k 1r 2 + k 2 r 4 + ....)
(3.22)

r= X d2 + Y d2

Con este método se pretende calcular los parámetros extrínsecos: r1, r2, r3, r4, r 5, r6, r7, r8, r 9, tx, ty, tz como
parámetros extrínsecos, además de f, k1, kx, ky, Cx y Cy como parámetros intrínsecos, véase ecuación (3.17). Existen
dos formas de resolver el problema, dependiendo de si los puntos de calibración se encuentran todos en el mismo
plano (caso coplanar) o si están distribuidos por un volumen (caso no coplanar).

[Link].1 Calibración TSAI con puntos coplanares

Se puede elegir el Sistema de Coordenadas del Mundo de tal modo que todos los puntos del plano de
calibración tengan Zw=0. Se considera conocido en esta calibración el centro de la imagen (que se toma igual al
centro del buffer de almacenamiento) y los factores de escala. En un primer momento se supone que no existe
distorsión. La ecuación resulta:

Xu x 
= 
Yu y  X x X r x +r y +t (3.23)
→ d = → d = 11 w 12 w x
Xu Xd  Y y Y r21 x w + r22 y w + t y
=  d d
Yu Yd 

Este sistema es lineal y puede resolverse por mínimos cuadrados lineales tomando un número suficiente de
puntos. De este modo se logra calcular R, tx y ty. Suponiendo ahora que existe distorsión radial se llega a:

r11 x wi + r12 y wi + r13 z wi + t x


X di + k 1 r 2 X di = f
r31 x wi + r32 y wi + r33 z wi + t z
r21 x wi + r22 y wi + r23 z wi + t y (3.24)
Y di + k 1 r 2 Y di = f
r31 x wi + r32 y wi + r33 z wi + t z
r= X di2 + Y di2

Se tiene un sistema no lineal en el que hay tres incógnitas f, k1 y tz y 2n ecuaciones para su resolución (n
número de puntos de control). Para resolver este sistema se va a realizar una primera aproximación en la que se
obtendrá la distancia focal f y el elemento del vector de Traslación tz sin considerar la distorsión. Y posteriormente
se desarrollará un cálculo iterativo con los valores obtenidos en el paso previo como valores iniciales, y suponiendo
un coeficiente de distorsión inicial igual a 0.

[Link].2 Calibración TSAI no coplanar

Se aplica cuando es desconocido el factor de incertidumbre de escala sx. Como en el caso anterior es
conocido el centro de la imagen. En un principio la ecuación sin distorsión ahora resulta:

Xd r x +r y + r z +t
= 11 w 12 w 13 w x (3.25)
s x Yd r21 x w + r22 y w + r23z w + t y

Ahora aparece la componente zw y esto va a permitir calcular una incógnita más sx cundo apliquemos
mínimos cuadrados. El resto de parámetros f, k 1 y tz se calculan igual que en el caso anterior. Mayor información
sobre el método TSAI puede encontrarse en su famoso artículo [TSAI, 1986]. Una comparativa con otros métodos
en [GONZÁLEZ, 1994].

[Link] Método DLT. Transformación lineal directa

El método DLT se basa en el modelo pin-hole de cámara, e ignora las componentes no lineales de
distorsión radial y tangencial. El procedimiento de calibración sigue los siguientes pasos. Primero se calcula la
matriz (3x4) que transforma las coordenadas del mundo (Xw, Yw , Zw ) en las coordenadas de la imagen (Xf, Xf ), a esta
matriz se le denomina matriz de perspectiva M ecuación (3.17), quedando la matriz de perspectiva:

UPM-DISAMT-2000.31v1.0 67
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

 m1 m14   m11 m12 m13 m14 


   
M =  m2 m24  =  m21 m22 m23 m24  (3.26)
m m  m m34 
 3 34   31 m32 m33
 fK x r1 + (C x − K x Dx )r3 fKx t x + (C x − K x Dx )t z 
 
M =  fK y r2 + (C y − K y D y )r3 fK y t y + (C y − K y Dy )t z 
 
 r3 tz 

Como se observa el término m34 es igual a la componente z del vector de traslación, que normalmente será
no nula, por lo que se puede dividir cada elemento de la matriz por este último, resultando:

 m 11 m12 m13 m 14 
 
 m 34 m 34 m 34 m 34 
 m 21  a 11 a 12 a 13 a 14 
m 22 m 23 m 24 
 → A =  a 21 a 24 
1
M = a 22 a 23 (3.27)
m 34  m 34 m 34 m 34 m 34   
 m 31 m 32 m 33   a 31 a 32 a 33 1 
 1 

 m 34 m 34 m 34 

De forma que la relación entre los sistemas de coordenadas queda:

 n 
 Xf   xw   xw 
 m34     mX f   
 n   yw     yw 
 Yf = A  →  mY f  = A  (3.28)
 w   m 
m z z
 34   w 
 n  
 m  1   1
 34 

[Link].1 Método DLT clásico

El procedimiento DLT clásico consiste en deducir una primera estimación de los valores de los parámetros
fx (fx =fKx), fy (fy =fKy), (Cx, Cy), R y T suponiendo que no existe distorsión. Así, estos valores primeros se pueden
obtener directamente a partir de los parámetros de la matriz A, sin más que despejar y sustituir partiendo del modelo:

x w m11 + y w m12 + z w m13 + m14


X f sindistorsion =
xw m31 + y w m 32 + z w m33 + m34
x w m 21 + y w m 22 + z w m23 + m24
Y f sindistorsion = (3.29)
xw m 31 + y w m 32 + z w m33 + m34

A continuación se modela la distorsión utilizando uno de los modelos descritos en el apartado [Link] y se
hallan sus coeficientes a partir de los errores que existen entre el punto de la imagen (Xfi, Yfi) y el punto que se
obtiene al emplear la ecuación (3.29):

X f − X f sindistorsion = Dx
Y f − Y f sin distorsion = D y (3.30)

Como se consigue un sistema lineal puede ser resuelto con el suficiente número de puntos de control. En
este momento se suele modelar también todo tipo de error sistemático que se puede cometer. Este error sistemático
es normalmente causado por una serie de factores fijos como pueden ser convertidores A/D y peculiaridades de la
fabricación de la cámara y su montaje. El modelo completo en este caso quedaría:

x w m11 + y w m12 + z w m13 + m14


X f sindistorsion + D X + dX f + n X f =
xw m31 + y w m 32 + z w m33 + m34
(3.31)
x m + y m + z w m 23 + m24
Y f sindistorsion + DY + dY f + nY f = w 21 w 22
x w m 31 + y w m32 + z w m 33 + m 34

68 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Donde (DX, DY) incorporan la distorsión, (dXf, dYf) son los errores sistemáticos y (nXf, nYf) representa el
ruido aleatorio. Una vez obtenida la distorsión, el error sistemático se obtiene a partir del modelo:

X f − (X f sindistorsion + D X ) = p0 + p1 X f + p2Y f + p3 X 2f
+ p4 X f Y f + p5Y f2 + p6 X 2f Y f + p 7 X f Y f2 + p8 X 3f + p9Y f3
(3.32)
Y f − (Y f sindistorsion + DY ) = q0 + q1Y f + q2 X f + q3Y f2
+ q4 X f Y f + q5 X 2f + q6Y f2 X f + q7Y f X 2f + q8Y f3 + q9 X

Nuevamente se puede resolver el sistema lineal empleando el suficiente número de puntos. A partir de estos
primeros valores de los parámetros se lleva a cabo un proceso iterativo, recalculando en cada paso los parámetros
extrínsecos e intrínsecos, y posteriormente los coeficientes de distorsión y error sistemático. Tanto el método TSAI,
como el DLT aparecen desarrollados detalladamente en la referencia bibliográfica [GONZÁLEZ, 1994].

[Link] Método en dos pasos, DLT más optimización no lineal

Este procedimiento consta de dos pasos. Primero mediante un método DLT se calculan los elementos de la
matriz de perspectiva y, a partir de ellos, con una factorización QR [DE LA FUENTE, 1993], se obtienen las
estimaciones de los parámetros. Posteriormente realizamos una optimización no lineal mediante el método de
Levenberg-Marquardt [DE LA FUENTE, 1993]. El método utilizado permite calibrar tanto con puntos no
coplanares, como con puntos coplanares, aunque en este último caso se deben emplear varias imágenes. Más
detalles sobre este método pueden encontrarse en [LI y LAVEST, 1996].

El procedimiento DLT empleado tiene algunas peculiaridades con respecto al anterior. Se definen la matriz
L y el vector a:

La = 0 (3.33)

Se obtiene la ecuación 3.34 para N puntos de calibración:

 x w1 y w1 z w1 1 0 0 0 0 − x w1 X 1f − y1w X 1f − z w1 X 1f − x1w 
 
0 0 0 0 x w1 y w1 z w1 1 − xw1 Y f1 − y w1 Y f1 − z w1 Y f1 − y w1 
 M M M M M M M M M M M M 
 i 
y wi z wi 0 − x w X if
i
−y X i i
− z X if
i
− x iw 
L= w
x 1 0 0 0 w f w
0 (3.34)
0 0 0 x wi y wi z wi 1 − xwi Y fi −y Y i i
− z Y fi
i
− y iw 
 w f w

 M M M M M M M M M M M M 
x N y wN z wN 1 0 0 0 0 − xw X Nf
N
− y w X Nf
N
− z w X Nf
N
− xwN 
 w 
 0 0 0 0 x wN y wN z wN 1 − x wN Y fN − y wN Y fN − z wN Y fN − y wN 

a = [a11 a12 a13 a14 a21 a22 a23 a 24 a31 a32 a33 1]

Los 11 valores desconocidos de a se obtienen por mínimos cuadrados, mediante la pseudoinversa. Los
parámetros de a no tienen un significado físico, pero se pueden extraer hasta 11 parámetros físicos de la cámara
aplicando un método basado en la descomposición QR. La descomposición QR es una triangularización ortogonal
que produce una matriz triangular superior de la misma dimensión que la matriz original y una matriz unitaria. A
partir de las matrices resultantes de esta descomposición puede llegarse a una expresión en la que aparecen
desgranadas las transformaciones entre sistemas de referencia:

A = ?V −1 B −1FP (3.35)

Donde λ es un factor de escala y la matriz P recoge la rotación y traslación desde el sistema de coordenadas
del mundo al sistema de coordenadas de la cámara.

UPM-DISAMT-2000.31v1.0 69
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

3.4 Geometría epipolar

3.4.1 Introducción
La obtención de la información espacial a partir de imágenes es uno de los objetivos más perseguidos por
un gran número de investigadores. La geometría epipolar, que se trata en el presente punto, es la que explica las
relaciones geométricas fundamentales entre dos sensores planos. Una buena referencia bibliográfica de los
conceptos que aquí se presentan puede ampliarse en [XU y ZHANG, 1996].

Un simple vistazo a la figura 3.11 basta para comprobar que un punto espacial P con coordenadas (x w , y w ,
zw), no es el único que se proyecta sobre el plano de la imagen con las coordenadas (xu, yu). En realidad los infinitos
puntos que se encuentran sobre la línea que une el punto P con el centro óptico, se proyectan de igual forma. Esto se
manifiesta matemáticamente en la ecuación (3.17) ya que las coordenadas del plano están multiplicada por una
constante n cualquiera. Así, conocida la matriz de proyección M, y dadas las coordenadas del mundo, se podría
calcular las coordenadas en el plano, pero el problema inverso no tiene solución única.

Para resolver este problema inverso se recurre a dos o más sensores ópticos. De esta manera por
triangulación se puede calcular las coordenadas del mundo a partir de las proyecciones de un punto sobre dos
sensores planos calibrados.

3.4.2 Modelo de una cámara


Se hará aquí un repaso al modelo de proyección perspectiva visto en el punto 3.2, pero empleando la
~
notación utilizada habitualmente en geometría proyectiva (véase apéndice A). Así M será un punto tridimensional
expresado en coordenadas proyectivas y m ~ un punto del plano de la imagen, expresado también en coordenadas
proyectivas. Haciendo referencia a la figura 3.11, la ecuación (3.17) se puede expresar como:

 xc   r11 r12 r13 t x   xw   xw 


 y  r r t y   y w   Rcw
 c  =  21 22
r23
 =  t   y w 
w


c 
 z c   r31 r32 r33 tz  zw   0 1   zw  (3.36)
1 0 0 1   1  1
   0  

O lo que es lo mismo:
~ ~ ~ (3.37)
M c = M cw M w

Donde M ~ es un punto tridimensional respecto a las coordenadas de la cámara, ~ es el mismo punto


c Mw
representado en coordenadas del mundo y M ~ w es la rotación y traslación representada en la ecuación (3.36), donde
c

Rcw es una matriz de 3x3 y t cw de 3x1. La relación entre las coordenadas de la cámara y las coordenadas centradas de
la imagen de la ecuación (3.15) se expresará ahora:

~ =A~ ~
m u 0 Mc
(3.38)

Siendo m ~ coordenadas del punto en el plano de la imagen, centradas y sin distorsión. ~ A0 será la matriz de
u

proyección representada en la ecuación (3.14). Para pasar a coordenadas laterales del plano del CCD, pero todavía
en milímetros, se realiza la transformación de la ecuación (3.16), que puesto de forma matricial queda:

n x f  K x 0 Cx   n xu 
n y  =  0 Ky C y  n y  (3.39)
 f   u
 n   0 0 1   n 

~ =A~ ~
m f 1 mu (3.40)

70 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Combinando las ecuaciones (3.37), (3.38) y (3.40), queda la ecuación de proyección (3.41), expresada
también en la ecuación (3.18):

~ = P~ M
m
~
f w (3.41)

Donde m ~ es el punto
~ es el punto proyectado en el plano sensor en coordenadas laterales en milímetros, M
f w
~
tridimensional expresado en coordenadas del mundo y P es la matriz de proyección, descompuesta en parámetros
~ ~ ~ . y en parámetros extrínsecos ~ w . La matriz de parámetros intrínsecos se puede descomponer
intrínsecos A = A1 A0 Mc
A = [ A 0] , con A de 3x3 y 0 de 3x1, véase ecuación (3.18). La matriz de proyección se puede descomponer
en ~
también en P~ = [P p ] , con P de 3x3 y p de 3x1, y que será igual a :

~ ~ ~ ~
P = A1 A0 M cw (3.42)

3.4.3 Modelo de dos cámaras


El modelo descrito en la figura 3.26 corresponde a la geometría epipolar de dos cámaras. Este explica las
~
distintas transformaciones que se producen al proyectar un punto espacial M sobre los dos planos de imágenes. Su
principal aplicación es para el establecimiento de puntos correspondientes mediante la restricción epipolar y, para el
~
cálculo de las coordenadas del punto espacial M , conocidas sus dos proyecciones.

Así un punto espacial


~
M se proyectará sobre los dos
planos sensores como m ~ en la
imagen 1 y m ~′ en la imagen 2,
siendo ambos puntos
correspondientes. En dichas
imágenes se define los centros
ópticos o de proyección, como
~ ~
C para la cámara 1 y C ′ para la
cámara 2. La proyección de este
último sobre el plano sensor 1
formará el punto ~
e , denominado
epipolo y de igual manera se
formará el epipolo e′,
~
~
proyectando C sobre la imagen
2. Notesé que los epipolos son
una entelequia matemática y
podrían estar fuera del plano
Figura 3.26: Geometría epipolar de dos cámaras. sensor.

Tanto el epipolo e~ con el punto proyectado m ~ , ambos pertenecen al plano sensor de la cámara 1, y forman
la recta lm′ , denominada recta epipolar. De igual forma se puede construir la recta epipolar ~
~
lm′ sobre la imagen 2,
formada por el epipolo e~′ y la proyección m ~′ . Las rectas epipolares sirven entre otras cosas para establecer la
restricción epipolar en la correspondencia. Teniendo dos cámaras calibradas, si se quiere averiguar la
correspondencia de un punto m ~′ en el sensor 2, si existe, se encontrará
~ sobre el sensor 1, el punto correspondiente m
necesariamente sobre la recta epipolar l m′ .

La importancia del cálculo de los epipolos de las dos cámaras estriba en que todas las rectas epipolares
pasan necesariamente por el epipolo. Notesé que para calcular éste, solamente se proyecta el centro de la imagen de
~ ~
la cámara contraria, es decir no interviene para nada el punto M . Para cada punto espacial M se formarán un par de
puntos correspondientes m y m′ que junto con sus correspondientes epipolos, formarán un par de rectas epipolares.
~ ~
Para resumir, los epipolos son únicos para una configuración determinada de cámaras, es decir la posición relativa
entre ellas, determinada por una rotación R y una traslación t. Para cada punto que se proyecta se formarán rectas
epipolares distintas.

La formulación de la geometría epipolar puede realizarse en coordenadas del mundo o coordenadas de la


cámara, expresándose a continuación.

UPM-DISAMT-2000.31v1.0 71
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

[Link] Resolución en coordenadas del mundo

Con este enfoque, los parámetros de cada cámara han sido estimados respecto a un sistema de coordenadas
del mundo común a ambas cámaras, cumpliéndose la ecuación (3.41). A continuación se va a expresar la resolución
~
de los epipolos y de las rectas epipolares en función de las coordenadas del mundo. La proyección del punto M se
puede expresar matemáticamente según la ecuación (3.43) para la imagen 1 y la ecuación (3.44) para la imagen 2:

M 
~ = P~ M = [P p ]   = PM + p
~
m (3.43)
1

M 
′ M = [P ′ p ′]   = P ′M + p ′
~ ~
~′ = P (3.44)
m
1

Despejando de la ecuación (3.43) M y sustituyendo en (3.44) se establece una relación entre las dos
proyecciones, expresada en la ecuación (3.45). Sin embargo esta relación involucra a un punto proyectivo con un
valor fijo, por lo que la solución describirá una recta.

M = P −1 (m
~ − p) ⇒ m
~ ′ = P ′P −1 (m ~ + ( p ′ − P ′P −1 p )
~ − p ) + p ′ = P ′P −1m
(3.45)

Si se hace que el punto a proyectar sobre la imagen 1 sea el propio centro de proyección, se tendrá que
~ ~ ~ = 0 , que sustituyendo en (3.43) se tendrá que el
M = C , o lo que es lo mismo, M = C . Este se proyectará con un m
centro de proyección en coordenadas del mundo será el representado en (3.46). Haciendo un razonamiento similar
con la imagen 2, y (3.44) se obtendrá (3.47).

C = −P −1 p (3.46)

C ′ = − P ′−1 p ′ (3.47)

Una vez calculados los centros de proyección, se puede calcular el epipolo de la cámara 2, proyectando en
la cámara 2 el centro de proyección de la cámara 1, C . Para ello se combinan (3.44) y (3.46), quedando:

~ ~ ~  − P −1 p   − P −1 p 
 = [P′ p ′]  −1
e~′ = P ′C = P ′  = p ′ − P′P p (3.48)
 1   1 

De manera similar se procedería para calcular el epipolo de la cámara 1. La recta epipolar l m′ se podría
~′ y el epipolo ~
calcular conocidos dos puntos de ella, por ejemplo m e ′ . Así combinando (3.45) y (3.48) quedaría:

~ ~ ~
[ ]
lm′ = e ′ ∧ m′ = p ′ − P ′P −1 p ∧ P′P −1m
~ (3.49)

Esta ecuación es especialmente útil, por que obtiene la recta epipolar sobre el sensor 2, conocida la
proyección m~ sobre el sensor 1. Haciendo un razonamiento similar se puede calcular la recta epipolar de 2 sobre 1.
~′ . La resolución de
De esta manera se puede establecer la restricción epipolar para buscar el punto correspondiente m
un producto vectorial de forma matricial puede verse en el apéndice A.

[Link] Resolución en coordenadas de la cámara

Con este otro enfoque, los puntos del mundo son medidos respecto al centro de proyección de cada cámara.
Es decir, se sitúa el centro de coordenadas en el centro de proyección de cada cámara, tal y como se puede ver en la
~w
c = I
figura 3.26, haciendo M , con lo que la ecuación (3.41) se transforma en (3.50) para la imagen 1 y (3.51) para
la imagen 2:

~=m
~ =A~~
m f Mc (3.50)

~′ = m ~ ~
~′ = A
m f
′M c′ (3.51)

72 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Donde M ~ son los puntos del espacio referidos ahora al centro óptico de la cámara 1, y ~ referidos al
c M c′
~ c , por una rotación R y una
centro óptico de la cámara 2. Se define la transformación entre la cámara 1 a la 2 por M c′

traslación t representadas en la figura 3.26 con:

~ ~ ~ ~ R t 
M c ′ = M cc′ M c ⇒ M cc′ =   (3.52)
 0 1

~ ′ R − RT t
T
~ ~ ′ ~ (3.53)
M c = M cc M c′ ⇒ M cc =  
 0 1 

Dado que entre cámaras existe una rotación y traslación conocidas, las proyecciones sobre cualquier
cámara se pueden referir a la cámara contraria con (3.54) y (3.55).
~ ~
~′ = A ~ ~ ~ (3.54)
m ′M c′ = A′M cc′ M c

~~ ~~ ~
~=A
m M c = AM cc′ M c′ (3.55)

Para calcular el epipolo ~e ′ se proyecta sobre la cámara 2 el centro de proyección de la cámara 1. Este
tendrá las coordenadas M~ c = C~c = [0 0 0 1]T que dará el resultado de (3.56). Haciendo un razonamiento similar
se calcula el epipolo ~
e en (3.57). En estas dos ecuaciones se llega a la importante conclusión que los epipolos son
solo función de los parámetros intrínsecos de cada cámara y de la situación relativas entre ellas, para nada
intervienen los parámetros extrínsecos de cada cámara.

 0
 0
~  R t    = [ A ′ 0]   = A ′ t
t (3.56)
e~ ′ = A ′    
 0 1  0 1 
 1
 

0
~ R
T
− R t  0
T
− R T t 
   = [ A 0] 
~
e =A  = −A R t (3.57)
T

0 1  0  1 
1
 

Una vez calculados los epipolos, de manera similar a como se hizo en el punto anterior, se podría calcular
las rectas epipolares.

3.4.4 Homografía entre puntos


Al igual que existe una relación entre puntos correspondientes a un punto del espacio, m~y m~′ , representada
en 3.45, donde esta relación puede ser resuelta salvo un factor de escala λ, existe también una relación entre puntos
proyectados, pero ahora pertenecientes al plano del infinito, y esta relación si que está determinada. A la relación
entre puntos proyectados pertenecientes a un plano se llama homografía. Al caso particular de que este plano sea el
~ .
plano en el infinito, se llama homografía en el infinito H ∞

[Link] H∞ en coordenadas del mundo

Al proyectar un punto del espacio sobre el sensor m~ = P~M~ o lo que es lo mismo m~ = P ~


p  ⋅ M . Si un

punto del espacio perteneciente al plano en el infinito M ~ M 


=   ∈ ∏ ∞ . Cada punto en el plano en el infinito
0
~
representa una única dirección, ya que todas las rectas paralelas entre sí, se cortarán en ese punto M . Sustituyendo
queda m~ = PM y despejando quedaría M = P −1m ~ , y proyectando este en la cámara 2 quedaría la ecuación (3.58),
donde se establece una relación unívoca entre los dos puntos correspondientes.

UPM-DISAMT-2000.31v1.0 73
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

~
 P −1m
′ M = [P′ p′] 
~ ~
~′ = P
 = P ′P m = m ′
−1 ~ ~
m (3.58)
 0 

~′ = H~ m
m ~ con
~
H ∞ = P ′P −1
∞ (3.59)

El cálculo de la
homografía entre puntos del plano
del infinito tiene su interés para
calcular la correspondencia entre
direcciones del espacio. Así por
ejemplo en la figura 3.27 se tienen
direcciones representadas en dos
vistas de un objeto tridimensional.
Supuesto que se tenga
conocimiento que las direcciones
A y B, en la proyección de la
izquierda son direcciones paralelas
(la misma dirección), el punto m ~
Figura 3.27: Homografía entre puntos del plano del infinito donde se corten tendrá su
correspondiente en la imagen derecha que vendrá fijado por la ecuación (3.59), y que será la intersección de las
direcciones A’ y B’ en la imagen derecha. Esto es una herramienta muy útil para hallar la correspondencia en
cualquier dirección.

[Link] H∞ en coordenadas de la cámara


~ ~ , o lo que es lo mismo.
~=A
Ahora al proyectar un punto espacial en coordenadas de la cámara m Mc
~ = A 0 ⋅M~ ~ M c 
m   c . Si el punto a proyectar pertenece al plano en el infinito M c =   ∈ ∏∞
, sustituyendo queda
 
0
~ = AM y despejando quedaría M = A−1m
m ~ . El mismo punto en el infinito referido respecto a las coordenadas de la
c c

cámara 2 será M~  M c′  , así que de igual forma haciendo el mismo razonamiento para la cámara 2 quedaría
c′ =   ∈ ∏∞
 0 
m~′ = A′M , y despejando quedaría M = A′−1m ~′ . Sustituyendo el punto en el infinito en la ecuación (3.52) quedará
c′ c′

la ecuación (3.60) y sustituyendo las proyecciones de éstos quedará la ecuación (3.61), donde se obtiene la
homografía en el infinito en coordenadas de la cámara. Esta expresión es importante por que se demuestra que
conocida una dirección en una vista para conocerla en cualquier otra vista, tan solo es necesario conocer los
parámetros intrínsecos y la rotación existente entre ambas cámaras.

~ ~ ~  M c ′   R t  M c 
M c′ = M cc′ M c ⇒  =  ⋅   ⇒ M c ′ = RM c (3.60)
 0   0 1  0 

A′−1m
~ ′ = RA−1m ~ ′ = A′RA−1m
~⇒m ~
(3.61)
~′ = H~ m
m ~ con
~
H ∞ = A′RA −1
∞ (3.62)

[Link] Puntos espaciales sin restricción

Como se ve en el apéndice A, no existe homografía entre espacios de distinta dimensión. Al proyectar un


~=A ~ ~ , o lo que es lo mismo. ~ ~
punto espacial en coordenadas de la cámara m Mc m =  A 0 ⋅ M c . Si el punto a
~
proyectar M M c  ~ = AM y despejando quedaría M = A−1m
, sustituyendo queda m ~ . El mismo punto
c =   ∈ P3 c c
 1 
respecto a las coordenadas de la cámara 2 será M~  M c′  , así que de igual forma haciendo el mismo
c′ =   ∈ P3
 1 
razonamiento para la cámara 2 quedaría m~′ = A′M , y despejando quedaría M = A′−1m ~′ . Sustituyendo ambos
c′ c′

puntos en la ecuación (3.52) quedará la ecuación (3.63) y sustituyendo las proyecciones de éstos quedará la
ecuación (3.64), donde se obtiene la relación no homográfica entre puntos en coordenadas de la cámara.

74 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Compruebesé en la ecuación (3.56), que el sumando A′t es el epipolo de la cámara 2 y A′RA −1 no es otra cosa que
la homografía en el infinito calculada en el apartado anterior. Con esta importante expresión se concluye que
conocida la homografía en el infinito es posible acotar la búsqueda de la correspondencia entre los puntos de dos
vistas a una recta.

~  M c′   R t   M c   RM c + t  (3.63)
M c′ = M cc′ M c ⇒   =   ⋅  =   ⇒ M c′ = RM c + t
 1   0 1  1   1 

A′−1m
~ ′ = RA −1m ~ ′ = A′RA −1m
~+t ⇒ m ~ + A′t (3.64)
~ ~ ~
~′ = H ~
m ∞m + e ′ con H ∞ = A′RA −1 (3.65)

[Link] Homografía entre puntos de un plano

Éste es un caso especialmente interesante por que se aplica posteriormente en la detección de puntos que
pertenecen a un plano láser. Si el punto a proyectar en las dos cámaras pertenece a un mismo plano Π,
M c  ~ ~ ~
M c =   ∈ Π , se tendrá una homografía entre las dos proyecciones m′ = H Π m , tal y como se ha estado viendo
~
 1 
hasta ahora. Esta homografía se puede estimar y por tanto, calcular puntos correspondientes entre dos cámaras.
Supuesta la ecuación del plano en su forma normal n T ⋅ M = d , véase [SPIEGEL y ABELLANAS, 1988], donde
n T es el vector director del plano, M es un punto perteneciente a él en coordenadas euclídeas, y d es la distancia
perpendicular del plano al origen de coordenadas, entonces se puede demostrar que la homografía del plano es la
~ ~ el valor de ~ ~ ~ para
~′ = H
expresión (3.66). La comprobación es muy sencilla, basta con sustituir en m Πm m = AM c
obtener la ecuación (3.65), ya probada. Compruebesé también en la ecuación (3.66) que si la distancia al plano
tiende al infinito, la homografía del plano tiende a ser H∞.

~ ~ n T −1
e′
HΠ = H∞ + ~ A (3.66)
d
~ tiene 8 grados de libertad (nueve elementos menos uno por el escalado). Se puede
La homografía H Π

obtener conociendo tan solo las proyecciones de cuatro puntos que sean base proyectiva

Figura 3.28: Homografía entre puntos de un plano

3.4.5 Condición de epipolaridad


Como se ha visto hasta ahora, a cada punto de una imagen se asocia una línea epipolar en la otra. Así en la
~ sobre el sensor 1 hace que se forme de forma
figura 3.26 que describe la geometría epipolar, la mera existencia de m
~
unívoca la línea epipolar lm′ en el sensor 2. De manera análoga, m ~ ′ del sensor 2 formará ~
lm′ en el 1. Se pretende
buscar la matriz que calcule de forma directa las líneas epipolares. Conocida esta matriz, dado un punto de la
imagen en el sensor 1 se puede determinar la línea epipolar en la segunda imagen, donde se encontrará el punto
correspondiente, tal y como se muestra en la figura 3.29.

UPM-DISAMT-2000.31v1.0 75
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

Figura 3.29: Condición de epipolaridad

[Link] Resolución en coordenadas del mundo


~′ se puede expresar según la ecuación (3.67),
Según la ecuación (3.49), el producto vectorial entre ~e ′ y m
véase definición 47 del apéndice A.
~ ~
l m′ = e ′ ∧ m [
~ ′ = p ′ − P ′P − 1 p ][ ] P ′P

−1 ~
m (3.67)

Esto se puede escribir de forma más simplificada según las ecuaciones (3.68) y (3.69), introduciendo el
~
concepto de matriz fundamental F [LUONG y VIEVILLE, 1996], que transforma puntos de una imagen en líneas
en el otro sensor. La expresión de la matriz fundamental en coordenadas del mundo se tiene en (3.70).
~ ~ ~ (3.68)
lm′ = F ⋅ m

~ ~ ~ (3.69)
lm′ = F T ⋅ m ′

~
[
F = p ′ − P ′P −1 p ][ ] P ′P

−1 (3.70)

~
Se puede demostrar que sustituyendo en (3.68) el epipolo del sensor 1, F ⋅ ~ e = 0 . Se obtiene una expresión
equivalente sustituyendo el epipolo del sensor 2 en (3.69). Como el punto m ~′ ∈ ~
lm′ se verificará que su producto
~
~′T ⋅ l ′ será nulo, así que sustituyendo en (3.68), quedará la (3.71), que también se puede poner en la forma
escalar m m

de la (3.72). Estas importantes expresiones resumen toda la información de correspondencia entre dos puntos
originados por la proyección de un mismo punto espacial.
(3.71)
m~ ′T F~ m
~=0

~ T F~ T m
m ~′ = 0 (3.72)

El concepto de matriz fundamental es además importante porque permite construir la condición de


epipolaridad conociendo únicamente la correspondencia entre puntos en las dos imágenes, sin que sea necesario
conocer la geometría interna de cada sensor, es decir, sin depender del conocimiento de los parámetros de captación
(parámetros intrínsecos) ni de la geometría externa o situación espacial (parámetros extrínsecos).

El determinante de la matriz fundamental es cero, lo que unido a la condición de escalado, da siete grados
de libertad, dos por cada epipolo, y 3 por la relación homográfica entre los haces de rectas epipolares. Por tanto, tan
solo es necesario conocer 7 puntos correspondientes para su estimación por criterios lineales o no lineales.

[Link] Resolución en coordenadas de la cámara

Para el cálculo de la matriz fundamental en coordenadas de la cámara se combinan las ecuaciones (3.56) y
(3.62), tal y como se refleja en (3.73), que puesta según la notación de la definición 47 del apéndice A, queda según
(3.74), donde se demuestra nuevamente la ecuación (3.68), quedando ahora la matriz fundamental según (3.75).

76 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

~
l m′ = e~′ ∧ m ( ~ ~ ~
~ ′ = e~ ′ ∧ H ) ′ ~′
~ ~

~ ~
′ ′ −1 ~
∞ m + e = e ∧ H ∞ m = A t ∧ H ∞ m = A t ∧ A RA m = A
′ − T (t ∧ RA − 1m
~) (3.73)

~ ~
lm′ = e ′ ∧ m (
~ ′ = A′ −T t RA −1 m
[∧]
) ~ = F~ m
~ = A′ − T t RA −1m
[∧ ]
~ (3.74)

~
F = A′ −T t [ ∧ ] RA −1 (3.75)

En la ecuación (3.75) se puede ver que de los 7 grados de libertad de la matriz fundamental 3 son debidos a
la rotación, 2 por la traslación y otros 2 por los parámetros intrínsecos de las matrices de proyección (focales). La
base de la calibración proyectiva, que se verá en el punto 3.4.6 es encontrar las relaciones no lineales entre ellos.

[Link] Matriz esencial

El concepto de matriz esencial fue introducido por FAUGERAS en 1993. Si se conocen los parámetros
~ −1 ~
q , donde q = A m y de forma
intrínsecos de las cámaras, se definen como coordenadas normalizadas m~ = A ~
análoga q~ ′ = A′ −1 m
~ ′ . Combinando las (3.71) y (3.75) se tiene (3.76), donde la matriz E = t R se denomina matriz
[ ] ∧

esencial y expresa la condición de epipolaridad, solo dependiendo del movimiento relativo entre los sistemas ópticos
de las dos cámaras. Es especialmente útil cuando se maneja una cámara móvil, donde los parámetros intrínsecos no
varían, es decir A = A′ .

~ ′T F~ m
m ~ ′T A′ − T t RA −1 m
~=m ~ = q~′ T t R q~ = q~′T E q~ (3.76)
[∧ ] [∧ ]

3.4.6 Estimación del modelo en estereoscopía


Aunque en el punto 3.3 se trató con profundidad la estimación del modelo, cuando se tienen dos o más
cámaras, o incluso dos o más vistas, conviene hacer algunas consideraciones. Así se puede distinguir entre
calibración proyectiva, afín y euclídea. La primera pretende la estimación de la matriz fundamental con la que se
puede realizar una reconstrucción proyectiva. Con ésta se obtiene directamente los epipolos y la homografía entre
las rectas epipolares. En la calibración afín se pretende conocer, además de la matriz fundamental, la homografía
entre los punto en el infinito H∞. Con ella es posible realizar una reconstrucción afín del mundo. Finalmente en la
calibración euclídea se pretende el cálculo completo de los parámetros intrínsecos y extrínsecos del modelo tal y
como se vio en el punto 3.3. Con esta última se puede realizar una reconstrucción completa de la escena
tridimensional. Los métodos tradicionales de calibración euclídea emplean elementos de calibración, como se
explica en el punto 3.3.3, mientras que las técnicas de autocalibración, lo único que necesitan es el conocimiento de
puntos correspondientes entre las vistas. Un excelente trabajo sobre la recuperación de la estructura proyectivas, afín
y euclídea puede encontrarse en la tesis doctoral [ZELLER, 1995].

En principio, no se puede obtener ninguna información métrica de una estructura proyectiva, la medida de
longitudes, ángulos y paralelismo no tiene sentido. Sin embargo, si es posible recuperar cierta información como
coplanaridad, colinealidad y razones dobles (véase apéndice A). A veces esta información es más que suficiente para
sistemas de visión artificial que pretenden resolver problemas de navegación en entornos no estructurados y
reconocimiento de objetos [XU y ZHANG,
1996] .

Sin embargo, si se introduce


algún conocimiento de la escena, se puede
llegar a extraer más información. Por
ejemplo, especificando un plano en el
infinito (en la práctica, sólo se necesita
fijar un plano suficientemente alejado) se
puede recuperar la estructura afín [QUAN
y LAN, 1999], donde ya se preservan
paralelismos y la razón de distancias.

Si se asume que los parámetros


internos de la cámara no varían en
sucesivas tomas, se pueden emplear los
invariantes proyectivos para estimar la
Figura 3.30: Calibración por estratos.
estructura euclídea, es decir, realizar la
UPM-DISAMT-2000.31v1.0 77
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

calibración en sentido tradicional del punto 3.3, pero sin necesidad de emplear elemento de calibración alguno. Esto
es conocido como técnicas de autocalibración, recogidas en las tesis doctorales [ENCISO, 1995] y [AGAPITO,
1996]. Incluso teniendo las cámaras calibradas, al trabajar con distorsiones, se puede tener resultados más fiables
fijando algunas restricciones geométricas a las imágenes y recuperando la estructura proyectiva como paso
intermedio. En [ZHANG,1996] se realiza un interesante trabajo sobre la reconstrucción proyectiva, teniendo en
cuenta las distorsiones de las cámaras.

[Link] Calibración Euclídea a partir de la proyectiva

Como se puede ver en la figura 3.30 se puede realizar la calibración euclídea a partir de la proyectiva
[ZHANG et al.,1997]. Para explicar este proceso se introduce aquí el concepto de cónica absoluta (véase apéndice
c = [X Y Z T ]∈ P 3 si T = 0 , la cónica se encuentra en el plano en el infinito y se cumple
A). Sea la cónica M ~
~ ~
M cT M c = M cT M c = X 2 + Y 2 + Z 2 = 0 . La imagen de la cónica en la primera cámara quedará según se expresa en la
ecuación (3.77), mientras que en la cámara 2 quedará según (3.78). Notesé que en ambas expresiones la proyección
de la cónica absoluta sólo depende de los parámetros intrínsecos de las cámaras, por tanto, es el elemento de
calibración ideal para independizar la estimación de la geometría interna de la externa, es decir, parámetros
intrínsecos de extrínsecos.
~ ~
~=A
m M c = A M c ⇒ M c = A−1m ~ (3.77)
~ T A−T A−1m
M cT M c = m ~ = 0 si A−T A−1 = B ⇒ m
~T B m
~ =0

~′ = A~ ~ ~′
m ′ M ′c = A′ R M c ⇒ M c = R −1 A′ −1m
(3.78)
~ T A′ −T R −T R −1 A′−1m
M cT M c = m ~′ = m ~ ′ = 0 si A′ −T A′ −1 = B ′ ⇒ m
~ T A −T A −1m ~′T B′ m
~′ = 0

El dual de la imagen de la cónica absoluta sería la expresada en la ecuación (3.79), donde K es la matriz de
Kruppa. A partir de K se puede obtener de forma analítica los parámetros intrínsecos (matriz A).
~T ~
lt K lt con K = B * = A AT (3.79)

Como conclusión inmediata de


las ecuaciones de Kruppa se puede
obtener a partir de la matriz fundamental
Ω dos relaciones no lineales de los
π∞
parámetros intrínsecos que se ilustran en
la figura 3.31. En primer lugar, existen
dos planos epipolares a la cónica
~ absoluta. Las rectas epipolares serán
~
~
C e′
e • • • • tangentes a las proyecciones de la
~ cónica absoluta cumpliendo la ecuación
C′ de la cónica dual (véase apéndice A). En
~ ~′ segundo lugar, las rectas epipolares
l2 R , t l2 correspondientes cumplen la
~ transformación epipolar (homografía
l1 ~′ entre rectas). Dicha transformación se
l1
Imagen 1 deduce directamente de la matriz
Imagen 2
fundamental. Cada par de rectas
epipolares correspondientes suministra
Figura 3.31: Calibración euclídea a partir de la proyectiva. una relación no lineal de los parámetros.

Así en el caso de que la cámara


1 y 2 tengan parámetros intrínsecos diferentes, se podría obtener dos relaciones de los coeficientes de Kruppa a
partir de la matriz fundamental. Así si se tiene como datos F , ~e y ~e ′ , las incógnitas serían K = A AT para una
cámara y K ′ = A′ A′T para la otra. Sustituyendo la matriz fundamental en (3.79) quedaría:

F K F T = α [~
e ′][∧] K ′ [~
e ′] [ ∧ ]
T
(3.80)

78 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Si se hace una descomposición de la matriz fundamental F = UDV T según (3.81).

0 − 1 0
DV T KVDT = βMU T K ′UM T con M = 1 0 0
(3.81)
 
0 0 0

Finalmente se obtiene las dos relaciones no lineales de los coeficientes de Kruppa reflejado en la expresión
(3.82), donde r y s son los valores singulares de F y u1, u2, v1 y v2 son las dos primeras columnas de U y V
respectivamente.

r 2v1T Kv1 rsv1T Kv2 s 2 vT2 Kv2


= = (3.82)
u T2 K ′u 2 − u2T K ′u1 u1T K ′u1

Para el caso de que las dos cámaras tengan los mismos parámetros intrínsecos, A = A′ , caso éste muy
común cuando se están capturando varias vistas de un objeto a medir por una sola cámara, se tendrá que
K = K ′ = A A T . La ecuación (3.82) quedará ahora:

r 2 v1T K v1 rsv1T K v2 s 2 v 2T K v2
= = (3.83)
u2T K u 2 − u 2T K u1 u1T K u1

[Link] Calibración euclídea a partir de la calibración afín

En este caso se parte del conocimiento de la homografía del infinito H∞, de la matriz fundamental F y de
los epipolos. De la ecuación (3.62) se puede despejar la matriz de rotación R = A′ −1 H ∞ A . Como R R T = I
sustituyendo queda A′ −1 H ∞ A AT H ∞T A− T = I que se puede poner como la expresión (3.84).

A′ −1 H ∞ K H ∞T A −T = I (3.84)

La relación H ∞ K H T∞ = K ′ suministra cuatro relaciones independientes de los parámetros intrínsecos. Los


parámetros extrínsecos pueden calcularse con (3.85).

R = A′−1 H ∞ A ; e′
t = A−1~ (3.85)

3.4.7 Calibración cinemática de un cabezal estéreo robotizado


En los sistemas activos de visión los parámetros
intrínsecos y extrínsecos cambian cuando se varía la posición y/o
estado de la cámara. Son necesarias técnicas de calibración que
mantengan en todo momento el sistema calibrado. Los parámetros
intrínsecos serán modificados en función de la posición del cabezal,
tanto en elevación, convergencia y acimut, formando una serie de
tablas en las que se consulte los nuevos parámetros [LI et al., 1994]
y [LI y LAVEST, 1996]. Otros autores proponen la creación de
formulas matemáticas que consigan los parámetros en función del
zoom, enfoque y apertura del iris.

El problema del conocimiento continuado de los


parámetros extrínsecos se resuelve mediante la obtención previa de
una serie de matrices de transformación, que relacionan el sistema
de coordenadas de la cámara situado en el centro de proyección, y
los sistemas de coordenadas que definen los ejes de rotación del
cabezal. Conociendo los parámetros extrínsecos para una posición
inicial del cabezal, en la que se ha calibrado inicialmente, y
habiéndose obtenido previamente todas las relaciones de Figura 3.32: Relación de sistemas de
transformación entre los diferentes sistemas de coordenadas, puede coordenadas en un cabezal estéreo robotizado.
disponerse en todo momento de los parámetros extrínsecos de las

UPM-DISAMT-2000.31v1.0 79
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

cámaras. En la figura 3.32 se puede ver la estructura de un cabezal estéreo en la se definen los siguiente sistemas de
coordenadas:

• W-xwywzw S.C. del mundo.


• N-xnynzn S.C. del cuello.
• E-xeyeze S.C. de los ojos.
• c-xcyczc S.C. de la cámara

En (3.86) se plantean las relaciones existentes entre el sistema de coordenadas del ojo y de la cámara.

X co = Reco X eo + Teco
(3.86)
X co = Rwc
o
X w + Twco

0 1 o 1
Xe a X e Xc a Xc
(3.87)
X 1e = Rxy (τ , ρ ) X e0

Si se realiza una rotación alrededor del eje y (convergencia), seguida de una rotación alrededor del eje x
(elevación) quedaría según (3.87). Al estar la cámara rígidamente unida al ojo se podría plantear (3.88). Despejando
Xw y sustituyendo se obtiene (3.89).

X c1 = Rec0 X e1 + Tec0
(3.88)
X c1 = R1wc X w + Twc
1

X w = Rwc
0T
(X c0 − Twco ) (3.89)
X c1 = Rwc
1 0T
Rwc X c0 + Twc
1
− Rwc
1 0T 0
Rwc Twc

Despejando Xe0 y sustituyendo se tiene ( 3.90) e igualando ambas expresiones se llega a (3.91).

X e = Rec ( X c − Tec )
0 0T 0 0

X c1 = Rec0 Rxy (τ , ρ )Rec0T X c0 + ( I − Rec0 Rxy (τ , ρ )Rec0T )Tec0


(3.90)

1
Rwc 0T
Rwc = Rec0 Rxy (τ , ρ )Rec0T (3.91)
1
Twc − Rwc
1
Twc = (I − R1wc Rwc
0T 0
Rwc 0T
)Tec0
Una vez obtenidas todas las matrices, el sistema puede estar continuamente determinado en el tiempo, de
forma que para un instante t, se habrá rotado un ángulo rt alrededor del eje y, y otro ángulo tt alrededor del eje x. Así
en (3.92) quedaría totalmente resuelta la cinemática del ojo.

X c ( t ) = Rec0 Rxy (τ t , ρt ) Rec0T Rwc


0
X w + Rec0 Rxy (τ t , ρt ) Rec0T Twc0
(3.92)
+ ( I − Rec0 Rxy (τ t , ρt ) Rec0T )Tec0

X c ( t ) = Rnc0 Ry ( ρ ) Rnc0T Rwc


0
X w + Rnc0 Ry ( ρ ) Rnc0T Twc0 + (3.93)
( I − Rnc0 Ry ( ρ ) Rnc0T )Tnc0

En (3.93) se obtiene de manera similar en función de las variaciones del cuello, las coordenadas de la
cámara Xc relacionadas con las del mundo Xw. Finalmente el movimiento combinado ojo con cuello se podría
expresar según (3.94).

X c (t ) = Re ( t ) Rn ( t ) Rwc
0
Xw +
[ ]
Re ( t ) R n (t )Twc0 + ( I − R n (t ))T nc0 + ( I − R e ( t ) )Tec0 (3.94)

80 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Proceso de calibración. El problema de la calibración cinemática se resuelve obteniendo la matriz R y el


vector T que cumplan las expresiones anteriores que pueden resumirse en (3.95), donde se tienen las
simplificaciones (3.96).

Rc = Rwc
1 0T
Rwc
(3.95)
Re (n ) = Rxy (τ , ρ )

Rc R = RRe ( n ) (3.96)
Tc = MT

El sistema RcR=RRe(n) se resuelve empleando alguno de los métodos siguientes:


• Solución por Interpretación Geométrica.
• Solución por Par de Rotación.
• Solución mediante Cuaternios.
• Solución resolviendo AX=B donde las incógnitas X son (senb 1, cosb 1,...,senb n cosbn) y n es el número de
posiciones distintas de la cámara, teniendo en cuenta la restricción sen2bi+cos2bi = 1 a la hora de obtener la
solución.
• Solución mediante optimización no lineal.
Un profundo estudio de la resolución de todos estos métodos puede encontrarse en [GONZÁLEZ, 1994].

3.4.8 Sistemas estereoscópicos


En este apartado se presentan sistemas estereoscópicos explicando sus características principales. Algunos
de ellos han sido empleados para el desarrollo de la presente tesis doctoral.

[Link] Sistemas existentes

El diseño de nuevos sistemas estereoscópicos con cualidades innovadoras a cautivado a numerosos


investigadores. Para ver numerosos sistemas de este tipo se puede visitar la página
[Link] en la que aparecen los más importantes.

[Link] Sistemas pseudoestereoscópicos

La teoría desarrollada en este punto para el


calculo de la geometría epipolar no es exclusiva al caso
de tener dos o más sensores. Algunos investigadores
idean curiosos sistemas estereoscópicos, capaces de
realizar una reconstrucción proyectiva, pero empleando
una sola cámara. Así en [MATHIEU y DEVERNAY,
1995] se presenta un sistema estereoscópico con una sola
cámara y un sistema de espejos, como se puede ver en la
figura 3.33.

En el punto [Link] se habló de la óptica


experimental presentada por [AHMED y AFIFI, 1999]
con un nuevo diseño de lente anillo capaz de realizar
mediciones estereoscópicas con una sola cámara. La
óptica tiene forma teórica con el círculo central opaco,
tal y como se aprecia en la figura 3.19 izq. La manera de
proyectarse un objeto es equivalente a la que resultaría
en un par estereoscópico, tal y como se refleja en la Figura 3.33: Sistema estereoscópico con una sola
figura 3.19 der. Con este sistema solamente es necesario cámara
emplear una cámara, haciendo que las líneas epipolares
sean paralelas, reduciendo notablemente el problema de la correspondencia. Además, el hecho de emplear una
cámara redunda en las ventajas de no tener que resolver la posición entre ellas y sobre todo, que los parámetros
intrínsecos se modifican por igual al variar el enfoque, zoom o apertura. El inconveniente es que las imágenes se
proyectan de una manera muy peculiar, deformadas, por lo que hay que realizar un proceso de warping para
reconstruir la imagen original.

UPM-DISAMT-2000.31v1.0 81
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

El sistema Cyclop, representado en la figura


3.34, ha sido construido por la Universidad de
Picardie Jules Verne, en la ciudad Francesa de
Amiens. Es un robot móvil dirigido por una sola
cámara que obtiene la imagen del espacio a través de
un espejo en forma de cono, de forma que con una
sola vista puede obtener información tridimensional
del sistema [MOUADDIB, 1999].

En el congreso del ISPRR celebrado en el


instituto cartográfico de Barcelona en Noviembre de
1999, sorprendió el sistema de captación
tridimensional presentado por [KAWASUE y
SHIKU, 1999] y representado en la figura 3.35. Se
proyecta una rejilla de puntos sobre la escena,
mientras que la captación es realizada con una sola
cámara. Enfrente de ésta se ha situado un cristal de
Figura 3.34: Sistema Cyclop. Cortesía Université de Picardie cuatro centímetros de espesor y dispuesto a 45º
Jules Verne respecto al eje óptico. Este cristal gira a gran
velocidad, de forma que por el fenómeno de refracción, los
puntos de la escena, son captados en la cámara como
círculos. Esto se emplea para estudiar el campo de
velocidades en el interior de un fluido en el cual se han
introducido partículas reflectoras de la luz. Así si las
partículas se alejan o se acercan, las circunferencias
captadas en imágenes consecutivas serán cada vez más
pequeñas o más grandes respectivamente. Si las partículas
avanzan en una dirección la circunferencia se desplazará.

[Link] Sistemas empleados

El cabezal estereoscópico MARCONI representado


en la figura 3.36 fue el empleado en los comienzos de esta
tesis doctoral. Tiene 10 grados de libertad, incluyendo Figura 3.35: Sistema medidor de campo de
movimientos de elevación, acimut, convergencia para las velocidades en un fluido, cortesía Universidad de
cámaras y enfoque zoom e iris para las ópticas motorizadas. Nagasaki.
Una descripción detallada de este sistema se puede ver en
[GONZALEZ, 1994].

El sistema Escher (E.T.L. Stereo Compact Head for Robot vision) ha sido diseñado por el E.T.L figura
Escher. El autor de la presente
tesis doctoral ha realizado la
calibración cinemática de este
robot, durante su estancia en la
ciudad Japonesa de Tsukuba.
Cuenta con cuatro grados de
libertad, convergencia
independiente y elevación y giro
panorámico común. Dos cámara
de color dotadas con lentes de
ancho ángulo de vista (120º),
comentadas en [Link]. Su diseño
está orientado hacia aplicación
de Visión activa en entornos
dinámicos no estructurados, ya
que sus velocidades de giro son
extremadamente altas. Se puede
leer más sobre este cabezal en
[KUNIYOSHI et al., 1995] y en
Figura 3.36: Cabezal estereoscópico MARCONI. Cortesía DISAM.

82 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Figura 3.37: Cabezal estereoscópico Escher. Cortesía Figura 3.38: Cabezal estéreo-estático DISAM 3D.
E.T.L. Tsukuba (japón). Cortesía DISAM

las páginas web del sistema recogidas en el apéndice D.

En la figura 3.39 se aprecia el cabezal estereoscópico empleado en el sistema ROBTET explicado en


profundidad en el capítulo 5 y en [ARACIL et al., 1998]. Por último, en la 3.38 se ve el cabezal estático DISAM 3D,
que al no tener elementos móviles controlados, se minimiza la oscilación de las cámaras al ruido mecánico del suelo,
haciendo que este cabezal sea muy preciso.

Figura 3.39: Cabezal estéreo TRC. Cortesía DISAM

UPM-DISAMT-2000.31v1.0 83
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

ESTA PAGINA HA SIDO DEJADA EN BLANCO INTENCIONADAMENTE

84 [Link]
Francisco Manuel SÁNCHEZ MORENO Capítulo 3: Visión 3D estereoscópica

Indice de contenido del CAPÍTULO 3

3 VISIÓN 3D ESTEREOSCÓPICA.....................................................43

3.1 Preámbulo................................................................................................................................... 43

3.2 El modelo de cámara................................................................................................................. 44


3.2.1 Introducción.......................................................................................................................... 44
[Link] Modelo fotométrico o radiométrico............................................................................. 44
[Link] Modelo Geométrico ...................................................................................................... 45
[Link] La cámara oscura ......................................................................................................... 45
3.2.2 Modelos geométricos sin distorsión.................................................................................... 46
[Link] Modelo estenoscópico, proyección perspectiva.......................................................... 46
[Link] Proyección ortográfica................................................................................................. 47
[Link] Proyección débil ........................................................................................................... 48
[Link] Proyección paraperspectiva......................................................................................... 48
[Link] Proyección afín ............................................................................................................. 49
[Link] Geometría proyectiva ................................................................................................... 50
[Link] Rectificación.................................................................................................................. 50
3.2.3 Modelos con distorsión........................................................................................................ 50
[Link] Tipos de aberraciones ópticas ..................................................................................... 51
[Link] Proyección perspectiva con distorsión........................................................................ 52
3.2.4 Aproximación al modelo real.............................................................................................. 54
[Link] Lente delgada ................................................................................................................ 54
[Link] Óptica con zoom ........................................................................................................... 55
[Link] Óptica telecéntrica........................................................................................................ 55
[Link] Óptica métrica ............................................................................................................... 56
[Link] Ópticas experimentales ................................................................................................ 56

3.3 Estimación del modelo .............................................................................................................. 57


3.3.1 Introducción.......................................................................................................................... 57
3.3.2 Formulación y parámetros del modelo ............................................................................... 58
[Link] Parámetros intrínsecos................................................................................................. 59
[Link] Parámetros extrínsecos ................................................................................................ 59
[Link] Parámetros con distorsión ........................................................................................... 60
3.3.3 Trabajo de campo ................................................................................................................. 60
[Link] Elementos de referencia ............................................................................................... 60
[Link] Elemento de referencia empleado................................................................................ 61
[Link] Procesamiento de las imágenes................................................................................... 62
[Link] Generación del fichero de calibración ........................................................................ 62
3.3.4 Métodos de estimación ........................................................................................................ 62
[Link] Evolución histórica en la estimación del modelo ....................................................... 64
[Link] Técnicas basadas en el modelo físico.......................................................................... 66
[Link] Técnicas basadas en el modelo matemático ............................................................... 66
[Link] Método TSAI, método de la restricción radial............................................................ 66
[Link] Método DLT. Transformación lineal directa.............................................................. 67
[Link] Método en dos pasos, DLT más optimización no lineal ............................................. 69

3.4 Geometría epipolar .................................................................................................................... 70


3.4.1 Introducción.......................................................................................................................... 70
3.4.2 Modelo de una cámara ......................................................................................................... 70

UPM-DISAMT-2000.31v1.0 85
Reconstrucción 3D con iluminación láser: Aplicaciones a la Fotogrametría industrial fsanchez@[Link]

3.4.3 Modelo de dos cámaras........................................................................................................ 71


[Link] Resolución en coordenadas del mundo ....................................................................... 72
[Link] Resolución en coordenadas de la cámara................................................................... 72
3.4.4 Homografía entre puntos ..................................................................................................... 73
[Link] H∞ en coordenadas del mundo..................................................................................... 73
[Link] H∞ en coordenadas de la cámara ................................................................................ 74
[Link] Homografía entre puntos en coordenadas de la cámara¡Error!Marcador no definido.
[Link] Homografía entre puntos de un plano ......................................................................... 75
3.4.5 Condición de epipolaridad ................................................................................................... 75
[Link] Resolución en coordenadas del mundo ....................................................................... 76
[Link] Resolución en coordenadas de la cámara................................................................... 76
[Link] Matriz esencial .............................................................................................................. 77
3.4.6 Estimación del modelo en estereoscopía ............................................................................ 77
[Link] Reconstrucción Euclídea a partir de la proyectiva .................................................... 78
[Link] Calibración euclídea a partir de la calibración afín ................................................. 79
3.4.7 Calibración cinemática de un cabezal estéreo robotizado ................................................. 79
3.4.8 Sistemas estereoscópicos ..................................................................................................... 81
[Link] Sistemas existentes ........................................................................................................ 81
[Link] Sistemas pseudoestereoscópicos .................................................................................. 81
[Link] Sistemas empleados ...................................................................................................... 82

86 [Link]

También podría gustarte