VÍDEO DIGITAL
Los cinco pilares del vídeo digital
Los cinco pilares del vídeo digital que conforman la calidad del sistema son los siguientes:
Píxeles en cada imagen (4K, 5K, 6K u 8K)
Resolución espacial
Fotogramas por segundo (48, 50, 60,100 o 120 fps)
Resolución temporal
Número de bits que se emplean para codificar cada
Produndidad de color uno de los píxeles (10, 12 o 16 bits)
Capacidad para captar y reproducir niveles de brillo
Rango dinámico y matices de color
Gama de colores que el sistema es capaz de reproducir a
Gamut de color través de todas las combinaciones posibles de señales
legales con los colores primarios RGB
Cronología de los avances
01 Resolución espacial
Resolución espacial
La resolución espacial indica las dimensiones en píxeles de una imagen, es decir, el número de píxeles
que constituyen la altura y la anchura de una imagen. El término 4K, inicialmente utilizado en la industria
del cine digital, se emplea ahora para los formatos de cine, televisión o de difusión por internet que
utilizan resoluciones espaciales de aproximadamente 4.000 píxeles en sentido horizontal.
Resolución espacial
Tradicionalmente, la resolución de la televisión se ha medido en líneas. Con el término 4K se produce un
cambio de denominación puesto que el 4.000 no hace referencia a las líneas sino a las columnas de la matriz
de píxeles que componen la imagen.
El origen del término 4K proviene de los escáneres de cine que se utilizan para digitalizar cada fotograma de
una secuencia rodada sobre película fotoquímica. Nace de la búsqueda de la resolución adecuada para poder
digitalizar la película cinematográfica preservando la calidad registrada en el material fotoquímico.
Kodak diseñó el sistema Cineon con este propósito. Se utilizó por primera vez en el año 1993 para la
restauración digital del clásico de Disney Blancanieves y los siete enanitos. La película entera fue escaneada,
fotograma a fotograma, en archivos digitales de 4K a 10 bits de profundidad de color y retocada con sistemas
informáticos.
A partir de estas primeras experiencias, la resolución 4K se empezó a utilizar habitualmente en
postproducción digital de cine y posteriormente se fue concretando también para captación y como evolución
de los sistemas de televisión de alta definición.
En la siguiente tabla se pueden ver los valores de resolución espacial y relación de aspecto de los formatos
más comunes en cine (DCI) y televisión (BT-2020):
La relación de aspecto es la relación entre
la altura y la anchura de la imagen. Por
ejemplo, 1,85:1, puede significar que, por
cada centímetro vertical, hay 1,85
centímetros horizontales.
Resolución espacial
Actualmente se trabaja también con
otros formatos con resoluciones
superiores que todavía no están tan
generalizados, entre los que destacan:
La mayoría de los fabricantes de cámara
de cine digital del alta gama ofrecen la
posibilidad de grabar con resoluciones
superiores a 4K. Por citar solamente
algunos ejemplos, la Arri Alexa 65, las
cámaras RED o la Sony Venice.
Por último, en Japón, de cara a las
olimpiadas 2020, la cadena televisiva
NHK (Nippon Hoso Kyokai) promovió el
desarrollo del formato de 8K (7.680 x
4.320) para una relación de aspecto de
16:9. El formato 8K está contemplado en
la norma BT-2020 para masterización.
Resolución espacial
Formato Resolución
SD 720 x 576
(HD) 720p 1280 x 720
(HD) 1080i y 1080p 1920 x 1080
2K 2040 x 1080
4K 4096 x 2160
5K 5120 x 2700
6K 6144 x 3160
8K 8192 x 4320
Resolución espacial
Relación de aspecto
La relación de aspecto expresa la
proporción entre el alto y el ancho de la
imagen. La televisión adoptó en sus
inicios una relación de aspecto de 4:3
(1,33:1) siguiendo la tradición del formato
académico del cine. Pero en los años 50,
para la producción y exhibición
cinematográfica, se desarrollaron los
formatos panorámicos consiguiendo así
un elemento diferenciador y aumentando
la espectacularidad del formato.
En los años 2000, aprovechando la
migración digital, se implantó
mundialmente en televisión el formato de
pantalla ancha 16:9 (1,77:1).
1,33:1 1,77:1
Resolución espacial
Relación de aspecto
En cine y televisión se han utilizado dos
formas distintas para indicar la relación
de aspecto: en televisión se usa una
fracción, por ejemplo 4:3 o 16:9, mientras
que en cine se emplea un decimal en
relación a 1, por ejemplo 1,33:1 o 1,77:1.
La normalización establecida para el cine
digital DCI es 1,85:1 y 2,39:1 para formatos
panorámicos. En televisión, el estándar es
el formato 16:9.
A efectos prácticos, conviene destacar
que el formato 1,85:1 del cine es
prácticamente igual que el 16:9 de la
televisión, tan solo con un ligero recorte.
Por tanto, la relación de aspecto funciona
correctamente tanto en televisión como
en cine, simplemente se tiene que aplicar
un ligero recorte.
02 Resolución temporal (frame rate)
Resolución temporal (frame rate)
Los sistemas de edición de vídeo que se utilizan hoy en día ofrecen mucha flexibilidad a la hora de
definir la frecuencia de fotogramas o frames por segundo (fps) de una secuencia o un proyecto. En
cine, tradicionalmente se ha rodado a 24 fps, en la televisión europea a 25 fps y en Estados Unidos a
30 fps o a 29,97 fps. Las cámaras digitales pueden grabar con cualquiera de estos valores de
frecuencia y los sistemas de postproducción ofrecen herramientas para hacer las conversiones que
puedan ser necesarias.
Cuantos más fotogramas se tomen de una acción, más información se registrará sobre el movimiento
que produce. Por ello, la frecuencia de fotogramas por segundo [frame rate) de una secuencia se
denomina resolución temporal (temporal resolution).
Resolución temporal (frame rate)
El ajuste de la resolución temporal en la cámara también afectará a la definición de los bordes de los
objetos en movimiento y al efecto de desenfoque de movimiento (motion blur) . Un aumento en la
frecuencia de captación implica un aumento de la velocidad de obturación en la cámara generando
así imágenes más nítidas con un efecto de desenfoque de movimiento reducido.
Resolución temporal (frame rate)
Para Ultra HD y para cine digital se han especificado
resoluciones temporales superiores que se conocen como
High Frame Rate (HFR) . Cuando se amplía el tamaño de
representación, es decir, para pantallas de mayor tamaño,
es conveniente también aumentar el número de fotogramas
por segundo para obtener mayor nitidez y reproducir
fielmente el movimiento. Las frecuencias de 48 fps o
superiores se consideran HFR.
Estéticamente hay una diferencia notable: el desenfoque de
movimiento que el espectador está acostumbrado a ver en
el cine grabado a 24 fps, resulta artísticamente interesante.
La frecuencia HFR produce, a veces, una sensación más fría
y más real que puede no agradar a todo el mundo. Pero los
gustos del público también evolucionan con la tecnología y
la calidad de la representación se está imponiendo.
Cuando el movimiento se percibe con un efecto
estroboscópico, con tirones o falta de suavidad, es debido a
dos factores: la ausencia de desenfoque de movimiento y
una resolución temporal insuficiente. Al contrario, las
imágenes grabadas y reproducidas en HFR son más nítidas
(por la ausencia de desenfoque de movimiento) y el
movimiento es más suave. También parece que la sensación
de parpadeo aumenta cuando el contenido se ha
masterizado en alto rango dinámico (HDR).
Resolución temporal (frame rate)
La norma BT-2020 contempla, además de Frame rate Uso
los 48 fps, frecuencias de 50 y 60 fps en
exploración progresiva. Los proyectores
Es la frecuencia que se usa en la televisión PAL,
de cine digital, siguiendo la norma DCI,
25 fps
en Europa y en las regiones del mundo donde la
también incluyen la posibilidad de electricidad es de 50 Hz.
proyectar en las salas de exhibición a 48
fps.
Los nuevos desarrollos para la televisión Es la frecuencia que se utiliza en la televisión en
Ultra HD consideran valores de color NTSC, en Estados Unidos y en las demás
resolución temporal más altos aún. En las 29,97 fps regiones del mundo donde la frecuencia
eléctrica es de 60 Hz.
recomendaciones de DVB (Digital Vídeo
Broadcasting) y SMPTE (Society of Motion
Picture & Televisión Engineers) está
Es la frecuencia que se utiliza tradicionalmente
previsto alcanzar los 120 fps. Las cámaras
de cine profesional, e incluso alguna de 24 fps en cine.
gama inferior, ya ofrecen también la
posibilidad de aumentar la resolución Es la frecuencia que se utiliza en el cine digital
temporal.
23,98 fps
para facilitar las conversiones a la frecuencia
29,97 de la televisión en color NTSC.
Las frecuencias más habituales en
difusión son: 25 fps, 29,97 fps, 24 fps,
23,98 fps y 48 fps. En la siguiente tabla se
Es un estándar de resolución temporal opcional
detallan los contextos donde se usan:
48 fps en la exhibición de cine digital.
03 Profundidad de color
Profundidad de color
Otro indicador fundamental de la calidad de una imagen digital es la profundidad de color (color
depth) o profundidad de bits (bitdepth), que indica la cuantificación de la señal, es decir, cuántos bits
se utilizan para describir cada píxel.
Con este dato se expresa cuántos valores distintos de brillo y color están disponibles para codificar la
imagen.
La profundidad de color mínima en los equipos profesionales es de 8 bits por cada componente RGB,
pero actualmente, ya sea en fotografía, en vídeo o en cine digital, se pueden utilizar 10, 12 o incluso 16
bits para cada canal RGB.
Estos valores permiten aumentar la gama de colores hasta niveles iguales o superiores a los que puede
percibir el ojo humano y superiores también a los sistemas de monitorización de los que disponemos en
los ordenadores.
Este incremento de la capacidad de codificación de los matices de brillo y color se aprecia en la
representación de degradados evitando los artefactos conocidos como color banding.
Una condición indispensable para la correcta masterización en HDR es que todo el flujo de trabajo,
desde captación a emisión, se realice al menos a 10 bits de profundidad de color.
Profundidad de color
04 Rango dinámico
Rango dinámico
El rango dinámico de una imagen digital es la capacidad que tiene dicha imagen de representar
correctamente el contraste, las altas luces y las sombras profundas.
Las imágenes con alto rango dinámico (High Dynamic Range, HDR) tienen más detalle en las altas luces,
en las sombras y en los tonos medios. Sus valores máximos de luminancia son más brillantes y los
mínimos más oscuros. Con esta tecnología se persigue una nueva experiencia de usuario con una
representación en pantalla más cercana a la visión directa de la realidad.
Rango dinámico
Ajuste de los niveles de brillo: rango legal y rango extendido
Una cuestión importante de los archivos de vídeo es el nivel máximo y mínimo de brillo permitido. Las
normas técnicas de radiodifusión televisiva establecen unos niveles determinados para el blanco puro y
el negro puro, pero en exhibición de cine digital o en las pantallas de ordenador se utiliza una norma
distinta lo que implica modificar los niveles de brillo y contraste del máster en función del uso que se le
vaya a dar: cine, televisión o internet.
Rango legal Rango extendido
Rango dinámico
Ajuste de los niveles de brillo: rango legal y rango extendido
Para el ajuste de los niveles de brillo en los sistemas de rango dinámico estándar (SDR) existen dos
modelos: se denomina rango legal (rango nominal, señal legal o vídeo) a los niveles de señal para la
televisión mientras que el material ajustado para cine digital utiliza el rango extendido (señal extendida
o data).
Para la codificación a 8 bits de la señal de luminancia se disponen de 256 valores que se corresponden
con una gama de grises. En rango legal, el valor máximo permitido que se usa para el blanco puro es
235. El negro puro se sitúa en el valor 16. Cuando se dispone de 10 bits para codificar la señal, el rango
total de valores disponibles es de 1.024. En este caso los valores de la señal legal están entre el 940 que
se utiliza para el blanco y el 64 para el negro.
Bits Valores Rango legal
SDR
Blanco puro: 235
8 bits 256
Negro puro: 16
Blanco puro: 940
10 bits 1024
Negro puro: 64
Rango dinámico
Ajuste de los niveles de brillo: rango legal y rango extendido
En cine se utiliza el rango completo que nos permite la codificación digital: el rango extendido. Los
blancos se sitúan en 255 para la codificación con 8 bits y en 1.023 con 10 bits. En ambos casos los negros
se sitúan en 0.
Para la difusión de contenidos por internet no existen este tipo de normas. Las pantallas de ordenador
utilizan el rango extendido, que es el empleado cuando se prepara un máster para su difusión por
internet.
En la siguiente tabla se resumen los valores utilizados en el rango legal y extendido, tanto para la
codificación en 8 bits como en 10 bits.
Bits Valores Rango legal
HDR
Blanco puro: 255
8 bits 256
Negro puro: 0
Blanco puro: 1023
10 bits 1024
Negro puro: 0
Rango dinámico
Las curvas gamma
Para registrar 14 o 15 f-stop de rango dinámico, las cámaras de cine digital y algunas cámaras mirrorless
aplican una curva de gamma logarítmica que genera una señal de bajo contraste con un aspecto plano y
lavado. Posteriormente, se ajustan diferentes valores colorimétricos en el proceso de color grading. Con
este procedimiento se consigue más detalle en las altas luces y las sombras.
No hay un estándar de curva de gamma logarítmica, cada fabricante tiene la suya propia:
SONY: S-LOG
CANON: C-LOG
PANASONIC (LUMIX): V-LOG
BRUTO DE CÁMARA MÁSTER CORREGIDO
SIN CORREGIR
Rango dinámico
Las curvas gamma
En la siguiente imagen se puede observar un plano capturado con una cámara Sony con curva de
gamma logarítmica y el resultado final después de un ajuste de la exposición.
Rango dinámico
Las curvas gamma
Con las curvas de gamma logarítmicas se obtienen imágenes de mayor calidad ya que se evita quemar
las altas luces y empastar las sombras como hacen habitualmente las cámaras que registran con rangos
dinámicos inferiores. Pero es necesario un proceso de postproducción y corrección de color hasta
alcanzar el aspecto definitivo de las imágenes.
Simplificando un poco las cosas con fines didácticos, consideramos que las cámaras pueden utilizar tres
tipos de curvas de gamma:
Gamma logarítmica. Es una curva gamma que optimiza el rango dinámico. Genera una imagen más
lavada que requerirá un proceso posterior de corrección de color. Se utiliza en grabación de
imágenes de alta calidad: cine, ficción televisiva, publicidad, etc.
Gamma corregida. Es como funciona la gamma BT-709. Genera un contraste adecuado para la
visualización final en una pantalla SDR. Se consigue menos rango dinámico pero el material sale de la
cámara con un look más definitivo. Se utiliza en producciones donde no está prevista la corrección de
color en postproducción: televisión de flujo, reportajes informativos, directos, etc.
Gamma lineal (1,0) . Recoge directamente la información que genera el sensor. Se utiliza en los
formatos raw y en flujos de trabajo avanzados como efectos visuales (VFX) o producciones en
espacios de color más amplios como ACES.
Rango dinámico
Las curvas gamma
OUTPUT
INPUT
Curva logarítmica Curva corregida Curva lineal
05 Gamut de color
Gamut de color
Gamut de color
Un gamut de color es el conjunto de
colores que se pueden utilizar en una
determinada norma.
El gamut de la norma BT-2020 para
Ultra HD es mucho más amplio que el de
la norma BT-709 de televisión HD.
En la siguiente figura se puede observar
un gráfico que representa estos dos
gamuts en el sistema de coordenadas
CIE-1931.
BT-709 HD
BT-2020 Ultra HD
Profundidad de color
Gamut de color
El gamut BT-709 corresponde a la norma
de televisión HD y es el que se utiliza
actualmente en todos los monitores,
pantallas de ordenador, televisores y
proyectores de vídeo.
El gamut BT-2020 está todavía en una
fase inicial experimental y
prácticamente no existen monitores en
el mercado que trabajen en este espacio
de color. Los televisores 4K que se están
comercializando utilizan todavía el
espacio de color y gamma de BT-709.
Para que se generalice el uso del
espacio de color BT-2020 habrá que
esperar a una nueva generación de
pantallas.
Profundidad de color
Gamut de color
Para la proyección de cine digital, DCI ha
definido un gamut de color específico: el
DCI-P3. El gamut DCI-P3 no es tan amplio
como el de la norma BT-2020, pero es
mayor que el de la norma BT-709. Todos
los proyectores de cine digital instalados
en las salas de exhibición utilizan este
espacio de color. Los monitores
profesionales y proyectores que se utilizan
en postproducción y corrección de color se
pueden ajustar a los parámetros de DCI-P3.
Por lo tanto, a día de hoy, en
postproducción 4K se trabaja con dos
espacios de color: el de la norma BT-709
para televisión y el de DCI-P3 para cine
digital. Los distintos estándares de HDR DCI-P3 CINE DIGITAL
también vienen acompañados de un gamut
de color ampliado (Wide Color Gamut).
Dependiendo de la norma se puede
masterizar en P3 o BT-2020.
Profundidad de color
Gamut de color
Para asegurar la compatibilidad futura
en cuanto al color, se ha definido un
nuevo espacio de color más amplio y
que ofrece mayor flexibilidad para la
codificación del color: el Academy Color
Encoding System (ACES) . ACES tiene un
sistema de coordenadas mucho más
amplio que los sistemas anteriores y se
postula como el sistema de color que
mejor resistirá el paso del tiempo y el
ideal para el cine de ficción, la
producción de efectos especiales, la
masterización y el archivo a largo plazo.
La Academia de Cine de Hollywood se
ocupa del desarrollo técnico de ACES.
06 Compresión, códecs, bitrate...
Códecs
El término códec , abreviatura de
'codificador' y 'descodificador', es una
especificación que se ocupa de la
conversión de una señal de vídeo o
audio en datos digitales. La información
resultante se guarda en un 'formato' y se
utilizará para la difusión o
almacenamiento de esa señal.
El dispositivo receptor deberá conocer
el códec para poder descodificarlo y
presentar las imágenes o los sonidos.
Códecs
Submuestreo de color
El submuestreo de color (Chroma
Subsampling) es un tratamiento
consistente en reducir el número de
píxeles que se codifican en las
componentes de color reduciendo la
información del mismo. Esta estrategia
aprovecha que la visión humana es más
sensible al brillo que al color. Así, se
conserva toda la resolución de la
imagen en blanco y negro (brillo) y se
elimina información de color,
manteniendo la sensación de calidad.
En una señal 4:4:4 'Y, Cb, Cr' no hay
submuestreo de color y, por lo tanto, se
trata de una señal por componentes
equivalente en calidad a RGB. El
submuestreo 4:2:2 reduce a la mitad la
resolución espacial de las componentes
de color (Cb y Cr), preservando la señal
de luminancia (Y). El 4:2:0 reduce la
resolución del color a una cuarta parte.
Códecs
Submuestreo de color
En flujos de trabajo de alta calidad y para la postproducción, lo mejor es trabajar en 4:4:4, es decir, sin
submuestreo de color. En algunos contextos profesionales se utiliza el submuestreo 4:2:2, también
conocido como 'calidad de estudio' o 'calidad broadcast'. Para el vídeo doméstico, semi-profesional
(prosumer) y para la difusión, lo habitual es utilizar submuestreo 4:2:0.
El submuestreo de color también entra en juego en 4K. Una señal con submuestreo 4:2:0, por mucho
que sea 4K, no tendrá los mismos niveles de calidad que con 4:2:2 o 4:4:4. Estará por debajo de los
estándares profesionales de la producción de cine o televisión. Los requisitos de almacenamiento y
transmisión serán muy inferiores, pero también la calidad de la imagen resultante.
Sin embargo, con las imágenes de alta calidad, es decir, de 4K con 10 bits de profundidad de color, en
4:4:4, el tamaño de los archivos es gigantesco y el simple proceso de descargar el material a un disco
duro o realizar una copia puede resultar una ardua tarea que demande mucho tiempo. Un minuto de
material puede ocupar 1,27 GB. Será necesario por lo tanto prestar atención a la capacidad de
transferencia de las distintas conexiones y cableados, así como a la velocidad de lectura y escritura de
los discos duros que se estén utilizando.
Los sistemas de codificación tienen que encontrar un equilibrio entre la calidad de la imagen y el
tamaño del archivo que se genera. Dependiendo del segmento de mercado a los que se dirijan los
equipos (profesional o doméstico) se aplicarán distintas estrategias tecnológicas.
Códecs
Compresión
La compresión implica una determinada forma de codificar la información que posteriormente tendrá
que ser decodificada por el equipo de recepción. Cuando se codifica con una compresión con pérdidas
(lossy) se elimina parte de la información que tendrá que ser reconstruida por el receptor.
Se diferencian dos tipos de compresión:
La compresión espacial: es la que elimina la redundancia en el interior del espacio de una imagen
(compresión intracuadro).
La compresión temporal : opera sobre el flujo redundante temporal de un grupo de fotogramas
(compresión intercuadro).
Códecs
Compresión
La compresión espacial trabaja únicamente con un fotograma (frame)
Compresión intracuadro
basándose en la redundancia o la similitud de los píxeles vecinos en la
imagen, llamados bloques o macrobloques, por ello se denomina también
compresión intracuadro (intraframe) y se utiliza en los entornos de DV
producción. Un ejemplo muy conocido de compresión espacial es JPG, que
JPEG 2000
se utiliza de forma muy generalizada en fotografía y vídeo. Los códecs de
ProRes
vídeo DV, JPEG 2000 o los de la familia ProRes, entre otros muchos,
utilizan la compresión intracuadro.
La compresión temporal compara la información de cuadros sucesivos
para encontrar similitudes que se puedan expresar de forma más eficiente. Compresión intercuadro
intracuadro
Se denomina intercuadro (interframe) precisamente porque opera en una
secuencia de imágenes en movimiento.
La compresión temporal funciona con paquetes de frames GOP (Group Of MPEG 1
Pictures) que se codifican conjuntamente. Solo se guarda la información MPEG 2
no redundante con respecto al primer fotograma del grupo que se MPEG 4 (H264)
establece como referencia. Este tipo de compresión se utiliza HEVC (H265)
habitualmente en difusión y es muy eficiente para la transmisión de vídeo,
pero problemática para la edición puesto que no existe una descripción
completa de cada uno de los cuadros que componen la secuencia. Los
ejemplos más conocidos de compresión temporal son MPEG, MPEG4
(H264) y HEVC (H265).
Bit rate
Flujo de transferencia o bit rate
El flujo de transferencia binaria o tasa de transferencia (bit rate) indica el número de bits que se
transmiten por segundo. Se puede expresar en bits por segundo (bits per second-, bit/s) o en Bytes por
segundo (B/s). Un bit es la unidad mínima de información digital. Un Byte son ocho bits. Se suele
utilizar la unidad bit cuando la transmisión se produce en serie, es decir, en fila uno detrás de otro, y
Bytes cuando la transmisión de hace con ocho bits en paralelo.
Cuanto mayor sea la resolución espacial, la profundidad de color y la resolución temporal, mayor será
la cantidad de información (bits) a transmitir para poder reproducir el vídeo en tiempo real. Es decir,
cuanta más calidad tenga el formato de vídeo, mayor será el flujo de transferencia que genera.
En radiodifusión se emplea el término análogo, 'ancho de banda', para referirse al espacio
radioeléctrico necesario para transmitir la señal.
Con el fin de reducir el flujo de transferencia de las señales, y por lo tanto el ancho de banda para la
transmisión, se utiliza el submuestreo de color y los sistemas de compresión.
Todos estos valores quedan reflejados en el formato de archivo y el códec que se utilice. A modo de
ejemplo, en la siguiente figura se pueden ver las tasas de transferencia en Mbit/s que generan los
distintos codees ProRes y DNxHR para una resolución de 3.840 x 2.160 a 25 fps.
Bit rate
Flujo de transferencia o bit rate
Todos estos valores quedan reflejados en el formato de archivo y el códec que se utilice. A modo de
ejemplo, en la siguiente figura se pueden ver las tasas de transferencia en Mbit/s que generan los
distintos codees ProRes y DNxHR para una resolución de 3.840 x 2.160 a 25 fps.
Bit rate
Flujo de transferencia o bit rate
En el siguiente cuadro tienes algunos de los bitrates
que emplea la cámara SONY ALPHA 7 sIII.
Archivos RAW
Archivos RAW
Los archivos raw contienen toda la información en bruto que ha captado el sensor de la cámara. No se
pueden ver de forma inmediata porque les falta el procesado de la imagen. A esta operación de
procesado de la imagen en postproducción se le llama revelado raw. Continuando con la analogía con
el fotoquímico, se puede decir que el fichero raw contiene una 'Imagen latente' y cuando no se graba
en raw se dice que se graban 'Imágenes procesadas'.
Cada fabricante de cámaras de cine digital tiene su propio formato raw: ArriRaw, SonyRaw, CanonRaw,
RedCodeRaw, Cinema DNG, etc. Y no todos funcionan igual. Cada uno de estos formatos permite, en
mayor o menor medida, modificar en postproducción parámetros básicos, como la ganancia (ISO), la
curva de gamma, el gamut o el balance de blancos.
Los archivos de imagen procesada, a diferencia de los formatos raw, tienen estos parámetros definidos
directamente desde la cámara y no se pueden modificar. Para modificar el contraste o el equilibrio de
color será necesario hacer una nueva codificación, es decir, generar un nuevo archivo de media (clip o
media file).
La diferencia fundamental es que los cambios que se realizan en raw son a nivel de metadatos. Con los
códecs de imagen procesada estos parámetros vienen ya definidos desde la cámara y consolidados en
la imagen.
Formatos contenedores
Formatos contenedores
Un archivo audiovisual puede tener
varios audios, varios vídeos y una
Contenedor
cantidad variable de metadatos.
Todo este conjunto de
componentes se compila en
Códec de audio
formatos contenedores (container
formats).
Empaquetadas en el formato
contenedor están las componentes
de vídeo y audio. Cada una de
estas componentes está codificada Códec de vídeo
mediante un códec. Resumiendo,
un archivo de vídeo tiene un
formato contenedor y un códec, y
dentro de un formato contenedor
puede haber distintos codees.
Metadatos
Formatos contenedores
Formatos contenedores
Como ejemplos de formatos contenedores muy conocidos se Formatos contenedores
Compresión intracuadro
pueden citar:
AVI, que es el contenedor estándar de los equipos de
Microsoft.
MOV , el de los ordenadores de Apple .avi
MP4 que es el contenedor genérico que se utiliza para los
archivos codificados en MPEG-4. .mov
En entornos profesionales de producción se utiliza .mp4
frecuentemente el formato contenedor MXF (Material
Exchange Format); también se utiliza mucho MOV, por .mxf
ejemplo, para entrega a cliente. Apple ha admitido
recientemente el formato MXF para Final Cut Pro. Este
movimiento indica que MXF va a quedar como el formato
preferente para producción. La dificultad que tiene MOV es
que da problemas frecuentemente con la gamma. La ventaja
de MXF es la potencia que ofrece en los metadatos. Los
fabricantes de cámaras de cine prefieren MXF que además
ofrece mayor estabilidad para postproducción. Los archivos
para la proyección de cine digital DCI también van
encapsulados en MXF. En difusión, sobre todo para streaming,
se utiliza mucho MP4 como formato contenedor.
Clasificación de los códecs
Tipos de códecs
Existen muchos códecs para los archivos de vídeo que
ofrecen distintos niveles de calidad para la producción y
difusión de televisión y cine digital. A efectos didácticos
los podemos clasificar en cuatro grupos:
Códecs nativos de cámara
Códecs de intermediación o de postproducción
Códecs de masterización y archivo
Códecs de difusión
Pero estos grupos no son estancos, puesto que hay
cámaras que ofrecen la posibilidad de grabar con códecs
que pertenecerían tanto al apartado de postproducción
(por ejemplo, Apple ProRes) como al de difusión (por
ejemplo, H.264). Lo mismo ocurre con los sistemas de
edición y postproducción que pueden trabajar con
cualquier códec.
Clasificación de los códecs
Códecs nativos de cámara
Cada fabricante de cámaras ofrece su propia gama de Códecs nativos
Compresión de cámara
intracuadro
codees disponibles para la grabación.
Las cámaras Arri pueden grabar en ArriRaw, o también en
los códecs de imagen procesada Apple ProRes y Avid
DNxHR. ArriRaw
Sony tiene su propio formato raw, SonyRaw, para las
cámaras de cine digital y utiliza XAVC para el mercado Apple ProRes
profesional de la televisión.
Las cámaras Red utilizan para raw un formato propio, el Avid DNxHR
Redcode Raw y también permiten la grabación en Apple
ProRes y Avid DNxHR. SonyRaw
La gama más alta de producto de Canon también tiene su
códec raw, el CanonRaw. En equipos más económicos, como XAVC
la cámara Canon EOS ID C, utilizan el códec Motion JPEG en
4K con algo de compresión. Redcode Raw
Las cámaras de Blackmagic utilizan el códec raw
CinemaDNG 4K y también permiten grabar en las distintas CanonRaw
calidades de la familia Apple ProRes o Avid DNxHR.
Las cámaras que no están dirigidas al mercado profesional
CinemaDNG 4K
utilizan códecs con fuerte compresión H.264 y submuestreo
de color 4:2:0.
H.264
Clasificación de los códecs
Códecs de intermediación
Los códecs de intermediación se emplean en postproducción Códecs de intermediación
Compresión intracuadro
de alta calidad para el montaje online y para la corrección de
color. Tratan de mantener la calidad de las imágenes
originales con una compresión mínima y procurando que el
peso final de los archivos no sea muy alto.
También se emplean códecs de intermediación para el
Apple ProRes
montaje offline, creación de dailies de visionado, etc.
Normalmente estos van asociados a niveles mayores de
Avid DNxHR
compresión y menor peso de archivo.
Existen muchos códecs de intermediación, aunque los más
utilizados para 4K son los ProRes de Apple y los DNxHR de
Avid.
Clasificación de los códecs
Códecs de masterización y archivo
Códecs de masterización
Compresión intracuadroy
Una vez terminada la postproducción se utilizará un códec
de máxima calidad para archivar el material. En este archivo
momento de la cadena de producción, el espacio que ocupe
el fichero ya no es tan relevante, por lo tanto, se utilizarán
códecs sin compresión o con compresión sin pérdidas, DPX
especialmente en cine digital. Es habitual utilizar secuencias
de imágenes fijas, es decir, una imagen fija independiente QUICKTIME sin
para cada frame. La ventaja de este sistema es que si, por
algún motivo, se corrompe un fichero, el resto de los frames compresión
quedan intactos. Ofrece también cierta garantía de que el
formato no quedará anticuado o descatalogado con el paso MXF
del tiempo.
El inconveniente de estos formatos de archivo es que ocupan XAVC
muchísimo espacio de almacenamiento.
Los formatos más utilizados son DPX, QuickTime (QT) sin AVC Ultra
compresión y MXF. El formato DPX es el más recomendable
hoy en día porque MXF o QT demandan más capacidad de IMF
proceso a la máquina.
Clasificación de los códecs
Códecs de masterización y archivo
Algunos fabricantes que tienen intereses en el sector de los Códecs de masterización
Compresión intracuadroy
archivos audiovisuales han creado archivo
códecs de masterización y archivo con algo de compresión
que encuentran un equilibrio entre
la calidad y el espacio de almacenamiento necesario.
Podemos destacar el XAVC de Sony o el AVC Ultra de
DPX
Panasonic. Este tipo de códecs son más apropiados para los
flujos de trabajo de televisión Ultra HD.
QUICKTIME sin
Actualmente, impulsado mayoritariamente por el gigante de compresión
streaming Netflix, está
comenzando a masterizarse en IMF (Interoperable Master MXF
Format).
EL IMF es un formato de máster que emplea cápsulas MXF y XAVC
ciertos códecs que permiten transportar la mínima media
imprescindible y la máxima cantidad de metadatos para los AVC Ultra
distintos visionados.
Por ejemplo, si el colorista ha realizado dos etalonajes de un IMF
proyecto, uno para HDR y otro para SDR, en un máster IMF no
tienen por qué viajar dos archivos de media sino tan sólo el
archivo de media HDR y la metadata necesaria para la
conversión automática a SDR.
Clasificación de los códecs
Códecs de difusión
El estándar de difusión del cine digital es el DCP (Digital Códecs deintracuadro
Compresión difusión
Cinema Package) de DCI (Digital Cinema Initiatives). El DCP
utiliza el códec JPEG 2000, que es una secuencia de
fotogramas con compresión JPG que se encapsula en MXF.
Tiene un sistema propio de encriptación para evitar usos
ilegítimos de las copias de alta calidad que se proyectan en
DCP
las salas.
El DCP es uno de los pocos ejemplos en los que el sistema de
H.264
masterización y el de emisión coinciden. Es decir, el DCP que H.265
se masteriza en el laboratorio tiene exactamente la misma
calidad y características que el que se proyecta en el cine, no
hay transformaciones intermedias.
Clasificación de los códecs
Códecs de difusión
Para la difusión en televisión se utilizan códecs orientados a Códecs deintracuadro
Compresión difusión
optimizar el ancho de banda de transmisión. Se utilizan los
códecs MPEG2 o MPEG4 (H.264) para la televisión digital de
resolución estándar y de alta definición. El nuevo salto en
esta familia de códecs es el MPEG-H Vídeo, más conocido DCP
como HEVC (H.265), el códec que se está utilizando para la
ultra alta H.264
definición.
H.265
07 La cámara
Sensores
Sensores
Los sensores están en el plano focal
de las cámaras digitales. Es el
plano donde convergen los haces
de luz que atraviesan el objetivo y
está compuesto por una matriz de
millones de cavidades captadoras
de luz llamadas fotodiodos o
fotositos. Durante la exposición, los
fotodiodos quedan al descubierto
para recoger y almacenar la
información de brillo y color de
cada píxel.
Sensores
Sensores
Para captar el color se colocan unos filtros cromáticos
delante de cada uno de estos fotodiodos.
La tecnología más extendida para esta función es la máscara
de Bayer que está formada por un 50% de filtros verdes, un
25% de rojos y un 25% de azules. Interpolando dos muestras
verdes, una roja y una azul se obtiene un píxel de color. En
los archivos raw se guarda la información del patrón de
Bayer de forma directa, sin interpolaciones. Por ello, al
proceso de relevado raw también se le conoce como
‘debayerización’ (debayering).
Sensores
Sensores
Aparte de los filtros de color del patrón
Bayer, en un sensor hay otros elementos:
un filtro de paso bajo para el anti-
aliasing
un filtro de infrarrojos (IR)
unas microlentes
unos filtros de densidad neutra (ND),
dependiendo de las cámaras.
Sensores
Sensores
A día de hoy el rango dinámico es el gran reto para aumentar
la sensación de calidad de una imagen, tanto o más que la
resolución.
Al aumentar el tamaño de los fotodiodos, es decir con sensores
grandes con menos megapíxeles, llega más cantidad de luz y,
por lo tanto, se incrementa potencialmente el rango dinámico.
El tamaño del sensor determina el tipo de objetivo que se
necesita. Las cámaras de cine tradicionales utilizaban película
de 35 mm y la denominación de los tamaños de los sensores
digitales sigue utilizando esta referencia, indicando así que los
objetivos que se utilizaban en cine y en fotografía siguen
siendo válidos para estas nuevas cámaras.
Pero los términos 35 mm, Super 35 mm, full frame, etc., no son
muy precisos puesto que el número 35 hace referencia al ancho
en milímetros de una película fotoquímica considerando
también la zona de las perforaciones y sin tener en cuenta la
relación de aspecto. En la siguiente imagen se puede apreciar
la correlación de tamaño de la película fotoquímica y los
sensores digitales de Super 35 mm.
Sensores
Sensores
El tamaño del sensor tiene también una influencia directa en la
profundidad de campo. Las cámaras con sensores más grandes,
por las características de la óptica que utilizan, dan menos
profundidad de campo. Por este motivo, en televisión se han
utilizado habitualmente sensores pequeños, más sencillos de
ajustar y que dan mucha profundidad de campo. Es una
característica muy efectiva para grabaciones rápidas realizadas
por un solo operador. En cine, con película de 35 mm, el foco era
más crítico dando lugar a bellas imágenes que utilizan el
enfoque selectivo. Las cámaras digitales de cine han heredado
esa característica porque utilizan sensores grandes.
Para aumentar la espectacularidad y la calidad de la imagen
cinematográfica se ha utilizado, en algunas ocasiones, la
película de 70 mm (la imagen en positivo que se proyectaba
ocupaba aproximadamente 65 mm). En cine digital también se
está viendo la misma tendencia: la Alexa 65 tiene un sensor de
65 mm que requiere objetivos fabricados específicamente para
este tamaño; Red y Panavision también han lanzado nuevas
cámaras 8K con un sensor de tamaño superior al full frame.
Sensores
Sensores
Sensores
Los sensores más grandes (de 65 mm) se utilizan en las cámaras de cinematografía de gama alta, como
por ejemplo la Arri Alexa 65 con una resolución espacial de 6K (6560 x 3102).
El formato full frame (equivalente a 35 mm-8 perforaciones) se utiliza mucho en fotografía y
recientemente se está extendiendo en cinematografía. Hay cámaras mirrorless, como la Sony Alpha A7
sIII, que graban vídeo en 4K con un sensor full frame que consigue unos resultados espectaculares en
condiciones de baja luz y en cuanto a rango dinámico.
Las cámaras de cine digital Sony Venice, Red Monstro 8K VV, Panavision DXL, Arri Alexa LF o Arri Alexa
Mini LF también emplean tamaños de sensor similares.
La mayoría de las cámaras de cine digital utilizan el sensor de Super 35 mm-3 perforaciones: las Arri
Amira y Alexa Classic, las de Red, las de Sony, las de Panasonic, etc.
El sensor de las Arri Alexa XTS está más cercano al Super 35 mm-4 perforaciones con una proporción de
1,55:1 (modo llamado en las Alexa Open Gate 4:3). Esta relación de aspecto se utiliza en muchas ocasiones
con lentes anamórficas 2x para hacer los formatos panorámicos scope 2,39:1.
El sensor de 2/3’’ se utiliza frecuentemente en cámaras de televisión.
Sensores
Sensores
El factor de recorte
Es la relación existente entre el tamaño de un sensor de Full Frame (36mm x 24mm) y otros tamaños de
sensor.
Como podrás imaginar, esta referencia al sensor de 35mm viene de la época de la fotografía química, en
que el tamaño de los negativos más populares y utilizados por los fotógrafos era, precisamente, de 36mm
x 24mm.
En el momento de la evolución al mundo digital, éstas fueron las dimensiones de los primeros sensores
que se comenzaron a crear. Sin embargo, pronto se empezó a trabajar con sensores más pequeños que
permitieron reducir costes y democratizar el acceso a la fotografía digital hasta los niveles que hoy
conocemos.
A partir de ese momento se empezó a hacer una distinción entre cámaras con sensor de formato
completo (Full Frame) y cámaras con sensor de tamaños más reducidos.
La diferencia entre los sensores radica en el tamaño de los mismos, así, el de formato completo, ofrece
una mayor área sensible que la que ofrecen los sensores APS-C. Lo que se traduce en que son capaces de
captar una región de escena superior.
Por tanto, si situamos el mismo objetivo, con la focal que tenga, delante de un sensor full frame y luego
delante de un sensor APS-C, observaremos que la región de escena que captan es distinta, mucho más
reducida en el caso del sensor APS-C.
Sensores
El factor de recorte
En términos de porción de escena recogida en la
imagen, efectivamente, podríamos decir que el 50mm se
comportaría sobre un sensor APS-C con factor de recorte
(o de multiplicación) de 1.5x, como un 75mm sobre un
sensor full frame.
Pero en ningún caso, podríamos decir que el sensor
altera o modifica la focal del objetivo. Como sabes, la
focal de un objetivo no sólo afecta a la parte de escena
recogida, también hay otros aspectos como: la
profundidad de campo, la compresión de elementos en
la escena o la distorsión que se produce en la misma
(especialmente con grandes angulares).
Pues bien, ninguno de estos aspectos son modificados
por el factor de recorte, por eso no es apropiado decir
que este factor multiplica la focal del objetivo. Ya que lo
único que logra es reducir la cantidad de escena
retratada, que simule el resultado que se obtendría al
usar una focal más larga sobre un sensor full frame y, por
tanto, una mayor magnificación, pero nada más.
Sensores
El factor de recorte
Ejemplo
+ = +
Sensor APS-C. Nikon 1,5x Objetivo 50 mm Sensor Full Frame Objetivo 75 mm
Ópticas
En ópticas de cine podemos empezar diferenciando las
ópticas anamórficas de las esféricas.
Las anamórficas se utilizan para hacer los formatos
panorámicos scope. Comprimen la imagen en sentido
horizontal para aprovechar toda la superficie del sensor
deformando ópticamente la imagen. En postproducción se
‘desanamorfiza’ para obtener el formato panorámico final.
La mayoría de los fabricantes ofrecen lentes anamórficas
con dos factores de deformación horizontal: 1,3x y 2x.
Por ejemplo, se puede utilizar una cámara Alexa SXT con
sensor cercano al 4:3 (Super 35 mm-4 perforaciones) y una
óptica anamórfica para cubrir gran parte del sensor. Si el
factor de multiplicador es un 2x se obtendrá una imagen
suficientemente panorámica para recortarla a 2,39:1.
Las ópticas esféricas son las que no deforman ópticamente
la imagen.
También se pueden clasificar las ópticas por su distancia
focal . Los objetivos con distancia focal fija son ópticamente
menos complejos y suelen dar más calidad. Los de distancia
focal variable son los zooms y se utilizan mucho para
televisión.
Ópticas
Aliasing
Al aumentar la resolución de los sensores también se han
intensificado los problemas de aliasing , un defecto de las
imágenes en movimiento que se produce cuando no se
puede discernir con claridad algunos elementos de detalle y
aparecen cosas que no son reales: líneas en diagonal, efecto
rejilla, bandas de color, etc. El aliasing más común es el
moiré que se produce, por ejemplo, al grabar a un personaje
con una camisa de rayas finas o al filmar una textura de
rejilla. Es un problema que surge por la combinación de una
óptica y un sensor. A mayor resolución, más pares de líneas
por milímetro y más problemas de aliasing.
Los filtros de paso bajo que tienen los sensores, también
llamados filtros de anti-aliasing, sirven para paliar este
problema, pero bajan la resolución, la nitidez y el contraste
que puede dar el objetivo.
Ópticas
Bokeh
Otro aspecto estético importante
para caracterizar una óptica es el
bokeh. Es un término que se Lente esférica:
utiliza para referirse a la calidad
de un objetivo basada en la
Bokeh redondo
estética de las zonas
desenfocadas que produce.
Bokeh, en japonés, significa
desenfoque. Es especialmente
importante en objetivos muy
luminosos, ya que en sus mayores
aperturas de diafragma pueden
producir una profundidad de
campo mínima y, por tanto, gran
parte de la imagen aparecerá Lente anamórfica:
desenfocada. Bokeh alargado
Ópticas
Flares
El uso de lentes anamórficas
genera flares horizontales que se
crean en los puntos de luz
intensos.
Ópticas
Rolling shutter
El rolling shutter es un método de captura de
imagen realizado con un sensor CMOS , donde el
obturador capta la escena a partir de un barrido. La
fotografía o vídeo no corresponde a una escena
entera en un instante de tiempo, sino que el
obturador la escanea rápidamente de manera
vertical u horizontal. En otras palabras, no todas las
partes de la escena están grabadas exactamente en
el mismo momento, pero la imagen final está
mostrada como si representara un solo instante de
tiempo. Esto produce distorsiones en objetos con
movimientos rápidos o con determinados efectos de
luz. Este fenómeno no sucede en otros dispositivos
como el «obturador global» donde toda la imagen es
capturada en el mismo instante.