100% encontró este documento útil (1 voto)
23 vistas37 páginas

Todo Lo Que Necesitas Saber: Audio

Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
100% encontró este documento útil (1 voto)
23 vistas37 páginas

Todo Lo Que Necesitas Saber: Audio

Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

TODO LO QUE NECESITAS SABER

3D
SOBRE

AUDIO

Nuno Fonseca, PhD


REVISADO POR

Francisco Bissone
[Link]
Todo lo que Necesitas Saber Sobre 3D Audio Prólogo

Prólogo
Agosto de 2020

El sonido inmersivo es el futuro del audio. El cine, la televisión, la realidad virtual y la


realidad aumentada, los videojuegos, la música, los museos… Todo mundo está
apostando por el audio 3D como una manera de ofrecer una experiencia inmersiva y
mejor al público. Sin embargo, el audio 3D introduce nuevos conceptos y algunas
nuevas/antiguas tecnologías que los profesionales pueden no entender a la primera,
con términos como 7.1.2, VBAP, 22.2, objetos, camas, formato B, AmbiX, ACN, SN3D,
HRTF o HRIR.

Este e-book, basado en conferencias que he impartido en las convenciones de la AES


(Audio Engeneering Society), intenta resumir la información más relevante sobre este
tema, incluyendo audio basado en canales, basado en objetos, Ambisonics y binaural.

Espero que te guste. ¡Bienvenido al mundo del sonido 3D!

Nuno Fonseca, PhD

[Link]@[Link]

SOBRE NUNO

Nuno Fonseca (PhD), es el fundador y CEO de la empresa


Sound Particles. Además, es el creador del software Sound
Particles, un software de audio 3D de tipo CGI utilizado en
gran parte de los estudios de Hollywood en producciones
como Star Wars 9, Frozen II, Aquaman o Juego de Tronos.

Antiguo profesor de universidad (ciencias computacionales


y tecnología de la música), Nuno es el autor del libro en portugués Introdução à
Engenharia de Som (Introducción a la ingeniería del sonido), coautor del libro en
portugués Desenvolvimento em iOS (Desarrollo en iOS) y autor de más de 20
publicaciones sobre la investigación en el terreno del audio.

Es miembro de AES, SMPTE, CAS, MPSE, AMPS, y forma parte el Comité Técnico de
Audio en el Cine de la Audio Engineering Society (AES).

[Link] © 2022 Sound Particles S.A. 2


Todo lo que Necesitas Saber Sobre 3D Audio Índice

Índice
Prólogo 2

Audio basado en canales 4


Estéreo 4
Altavoz central 5
Altavoces Surround (Envolventes) 6
LFE/Subwoofer 7
Otras disposiciones horizontales (6.1/7.1) 8
Audio inmersivo 9
Pros y contras 10

Audio basado en objetos 12


Audio basado en canales VS. audio basado objetos 12
Objetos 14
Dolby Atmos 15
Camas 16
Pros y contras 18

Ambisonics 20
Mid-Side 20
Ambisonics 22
Micrófonos Ambisonics 23
High Order Ambisonics (HOA) / Ambisonics de Ordenes Superiores 24
Las múltiples variantes de Ambisonics 25
Aplicación en RV (Realidad Virtual) 27
Pros y contras 28

Audio binaural 29
Percepción 29
HRTF 30
Personalización de la HRTF 32
Cómo utilizar el audio binaural 34
Pros y contras 34

Conclusión 36

[Link] 3
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

Audio basado en canales


Muchos formatos de sonido, como el estéreo o el 5.1, están asociados a una cantidad
preestablecida de canales y a una posición predefinida de los altavoces. Por ese
motivo, se conocen como formatos de audio basado en canales. Pero antes de
profundizar y empezar a hablar sobre sonido 3D y inmersivo, es importante repasar
algunos formatos básicos de sonido para poder establecer las bases del sonido 3D.
Por tanto, empecemos por el formato más sencillo.

Estéreo
El modo estéreo intenta recrear una imagen
sonora frontal utilizando 2 altavoces. Si
enviamos la misma señal a los dos altavoces,
se genera una imagen fantasma y
percibiremos el sonido como si viniese
directamente de la parte frontal. Si
modificamos la relación de ganancia entre
los dos altavoces, podemos hacer que el
sonido «se mueva» entre los altavoces
derecho e izquierdo.

Con el modo estéreo, se suele considerar Figura 1. Disposición de sonido estéreo: 2


que los altavoces se colocan con un ángulo altavoces con un ángulo aproximado de 60°, lo
de unos 60 grados. ¿Por qué? que permite crear un perfecto triángulo
equilátero.
Por un lado, porque queremos que la imagen
sonora sea lo más amplia posible. Si el ángulo es pequeño (colocando los altavoces
cerca uno del otro), la imagen será muy pequeña y estrecha. Por otro lado, si
aumentamos el ángulo a más de 60° (separando los altavoces), la imagen frontal
empieza a romperse. En lugar de tener una imagen fantasma frente a nosotros,
perdemos la percepción de un sonido central y comenzamos a percibir dos sonidos
independientes, uno proveniente del altavoz izquierdo y otro del altavoz derecho,
creando un hueco en el medio, donde ningún sonido es percibido.

[Link] 4
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

Altavoz central
En un momento determinado, la industria del
cine decidió añadir un altavoz central entre
los altavoces derecho e izquierdo que
plantea la siguiente cuestión: «Si somos
capaces de generar una imagen sonora
entre un par de altavoces estéreo, ¿por qué
necesitamos un altavoz central adicional?».

A veces, incluso escucho a mezcladores de


prestigio mundial, que han mezclado
álbumes de música famosos en sonido Figura 2. Disposición estéreo + altavoz central
envolvente (surround), afirmar que no utilizan
el altavoz central porque no lo echan de menos. Pero ¿por qué no necesitan el
altavoz central?

Lo que ocurre es que el mundo no es un lugar perfecto, y en el mundo del sonido


espacial, esto significa que no todo el mundo tiene por qué estar en la posición de
escucha óptima (sweet spot). Si estás en el sweet spot, los altavoces izquierdo y
derecho serán suficientes para crear la imagen sonora frontal entre ellos, pero hay
muchas situaciones en las que el oyente no está en ese sweet spot.

Por ejemplo, en una sala de cine, solo unos pocos tienen el privilegio de estar
sentados en el sweet spot. La mayoría de los oyentes estarán demasiado hacia un
lado, demasiado hacia adelante o demasiado hacia atrás. Los altavoces izquierdo y
derecho se colocan detrás de la pantalla de proyección, cerca de los extremos. Como
podrás imaginar, cualquier persona que se siente en las filas delanteras, tendrá un
ángulo izquierda-derecha de más de 60°, lo que puede romper la imagen sonora
frontal y crear un hueco en el centro. Por otra parte, la gente que está sentada en los
laterales estará más cerca de un altavoz que del otro, por lo que habrá una
«distorsión» de la imagen sonora (no una distorsión del sonido, sino una distorsión de
la percepción).

Para todas estas situaciones es necesario un altavoz central que funcionará como un
ancla de referencia que nos ayudará a tener una imagen sonora más definida y
estable, especialmente para las personas que están fuera del sweet spot, es decir, los
sitios no ideales. Y este es el motivo por el cual es tan habitual utilizar el altavoz
central en la industria cinematográfica: dentro de la sala, hay muchísimas personas
que no han tenido la suerte de sentarse en el sweet spot.

[Link] 5
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

Altavoces Surround (Envolventes)


Para mejorar la experiencia cinematográfica,
los cines empezaron a introducir altavoces
adicionales en los laterales. En lugar de
explorar únicamente la imagen sonora
frontal, ahora una película podría explorar
otras direcciones del sonido añadiendo
sonidos procedentes de los laterales, lo cual
hace que la experiencia sea mucho más
realista y que el público esté inmerso en la
escena (p. ej., un campo de batalla).

Uno de los primeros formatos fue el LCRS


(del inglés, Left, Center, Right, Surround).
Con este formato, empezamos a tener 5 Figura 3. Disposición LCRS

altavoces y 4 canales de audio. En este caso,


el canal de sonido envolvente es sólo un único canal de audio que se reproduce a
través de los dos altavoces surround, es decir, se reproduce exactamente el mismo
audio en el altavoz de sonido envolvente izquierdo y en el derecho.

Posteriormente, con la llegada de formatos como el 5.1, empezó la independencia del


altavoz surround izquierdo y del altavoz surround derecho, ya que cada uno tenía su
propio canal de audio.

En las salas de cine, los canales de sonido envolvente no se reproducen por un


solo altavoz, sino por una serie de altavoces. Si vas a ver una película en una sala
con sistema de sonido 5.1, notarás que hay varios altavoces distribuidos por las
paredes laterales y trasera. Sin embargo, en realidad solo están reproduciendo 2
canales de sonido. Esto significa que todos los altavoces de la pared izquierda y
todos los del lado izquierdo de la pared trasera reproducen exactamente lo mismo.
Lo mismo ocurre con los del lado izquierdo, que reproducen el canal derecho de
sonido envolvente.

¿Por qué se utilizan tantos altavoces en vez de utilizar un solo altavoz a cada lado?

En primer lugar, porque al añadir altavoces estamos evitando que aparezcan


«huecos» en la imagen sonora. Sí, estamos perdiendo un poco de resolución
espacial, ya que el sonido envolvente ahora será más difuso, casi fuera de foco, pero
no habrá huecos, es decir, zonas en las que no haya sonido.

En segundo lugar, el mundo no es perfecto y, una vez más, habrá mucha gente que no
esté sentada en el punto óptimo de escucha (sweet spot). Con este abordaje de
arreglo de altavoces, te sientes donde te sientes, estarás rodeado de varios

[Link] 6
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

altavoces. Si la sala de cine utilizase un solo altavoz para cada canal de audio, habría
grandes huecos que afectarían a algunos espectadores. Por ejemplo, una persona del
fondo de la sala tendría el altavoz de sonido envolvente a los lados (o ligeramente
hacia el frente) y no se estaría reproduciendo nada por detrás; una persona sentada
cerca de los laterales quizá podría tener el sonido del altavoz surround viniendo
desde atrás y sin sonido de la pared trasera, etc.

LFE/Subwoofer
En un momento dado, la industria
cinematográfica también quería aumentar el
impacto del sonido con frecuencias más
bajas en efectos como las explosiones o los
terremotos. El problema de las frecuencias
bajas es que los humanos no son sensibles a
esos rangos de frecuencia, es decir, para
que un humano pueda escuchar frecuencias
por debajo de 80 Hz, estas deben tener un
sonido muy potente, con niveles de SPL1
elevados, para lo cual se necesitan altavoces
Figura 4. Disposición sonido envolvente 5.1
muy potentes que permitan reproducir estos
tipos de frecuencias.

Para reproducir esas frecuencias se necesita mucha potencia y existen dos posibles
maneras de alcanzar el resultado deseado.

La primera, y aparentemente la solución obvia, sería utilizar unos altavoces más


potentes para tener un sistema de sonido más potente y, por tanto, capaz de
reproducir esas frecuencias bajas. Esta solución tendría un coste elevado, ya que
sería necesario sustituir todos los altavoces por otros nuevos más potentes. Además,
tendríamos que hacer frente a problemas en el rango dinámico. En ese momento, los
sistemas eran analógicos y tenían un rango dinámico bajo, es decir, que el rango
entre el sonido más bajo y el ruido de fondo del sistema era pequeño. Así que,
aunque hubiese potencia suficiente para reproducir esas frecuencias bajas, también
se estaba aumentando el nivel de ruido del sistema, algo que sería más notorio en
pasajes suaves, como, por ejemplo, las escenas con diálogos.

La segunda posibilidad, y también la que presentaba más ventajas en aquel momento,


era incorporar un altavoz adicional solo para las frecuencias bajas y con su propia
señal de audio. ¿Por qué? En primer lugar, porque los humanos no somos capaces de
detectar la dirección de las bajas frecuencias, por lo que, en caso de utilizar un solo
altavoz (con una sola dirección), ni el sentido del espacio se vería afectado ni se

1. Nivel de presión sonora

[Link] 7
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

produciría una disminución de la imagen sonora. En segundo lugar, los otros


altavoces funcionarían en al mismo rango de potencia, por lo que no habría
problemas en el rango dinámico como un incremento del nivel de ruido. Tercero, al
tener su propio canal de audio (LFE), los sistemas ya sabrían que este canal se
debería reproducir a un nivel más alto que los otros canales (una vez más,
aumentando la potencia de las frecuencias bajas sin que esto afecte al rango
dinámico de otros canales). Y, cuarto, las salas de cine solo tendrían que comprar un
altavoz adicional en vez de tener que sustituir todos los altavoces. Y así fue como
surgió el «.1» del 5.1: 5 canales principales (izquierdo, centro, derecho, izquierdo
surround y derecho surround) y 1 canal para los efectos de baja frecuencia (el «.1» del
nombre de este sistema).

Es importante hacer hincapié en el hecho de que LFE y subwoofer son conceptos


diferentes. El LFE es el nombre del canal de audio que transporta estas
frecuencias bajas, mientras que el subwoofer es el nombre del altavoz que
reproduce esas frecuencias.

Otras disposiciones horizontales (6.1/7.1)


Además de la 5.1, se crearon otras disposiciones añadiendo canales adicionales.

En la década de los noventa se creó el SDDS de Sony, que utilizaba una configuración
7.1, pero con 5 altavoces frontales (izquierdo, izquierdo centro, centro, derecho centro,
derecho) y 2 canales de sonido envolvente. Con los altavoces adicionales de la parte
frontal, el SDDS estaba especialmente concebido para salas de cine con pantallas
grandes en las que 3 altavoces no eran suficientes para las filas delanteras.

Posteriormente, Dolby desarrolló el Dolby Digital EX, un formato 6.1 con un altavoz
trasero de sonido envolvente para aumentar la percepción del sonido en la parte de
atrás. Este formato se estrenó con Star Wars: Episodio I.

Finalmente, se adoptó el 7.1 tradicional, con 3 canales frontales y 4 canales de


sonido envolvente, lo que permitía aumentar la resolución del espacio en los
laterales y atrás.

Figura 5. Disposición Dolby Digital 6.1; disposición Sony 7.1; formato 7.1 actual

[Link] 8
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

Audio inmersivo
La expresión «audio inmersivo» generalmente hace referencia a sistemas de audio
que permiten percibir el sonido proveniente de otras direcciones además del plano
horizontal. En lugar de colocar altavoces solo en el plano horizontal (frontal, lateral y
posterior), los sistemas inmersivos pueden explorar el componente de altura, por
ejemplo, agregando altavoces en el techo o incluso en el suelo.

Así, llegaron varios formatos, como Auro


11.1/13.1, IMAX 12.0 o NHK 22.2, entre otros.

Por ejemplo, Auro 11.1/Auro 13.1 parte de


una configuración de 3 planos de altavoces:
un plano horizontal con 5.1 o 7.1, un plano de
altura con una configuración de 5.0 con una
elevación de unos 30°, más un altavoz
instalado encima del oyente (llamado «voz
de Dios» por motivos obvios). De este
modo, tendríamos 5.1 + 5.0 + 1 = 11.1 o 7.1 +
5.0 + 1 = 13.1.

El abordaje de IMAX 12.0 es ligeramente Figura 6. Auro 13.1 (cedido por Auro
Technologies)
diferente. Parte de 12 canales, entre los que
se encuentran los 7 canales tradicionales del
plano horizontal, más 5 canales elevados para explorar la dimensión de la altura y sin
canales LFE (de ahí el cero de «12.0»).

El NHK 22.2, el formato creado por la televisión pública japonesa, va un paso más
allá: cuenta con 2 canales LFE (izquierdo y derecho), un plano inferior con 3 altavoces
(por debajo del plano horizontal, en la parte frontal, con sonido procedente del suelo),
un plano horizontal con 10 canales (5 en la parte frontal y 5 de sonido envolvente) y
un plano de altura con 8 canales + 1 «voz de Dios» (3.2 + 10 + 8 + 1 = 22.2).

[Link] 9
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

Figura 7. NHK 22.2

PANEO 3D

En el plano horizontal, el sonido se suele panear entre


2 altavoces para simular direcciones intermedias.
Cuando pasamos a una configuración inmersiva, ocurre
lo mismo, pero ahora con triángulos de 3 altavoces: si
aplicamos más o menos sonido en cada altavoz,
podemos crear una percepción del sonido que
proceda de cualquier punto de este triángulo de
altavoces. Esta técnica de paneo se denomina paneo
por amplitud de base vectorial (VBAP, del inglés
Vector Base Amplitude Panning).
Figura 8. Paneo 3D

Pros y contras
El audio basado en canales tiene sus pros y sus contras. La principal ventaja es que
es el sistema perfecto si sabemos de antemano la disposición exacta de los
altavoces en los que se va a reproducir el sonido. Por ejemplo, saber de antemano
que mi mezcla se va a reproducir en un sistema 5.1, con los altavoces ubicados en una
posición predeterminada, es fantástico. En ese caso, podemos utilizar exactamente
las mismas condiciones en el estudio y hacer una mezcla perfecta.

El principal problema del audio basado en canales es la falta de flexibilidad, ya que


está fijado a una configuración concreta de los altavoces y cualquier cambio en la
disposición de los altavoces requerirá una nueva mezcla. Por ejemplo, si una película

[Link] 10
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en canales

se estrena en estéreo, 5.1, 7.1, 11.1 y 22.2, necesitará 5 mezclas diferentes, una para
cada formato.

Esto nos hace plantearnos lo siguiente: ¿Se puede crear un formato que no dependa
de la disposición de los canales de salida? ¿Se puede crear un formato en el que una
sola mezcla se pueda adaptar automáticamente a diferentes configuraciones de
altavoces? Efectivamente, con audio basado en objetos y con Ambisonics.

[Link] 11
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

Audio basado en objetos


El audio basado en objetos empezó a ganar protagonismo con la aparición de Dolby
Atmos . Pero ¿en qué consiste exactamente el audio basado en objetos?

Audio basado en canales VS. audio basado


objetos
Antes de empezar con el audio basado en objetos, analicemos cómo se crea y cómo
se distribuye el audio basado en canales.

La base del audio basado en canales es tener una disposición prestablecida de los
altavoces, como, por ejemplo, estéreo o 5.1, lo que significa que sabemos de
antemano la configuración en la que se reproducirá la mezcla. Entonces nuestra
mezcla es creada exclusivamente para esa cantidad y disposición de canales, que
luego se distribuyen (por ejemplo, se transmiten, se almacenan en un archivo o
DVD). Durante la reproducción solo hay que enviar cada señal de audio al altavoz
correspondiente.

Figura 9. Audio basado en canales

En el estudio, todos los sonidos pasan por un panner, que controla la cantidad de
sonido que se va a reproducir en cada canal de salida. Por ejemplo, en una mezcla
5.1, si queremos colocar el sonido entre el altavoz central y el derecho, lo

[Link] 12
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

controlaremos con el panner, que pondrá la cantidad correcta de la señal en los


canales central y derecho, pero no en los demás canales.

Además, la salida de todos los panners se mezcla junta (utilizando un bus) antes de la
distribución: la salida izquierda de todos los panners se mezcla y se coloca en el
canal izquierdo, lo mismo ocurre con el canal derecho y así sucesivamente.

Por último, se distribuye la señal de salida (DVD, streaming, etc.) y se reproduce a


posteriori.

La idea del audio basado en objetos es ligeramente diferente. En vez de mezclar


todos los sonidos en el estudio y distribuir la mezcla final, el audio basado en objetos
utiliza un abordaje diferente, ya que distribuye todos los sonidos de forma
independiente y solo se mezclan durante la reproducción.

En el estudio seguirá siendo necesario un panner para colocar el sonido, pero esa
información de paneo no se aplica al sonido, ya que únicamente hay que indicar
dónde se quiere ubicar cada sonido. Esa información se distribuye y, durante la
reproducción, dependiendo del sistema de reproducción, esa información de paneo
se aplica al sonido.

Figura 10. Audio basado en objetos

Básicamente, lo que se distribuye son las intenciones: «quiero que este sonido se
coloque aquí y que este otro esté allí». Después, durante la reproducción, el sistema
sabe cuántos altavoces tiene y dónde están ubicados. En función de eso, se
asegurará de enviar las señales correctas a los altavoces para satisfacer las
intenciones del autor, todo ello a tiempo real.

Veamos un ejemplo práctico: imaginemos que queremos colocar el sonido, una vez
más, entre el «centro» y la «derecha». Con el audio basado en objetos, se distribuye el
flujo de audio de ese sonido, así como la posición de paneo deseada. Después,

[Link] 13
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

durante la reproducción y dependiendo de la configuración de altavoces que haya,


el sonido se renderiza a los altavoces exactos: en una sala de cine con 3 altavoces
frontales (izquierdo, central, derecho), el sonido se enviará a los altavoces central y
derecho, pero si la sala tiene 5 altavoces frontales (izquierdo, izquierdo central,
central, derecho central, derecho), el sonido se enviará al central y al derecho
central o al derecho central y al derecho, dependiendo de si el sonido está más
cerca del centro o no.

Otro ejemplo: imaginemos un automovil que está adelantando por el carril de la


izquierda. Con el audio basado en canales, toda la mezcla se hace en el estudio. En
un sistema 7.1, el sonido quizá empezaría en el canal izquierdo trasero de sonido
envolvente, gradualmente se iría desplazando al canal izquierdo lateral de sonido
envolvente y acabaría en el canal izquierdo. Con un audio basado en objetos, si la
sala tiene cinco altavoces en la pared izquierda, el sonido empezará en el altavoz 5,
pasará al 4, después al 3, luego al 2 y a continuación al 1, siempre de derecha a
izquierda. Sin embargo, en una sala con ocho altavoces en la pared izquierda, la
secuencia sería 8ˆ7ˆ6ˆ5ˆ4ˆ3ˆ2ˆ1, de derecha a izquierda, aprovechando los altavoces
adicionales para conseguir una mejor resolución del espacio.

Por supuesto, cuando se dice que la mezcla solo se termina durante la reproducción,
es obvio que el mezclador de regrabación necesita escuchar lo que se está
haciendo en la sala de mezcla, y tendrá su propio sistema de reproducción que
reproducirá la mezcla.

Objetos
La información de paneo que se distribuye para un sonido concreto no es un valor
estático, sino un valor que puede cambiar en el tiempo. En este ejemplo solo
tenemos un sonido (mono), pero la información de paneo va cambiando con el
tiempo. Por otra parte, además de la posición del sonido, se deben tener en cuenta
otros datos. Por ejemplo, un sistema de audio basado en objetos también podría
utilizar el concepto de «tamaño»: es una especie de sonido puntual (solo 1 o 2
altavoces reproducen ese sonido) o un sonido más amplio que cubra un área mayor
(en una situación extrema, todos los altavoces podrían reproducir ese sonido). De
nuevo, en el ejemplo, en vez de utilizar:

8→7→6→5→4→3→2→1→izquierdo

Se utilizaría algo así:

8765→7654→6543→5432→4321→321izquierdo

En determinadas situaciones, al mezclador no le preocupará la posición exacta del


sonido, sino que centrará tu atención en asegurarse de que un sonido concreto es
reproducido por un solo altavoz, para lo cual deberá indicar al sistema de

[Link] 14
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

reproducción que elija el altavoz más cercano que haya en una dirección
determinada y que reproduzca el sonido exclusivamente en ese altavoz.

Todos los datos que se distribuyen con cada sonido (p. ej., posición, tamaño, etc.) se
denominan metadatos (los datos sobre los datos). Cada sonido (y sus metadatos
correspondientes) constituye un objeto, ya que representa un objeto de sonido
(mono) que de mueve por el espacio 3D.

Con el audio basado en objetos, creamos algo que se adapta al sistema de


reproducción. Por ejemplo, un sistema con 10 altavoces podrá reproducirlo, pero
también podrá hacerlo un sistema con 50 altavoces, que ofrecerá una mejor
resolución del espacio gracias a la presencia de altavoces adicionales.

Puesto que la mezcla final solo se produce durante la reproducción, se puede permitir
que el oyente habilite o deshabilite ciertos objetos de audio o camas. Esta opción
puede ser interesante en las retransmisiones –y un buen ejemplo de ello son los
eventos deportivos–, ya que permite a los oyentes elegir si quieren escuchar el
partido con o sin comentarios, o incluso seleccionar el sonido según cuál sea su
equipo favorito cambiando entre los micrófonos que están colocados cerca de la
afición del equipo A o cerca de la afición del equipo B.

Dolby Atmos
Uno de los sistemas de audio basado en objetos más famoso es Dolby Atmos, por
lo que nos centraremos en él como ejemplo de audio basado en objetos. No
obstante, existen otros formatos de audio basados en objetos, como MPEG-H,
AuroMax o DTS:X .

Dolby Atmos es compatible tanto con audio basado en objetos (objetos) como con
audio basado en canales (camas). Un objeto tendrá su audio (clip de audio mono) y
sus metadatos correspondientes, pero Dolby Atmos también es compatible con el
audio basado en canales gracias al uso de camas 7.1.2 (7.1 + 2 canales en altura).
Empecemos por los objetos.

Dolby Atmos permite utilizar 128 canales independientes, es decir, podemos tener
hasta 118 objetos de audio más 10 canales reservados para una cama 7.1.2 (más
adelante hablaremos sobre las camas). Durante la reproducción, Dolby Atmos admite
hasta 64 altavoces independientes, lo que implica que en una sala de cine puede
haber hasta 64 altavoces que se controlan de forma independiente, es decir, que
cada altavoz reproduce un audio diferente al del resto de altavoces. La sala puede
llegar a tener incluso más de 64 altavoces, siempre y cuando algunos de ellos
compartan la misma señal de audio.

Como se aprecia en la figura 11, una sala de cine con un sistema Dolby Atmos es
ligeramente diferente a una salda 5.1/7.1 común.

[Link] 15
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

Figura 11. Diferencias entre una sala 5.1/7.1 y una sala Dolby Atmos

La principal diferencia reside en los altavoces que están en el techo. Con la llegada
de Dolby Atmos, las salas de cine empiezan a tener 2 filas de altavoces en el techo
para empezar a explorar el componente del sonido en altura.

En la parte frontal, seguimos teniendo los altavoces izquierdo, central y derecho, que
están detrás de la pantalla, que permiten instalar 2 altavoces adicionales en las salas
con pantallas de mayores dimensiones, concretamente entre el altavoz central y los
altavoces izquierdo y derecho.

Además, en la sala se puede añadir un máximo de 4 subwoofers.

Por último, se instalan altavoces adicionales en los laterales, cerca de la parte frontal.
En las salas tradicionales, los altavoces de sonido envolvente se instalan a 1/3 de la
longitud de la pared lateral, es decir, solo ocupan 2/3 de las paredes laterales y hay
un hueco entre la pantalla y los primeros altavoces de sonido envolvente. Con Dolby
Atmos, ese hueco desaparece y se rellena con altavoces adicionales para asegurar
que el plano horizontal queda totalmente cubierto.

Camas
Durante la producción de una película, puede que parte del contenido de audio se
haya mezclado previamente. Por ejemplo, la partitura de música se puede entregar a
los mezcladores de regrabación ya mezclada, o al menos premezclada en stems (7.1
cuerdas, 7.1 percusión, etc.) o imaginar un efecto de sonido que ya se haya grabado o
editado en 5.1.

[Link] 16
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

Además de objetos, Dolby Atmos también admite contenido basado en canales que
recibe el nombre de camas de audio. Esto significa que, además de objetos, se puede
incluir audio basado en canales «normales». Dolby Atmos utiliza camas 7.1.2, que
corresponden al tradicional 7.1 (3 canales frontales + 4 canales de sonido envolvente +
LFE) con 2 canales adicionales para el techo (uno en la parte izquierda y otro en la
parte derecha). Por ejemplo, todas las pistas 5.1 y 7.1 se pueden mezclar directamente
a la cama 7.1.2. E incluso sin utilizar objetos, un mezclador puede explorar el
componente del sonido en elevación enviando audio a los altavoces que están por
encima de la cabeza del oyente.

LA REPRESENTACIÓN DE LA DISTRIBUCIÓN (P. EJ., 7.1.2)

Durante muchos años, el formato de distribución se ha representado con 2 números.


Por ejemplo, 5.1 quiere decir que tenemos 5 canales principales + 1 LFE. Con los
nuevos formatos inmersivos, se ha añadido un nuevo número que indica cuántos
canales hay en el techo. Por ejemplo, en 7.1.2 tenemos 7 canales principales (plano
horizontal) + 1 LFE + 2 canales en el techo, y en 9.1.4 hay 9 canales principales (plano
horizontal) + 1 LFE + 4 canales en el techo, etc.

Este sistema no es perfecto (algunos formatos tienen una capa por debajo del plano
horizontal (en el suelo), otros tienen 2 capas por encima de la cabeza, etc.), pero al
menos nos da una ligera idea sobre el sistema de sonido en uso.

Sin embargo, las camas no se usan solo para el material mezclado previamente.
Muchas producciones cinematográficas utilizan cientos de pistas durante la mezcla, y
algunas incluso más de 1000 pistas de audio. Aún recuerdo la primera vez que visité
las instalaciones de posproducción de Universal, donde, en uno de los estudios de
mezcla, alguien dijo «esta es nuestra consola de mezclas de 512 canales para efectos
sonoros y 256 canales para diálogos y música». Aunque Dolby Atmos admite 118
objetos, esta cantidad no sería suficiente para todas las pistas de sonido. Es aquí
donde las camas entran en juego, ya que en ellas se pueden mezclar infinitos
sonidos . Cuando se utilizan objetos, cada sonido tiene que ser independiente para
poder controlar el paneo de cada uno, pero no es así con las camas, ya que se utiliza
un paneo común para distribuir cada sonido. Por este motivo, el mezclador de
regrabación podría utilizar objetos para los sonidos más importantes, en los que la
ubicación es decisiva, y camas para los sonidos secundarios mezclados.

Dolby Atmos incluye una cama 7.1.2, aunque se pueden añadir más camas reduciendo
el número de objetos. Por ejemplo, puede haber 118 objetos + 1 cama, 108 objetos + 2
camas, 98 objetos + 3 camas, etc. No obstante, cabe recordar una vez más que, en

[Link] 17
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

términos de sonido, utilizar más de una cama no presenta ninguna ventaja particular.

Pros y contras
La principal ventaja del audio basado en objetos es su capacidad de adaptación a
cualquier disposición de altavoces. Cuando se envían «intenciones» al sistema de
reproducción, esas intenciones se adaptan perfectamente a la configuración de
altavoces existente. Además, y muy importante, permite obtener la máxima
resolución espacial del sistema, ya que, cuando se añaden altavoces, se mejora la
precisión espacial de la reproducción.

En cuanto a sus desventajas, también presenta algunas. En primer lugar, hay que
distribuir muchos más canales de audio. En salas de cine, Dolby Atmos puede llegar
a utilizar 128 canales de audio. Sin embargo, si se utilizan otros medios (streaming,
Blu-ray), esos 128 canales de audio son demasiados y obligan a reducir el número de
objetos, lo que implica que muchas objetos se tengan que renderizar como camas y,
por tanto, pierdan sus ventajas. En segundo lugar, los objetos están limitados a un
número determinado . Es cierto que 128 es una cantidad considerable y que la
mayoría de los proyectos no necesita tantos; sin embargo, hay situaciones en las que
ese número se queda corto. Por ejemplo, Sound Particles es capaz de renderizar
escenas de audio con miles de sonidos, literalmente (tenemos renders de hasta un
millón de sonidos sonando en simultáneo). Las producciones de Hollywood también
utilizan más de 1000 pistas. Es cierto que las camas de audio son capaces de superar
gran parte de esas limitaciones, pero en ese caso no estaríamos ante un enfoque de
audio basado en objetos puro.

[Link] 18
Todo lo que Necesitas Saber Sobre 3D Audio Audio basado en objetos

CURIOSIDAD: FANTASÍA DE DISNEY

Durante la producción de Fantasía, la película de Disney de 1940 que incluye la


famosa escena de Mickey Mouse con sombrero del hechicero, Walt Disney creyó que
era importante para el público disfrutar de una mejor experiencia sonora debido al
importante papel que tenía la música en la película. Así fue que los ingenieros de
Disney y RCA crearon Fantasound, un sistema de sonido de múltiples altavoces que
se instaló en algunas salas de cine (algunos sistemas incluso se movieron por Estados
Unidos), lo que permitió al público ver la película con una experiencia sonora mucho
más interesante. Por todo ello, Fantasía se considera la primera película que utilizó
sonido envolvente .

Hubo varias variantes del sistema Fantasound, y algunos de esos sistemas


incluían altavoces en el techo, lo que convirtió a Fantasía no solo la primera
película que utilizó sonido envolvente, sino también en la primera película que
utilizó sonido inmersivo .

Desde un punto de vista técnico, el sistema utilizaba 4 pistas: 3 pistas con audio
grabado (3 señales sonoras independientes) y 1 pista con señales de control, que
controlaba cómo se iban a reproducir los 3 canales de sonido: en cierto punto, el
canal 1 se podía enviar al altavoz izquierdo; el canal 2, al altavoz derecho, y el canal 3,
a los altavoces de sonido envolvente, para más tarde poder reproducir el canal 1 en
los altavoces frontales; el canal 2, en el techo; el canal 3, en la parte trasera, etc. Sí,
es cierto que era tecnología analógica, pero esto también convierte a Fantasía en la
primera película que utilizó el audio basado en objetos .

Fue la primera película con sonido envolvente, inmersivo y basado en objetos. ¡Hace
80 años! Sin ninguna duda, hay personas realmente visionarias.

[Link] 19
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

Ambisonics
El principal objetivo de Ambisonics era crear un formato de audio que pudiese ser
independiente del formato de reproducción. Es decir, que si algo está grabado en
Ambisonics, no importa cuántos altavoces estén reproduciendo ni su distribución
espacial, porque Ambisonics es capaz de adaptarse.

Aunque Ambisonics se creó en los años setenta (a partir del trabajo de Michael
Gerzon), el interés por este formato ha aumentado significativamente durante la
última década, especialmente asociado a las aplicaciones en RV. Pero antes de
profundizar en el conocimiento de Ambisonics, intentemos comprender cómo
funciona su hermano pequeño: la técnica Mid-Side.

Mid-Side
Aunque mucha gente utiliza la técnica tradicional de grabación estéreo XY, donde se
usan 2 micrófonos cardioides (uno orientado hacia la izquierda y otro hacia la
derecha), algunos profesionales prefieren utilizar la técnica de grabación Mid-Side.

La Mid-Side es una técnica de grabación estéreo muy utilizada que consiste en


utilizar un micrófono orientado hacia el centro (Mid) y un micrófono bidireccional
orientado hacia los lados (Side), tal como aparece en la figura 12. Con este abordaje,
el micrófono central capturará todo lo que venga de la parte delantera. Al orientar el
micrófono bidireccional hacia los lados, este capturará los sonidos procedentes del
lado izquierdo y del lado derecho, pero no los sonidos procedentes de direcciones
perpendiculares (como la parte frontal).

Figura 12. Técnica Mid-Side

[Link] 20
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

Como se puede apreciar, un micrófono captura el componente mono (Mid, que


captura lo que procede de la parte frontal) y otro micrófono, el componente no mono
(Side, que no captura lo que procede de la parte frontal).

¿Y qué sucede si reproducimos las señales Mid-Side directamente en dos altavoces?


Los altavoces reproducirán audio normal, pero no habrá una imagen sonora estéreo.
Para un buen resultado, será necesario decodificarla hacia la izquierda o hacia la
derecha para conseguir una imagen sonora estéreo en la parte frontal.

Para crear la salida estéreo final, las señales de los micrófonos se mezclan de la
siguiente manera:

La señal izquierda se obtiene de mezclar ambas señales (Mid + Side)


La señal derecha se obtiene de mezclar Mid con una versión invertida de
polaridad de la señal del micrófono Side (Mid - Side)

Por tanto, si se utiliza un par Mid-Side y hay un sonido procedente del lado izquierdo,
ese sonido aparecerá en el canal izquierdo (los micros Mid y Side capturan ese
sonido con la misma fase), pero será muy débil en el canal derecho (la señal del micro
Side cancelará la señal de Mid debido a su polaridad opuesta).

Igual que se puede convertir Mid-Side en izquierda-derecha, se puede convertir


izquierda-derecha en Mid-Side2, lo que significa que se puede pasar de
derecha/izquierda a Mid/Side y viceversa. De hecho, esta conversión se utiliza con
frecuencia durante el proceso de masterización. Imaginemos que queremos
aplicar una pequeña compresión a la voz principal de una canción, pero solo
disponemos de la mezcla final en estéreo (no tenemos acceso a las pistas
individuales). En vez de aplicar el compresor a toda la señal sonora estéreo, un
profesional de la masterización convertirá el sonido izquierda-derecha en Mid-Side,
aplicará el compresor solo al canal Mid y volverá a convertir el Mid-Side en
izquierda-derecha. De este modo, el compresor se aplica principalmente a los
sonidos cercanos al centro.

La conversión Mid-Side también se utiliza en unidades de efectos para aumentar el


efecto estéreo. Si se convierte una señal estéreo (izquierda-derecha) en una Mid-Side,
y después se incrementa el alcance del canal Side para volver a convertirlo a estéreo,
se aumentará el alcance de los sonidos no mono, con lo que se incrementará la
sensación de espacio de la señal3.

2. Dedicado a los amantes de las matemáticas:


Izquierda + Derecha = (Mid + Side) + (Mid - Side) = 2 Mid
Izquierda + Derecha = (Mid + Side) - (Mid - Side) = 2 Side

3. Por supuesto, esto no funcionaría en un canal puramente mono, porque el canal Side estaría vacío.

[Link] 21
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

Ambisonics
Básicamente, Ambisonics es una técnica Mid-Side mejorada. Imaginemos que, en
vez de utilizar un micrófono bidireccional orientado hacia los laterales (eje
izquierda-derecha), añadimos un micrófono bidireccional orientado hacia el techo
(eje arriba-abajo) y otro hacia delante (eje delante-atrás). Para la señal Mid, en vez
de utilizar un micro cardioide para capturar el componente mono, utilicemos uno
micrófono omnidireccional para tener una señal mono completa de todo el entorno.
Esto es Ambisonics.

El formato Ambisonics tradicional, conocido como Ambisonics de 1er orden (formato


B) utiliza 4 canales de audio:

W: El componente omnidireccional, que permite capturar la escena como si


hubiese un micrófono omnidireccional, por lo que el audio de este canal tiene
procede de todas las direcciones.
X, Y, Z: 3 canales que se corresponden con los 3 micrófonos bidireccionales,
uno orientado a cada dirección: izquierda-derecha, delante-atrás, arriba-abajo.

Cuando se habla de Ambisonics, y teniendo en cuenta que existen diferentes


versiones de Ambisonics, normalmente nos referimos al primer orden, al formato B
(más información más adelante).

Y básicamente es eso… Ambisonics sigue siendo audio normal, no es ningún tipo de


magia oscura que pone el sonido 3D en funcionamiento. Simplemente, son canales de
audio: uno con el componente mono de todo y estos 3 componentes: izquierda-
derecha, delante-atrás, arriba-abajo. Se podría decir que Ambisonics es la versión 3D
de la técnica Mid-Side, ya que tiene un componente mono de todo y los tres
componentes que capturan los micrófonos bidireccionales (izquierda-derecha,
delante-atrás, arriba-abajo).

De la misma forma que no se pueden utilizar las señales Mid-Side y reproducirlas en


los altavoces (se puede, pero no se generaría la imagen frontal deseada), lo mismo
ocurre con Ambisonics: disponemos de 4 canales de audio, podemos escuchar sus
señales (es audio normal, no una señal ruidosa rara) pero necesitamos decodificarlas
antes de reproducirlas en una configuración de altavoces.

[Link] 22
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

Micrófonos Ambisonics
Una de las cosas que quedó clara desde el
principio es que grabar con un micrófono
omnidireccional y 3 bidireccionales no era
sencillo , especialmente teniendo en cuenta
que las cápsulas debían estar lo más cerca
posible. Sin embargo, el mismo resultado se
puede obtener con un micrófono tetrahedral
con 4 cápsulas cardioides (como se muestra
en la figura 13).

Con esta configuración de 4 cápsulas


(izquierda-frente-arriba (LFU), derecha-
Figura 13. Micrófonos tetrahedrales con 4
frente-abajo (RFD), izquierda-atrás-abajo cápsulas: Sennheiser AMBEO VR mic (cedido
(LBD) y derecha-atrás-arriba (RBU)) se por Sennheiser) y R0DE NT-SF1 (cedido por
pueden obtener 4 señales que más tarde se R0DE Microphones)

convertirán en el canal omnidireccional y en


los 3 canales bidireccionales. Las señales que salen directamente de las cápsulas de
este micrófono tetrahedral (LFU, RFD, LBD, RBU) están diseñadas como formato A,
mientras que las señales tradicionales (omni + 3 bidireccionales) están diseñadas
como formato B.

Sin embargo, con un poco de matemáticas, podemos convertir el formato A en


formato B. Por ejemplo, si mezclamos la señal de todas las cápsulas, obtendremos la
señal equivalente a la omni. Si restamos las cápsulas traseras a las cápsulas
delanteras, obtendremos la señal equivalente a delante-atrás, etc.

W = LFU + RFD + LBD + RBU


X = LFU + RFD - LBD - RBU
Y = LFU + LBD - RFD - RBU
Z = LFU + RBU - RFD - LBD

Aunque las cápsulas están cerca las unas de las otras, esa pequeña distancia puede
tener su impacto en ciertas frecuencias, ya que la señal no llega a todas las cápsulas
al mismo tiempo. Por eso, algunos sistemas/plugins son capaces de hacer un
procesamiento de señal incluso más avanzado durante esta conversión de
formato A -+ formato B en un intento de compensar esos efectos mínimos.

Una vez más, aunque el sonido se captura en formato A, es importante convertirlo lo


antes posible a formato B, ya que es el formado estándar de Ambisonics.

[Link] 23
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

EL USO DE MICRÓFONOS AMBISONICS SIN OLVIDAR LAS


LECCIONES DEL ESTÉREO

Los micrófonos Ambisonics presentan un abordaje muy interesante de la grabación


de audio y son capaces de grabar mucha más información espacial que otros
micrófonos mono o estéreo. Sin embargo, es importante recordar dos aspectos
fundamentales.

En primer lugar, hay gente que deposita demasiadas expectativas en los resultados
de estos micrófonos. Imaginemos una producción cinematográfica que se va a lanzar
en estéreo. Pensar que instalar un solo micro estéreo en la cámara es suficiente sería
demasiado ingenuo, ¿verdad? Pues lo mismo ocurre con las producciones de sonido
3D: no basta con instalar un micrófono Ambisonics a una cámara 360. Es necesario
instalar los micrófonos cerca del diálogo (aunque solo sean mono), añadir mejores
efectos de sonido durante la mezcla, tiempo de posproducción, etc.

En segundo lugar, los ingenieros que reciben premios Grammy por sus maravillosas
grabaciones de orquestas no utilizan un simple micrófono XY colocado en cualquier
sitio. Normalmente, se colocan varios micrófonos en distintos sitios para utilizar el
tiempo como una herramienta espacial . Una vez más, en las grabaciones inmersivas,
los micrófonos Ambisonics son una excelente opción (y sin duda son mejores que los
pares estéreo XY o MS), pero si se busca un sonido excelente, es necesario utilizar
micrófonos distribuidos por el espacio para, una vez más, poder utilizar el tiempo
como herramienta espacial.

High Order Ambisonics (HOA) /


Ambisonics de Ordenes Superiores
Entonces, ¿podemos conseguir imágenes sonoras 3D precisas utilizando solo 4
canales de audio? Bien, en realidad no. Aunque Ambisonics reproduce correctamente
los entornos sonoros 3D utilizando solo 4 canales de audio, su resolución espacial no
es muy alta. Esto significa que cada sonido será ligeramente borroso en términos de
direccionalidad. Pero High Order Ambisonics (HOA) puede ser una solución.

Con Ambisonics de órdenes superiores (HOA), en vez de los 4 canales de audio


propios del Ambisonics de primer orden (FOA), se amplían los canales de audio para
aumentar la resolución espacial: 9 canales de audio en Ambisonics de segundo orden
(SOA), 16 canales en el de tercer orden, 25 en el de cuarto, 36 en el de quinto, 49 en
el de sexto y así sucesivamente.

[Link] 24
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

Al añadir canales, se aumenta el detalle de la imagen sonora. Estos nuevos canales


siguen transportando las señales sonoras, pero con extraños comportamientos
polares (ver figura 14) en vez de con los tradicionales diagramas bidireccionales del
primer orden. Los matemáticos lo denominan armónicos esféricos, ya que, del mismo
modo que un sonido se puede descomponer en sus armónicos, un panorama sonoro
3D se puede descomponer en sus armónicos esféricos.

Figura 14. Diagramas polares de los varios canales Ambisonics (cortesía de Franz Zotter)

Aunque no existen las cápsulas de micrófonos que


capturen sonido de forma nativa con estos exóticos
patrones de directividad, se pueden utilizar micrófonos
especiales con un elevado número de cápsulas para
derivar esa señal, como el Eigenmike® (ver figura 15).

Las múltiples variantes de


Ambisonics
Algo muy importante que se debe tener en cuenta a
la hora de hablar de Ambisonics son sus
numerosas variantes . Y es que, sin querer,
podemos utilizar un formato erróneo o interpretarlo
de una manera incorrecta. Por eso, se deben tener
en cuenta 4 parámetros importantes que definen la
versión de Ambisonics de la que estamos hablando
en cada momento: Figura 15. Micrófono Eigenmike®,
compatible con Ambisonics de 4 to
Orden (1.ª, 2.ª, etc.) orden (cortesía de MH Acoustics)

Formato (A, B, etc.)


Orden de componentes (ACN, FuMa, SID)
Normalización (SN3D, N3D, FuMa, etc.)

[Link] 25
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

Lo primero que se debe tener en cuenta es el orden4 de Ambisonics: primero,


segundo, tercero, etc. Es fácil de identificar, ya que depende del número de canales
de audio que haya:

1 er orden 4 canales de audio

2 do orden 9 canales de audio

3 er orden 16 canales de audio

4to orden 25 canales de audio

5 to orden 36 canales de audio

6 to orden 49 canales de audio

n orden (n+1)2 canales de audio

El segundo aspecto que debemos identificar es el formato Ambisonics, que puede


ser A o B (existen otros formatos, pero son muy poco frecuentes). El audio grabado
directamente desde un micrófono Ambisonics es de formato A (cada canal representa
el audio de una cápsula concreta), pero se tiene que convertir5 lo antes posible a un
formato B, que es el formato habitual de Ambisonics, el que es compatible con la
mayor parte de softwares y el que esperan recibir.

El tercer aspecto al que debemos prestar atención es el orden de los componentes,


es decir, el orden de los canales de audio. Desafortunadamente, existen diferentes
maneras de ordenar los canales de audio dentro de Ambisonics, pero la buena
noticia es que la mayoría son poco frecuentes. Originalmente, los canales se
ordenaban de una manera concreta (W, X, Y, Z), pero con la llegada de High-Order
Ambisonics, era importante crear un orden de canales que se pudiese escalar
fácilmente cuando se utilizase en escenarios más complejos con más canales, así que
nació el orden ACN. Por ejemplo, con ACN, el orden de canales para el 1er orden de
Ambisonics sería W, Y, X, Z, pero con Fu-Ma sería W, X, Y, Z. Las plataformas de
Ambisonics modernas utilizan el orden de canales ACN, pero conviene prestar
atención cuando se utilicen plataformas de Ambisonics antiguas, ya que podrían
utilizar el orden Fu-Ma antiguo. También existe un abordaje SID, pero no es nada
frecuente. Si se prueba Ambisonics con direcciones incorrectas (sonidos que

4. También existe el concepto de orden mixto , muy poco frecuente en la actualidad, que nos permite
tener una mejor resolución en el plano horizontal, pero menos (o ninguna) en el plano elevado.

5. El micrófono Ambisonics debería incluir un plugin de conversión de formato A a formato B.

[Link] 26
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

El cuarto parámetro importante es la normalización, que hace referencia a la


ganancia de cada canal. Una vez más, existen diferentes abordajes (SN3D, N3D,
maxN / Fu-Ma 6 ), pero actualmente el más frecuente es SN3D , por un motivo: con
SN3D, el primer canal (omni) siempre es el canal con el nivel mál alto (alude a
amplitud de ganancia), lo que significa que, si se quiere mezclar o grabar, solo se
necesita prestar atención al primer canal en términos de clipping o saturación de
señal (si no hay clipping, los otros tampoco lo harán). Con otros abordajes de
normalización, como N3D, no queda garantizado que el canal omni sea el de mayor
nivel, al menos para todas las direcciones de sonido.

Al preguntar por estos parámetros, puede que nos mencionen AmbiX, un formato de
archivo de audio especial para Ambisonics que utiliza formato B, ACN, SN3D. A veces,
la gente menciona AmbiX no porque utilice ese formato de archivo, sino para decir
formato B, ACN, SN3D.

Por tanto, es recomendable ser cauto y asegurarse de que no estamos mezclando


diferentes versiones de Ambisonics.

Aplicación en RV (Realidad Virtual)


Ambisonics permite aplicar rotaciones con facilidad. Imaginemos que tenemos una
escena 3D pero que queremos rotarla (p. ej., 60° a la izquierda o 10° hacia arriba). Con
Ambisonics, rotar es tan sencillo como aplicar una matriz, es decir, aplicar una fórmula
que, a partir de los canales existentes, crea los nuevos canales rotados.

Gracias a esta característica, Ambisonics es perfecto para las aplicaciones de RV. ¿Por
qué? En las aplicaciones de RV, cuando se mira alrededor, básicamente lo que se
hace es rotar la cámara: hacia el lado (Yaw / Guiñada), mirara hacia arriba y hacia
abajo (Pitch / Cabeceo) o inclinar la cabeza (Roll / Alabeo). Por este motivo, es fácil
para la aplicación RV tomar las señales de Ambisonics y rotarlas según la rotación de
la cabeza, lo que permite generar un sonido coherente con la imagen.

Además, Ambisonics puede reproducir sonidos 3D utilizando pocos canales de audio


(4 canales de audio), lo cual es genial para todas las plataformas, especialmente web
y móviles. Por ello, durante los último años, Ambisonics ha despertado un interés
significativo entre el público con el renacer de las aplicaciones de RV.

Después de aplicar la rotación, las aplicaciones de RV simplemente convierten las


señales Ambisonics en binaurales, lo que permite a los usuarios escuchar los sonidos
3D con auriculares. En el próximo capítulo profundizaremos en el audio binaural.

6. El acrónimo de Furse-Malham

[Link] 27
Todo lo que Necesitas Saber Sobre 3D Audio Ambisonics

Pros y contras
La principal ventaja de Ambisonics es su capacidad de adaptación a cualquier
disposición de altavoces. En segundo lugar, puede reproducir una escena de audio
3D utilizando pocos canales de audio (mínimo 4 canales). Y, tercero, Ambisonics se
puede escalar a más canales para mejorar la resolución espacial.

La principal desventaja es que, si se desea obtener una buena resolución espacial,


se necesitan muchos canales, ya que el primer orden tradicional tiene una resolución
espacial reducida. Por este motivo, puede que necesitemos al menos un 3er orden
(con 16 canales de audio) para disponer de una buena resolución espacial, o incluso
superior (p. ej., 6to orden, con sus 49 canales de audio) si se desea algo similar al
audio basado en objetos.

[Link] 28
Todo lo que Necesitas Saber Sobre 3D Audio Audio binaural

Audio binaural
Cuando se habla de sonido inmersivo, automáticamente pensamos en una sala llena
de altavoces por doquier (arriba, a los lados, en la parte frontal, etc.). Sin embargo,
existe un tipo especial de enfoque de sonido inmersivo que solo requiere una
configuración muy sencilla: auriculares. Pero ¿se puede simular realmente el sonido
3D con unos auriculares?

Bien, la realidad que es todo el mundo puede experimentar el sonido 3D utilizando


dos oídos, ¿no? Podemos estar en una sala con Dolby Atmos, rodeados de 64
altavoces y con una experiencia de sonido fantástica. Sin embargo, a fin de cuentas,
nuestro cerebro solo escucha dos señales de audio: el oído derecho y el oído
izquierdo. Por ello, se puede reproducir una experiencia sonora 3D completa
utilizando auriculares en la medida en que nuestros oídos sigan escuchando
exactamente las mismas señales que si estuviésemos en una sala llena de altavoces.

La reproducción de sonido 3D con auriculares se denomina audio binaural, y no


necesita ningún tipo especial de auriculares, que a su vez resultan una herramienta
imprescindible para cualquier persona que trabaje en el ámbito del sonido inmersivo.

Percepción
Para comprender cómo funciona el sonido
binaural, es necesario entender cómo
perciben los humanos la dirección de un
sonido. Por ejemplo, imaginemos un sonido
que se reproduce a nuestro lado derecho, tal
como se muestra en la imagen (figura 16).

El sonido será más fuerte en el oído derecho


y más suave en el izquierdo, lo cual
constituye una prueba fundamental para que
el cerebro reconozca que el sonido viene
del lado derecho. Técnicamente, este Figura 16. Reproducción de un sonido por el
fenómeno se denomina diferencia interaural lado derecho
de intensidad (IDL, del inglés Interaural
Level Difference).

[Link] 29
Todo lo que Necesitas Saber Sobre 3D Audio Audio binaural

Además, el sonido llegará antes al oído derecho y ligeramente después al oído


izquierdo, lo que, según el tamaño de la cabeza y la dirección del sonido, puede
corresponder a un retardo de 1 microsegundo. Este fenómeno se denomina diferencia
interaural de tiempo (ITD, del inglés Interaural Time Difference).

Sin embargo, estos dos fenómenos no lo explican todo. Por ejemplo, ¿cómo
detectamos la diferencia entre sonidos frontales, elevados o traseros? En las tres
situaciones, el sonido llega a ambos oídos en el mismo nivel y al mismo tiempo.

Afortunadamente, tenemos unos accesorios de alto diseño llamados oídos.


Dependiendo de la dirección de la fuente de sonido, este rebotará en diferentes
zonas del oído externo (pinna o pabellón auricular), lo cual creará reflejos menores
que ayudarán al cerebro a identificar la dirección de los sonidos. Sabemos que,
cuando mezclamos un sonido con su versión retardada, algunas frecuencias se
refuerzan y otras se atenúan. Por eso, los oídos actúan como pequeños
ecualizadores que cambian su respuesta a la frecuencia dependiendo de la dirección
del sonido. Los reflejos de la zona de los hombros también complementan los reflejos
del oído externo, lo que de nuevo genera un pequeño cambio en la respuesta a la
frecuencia del sonido recibido.

Por último, también habrá un ligero efecto sombra en el oído contrario. Las
frecuencias más altas, debido a su longitud de onda más corta, tendrán más dificultad
para adaptarse y entrar en las zonas de sombra, es decir, que el oído más lejano
también tendrá un ligero descenso en las frecuencias altas.

HRTF
Todos estos factores hacen que nuestro cerebro sea capaz de detectar la dirección
de un sonido y, como podemos ver, depende de los niveles, los retardos y los filtros.
Por tanto, la siguiente pregunta que debemos hacernos es cómo podemos capturar (o
representar) la respuesta total a una dirección de sonido concreta que llega a una
cabeza humana.

De la misma forma que utilizamos respuestas al impulso para captar la reverberación


de una sala, que se compone de reflejos (concretamente, reflejos filtrados7), podemos
utilizar el mismo concepto para captar el impacto de la dirección de un sonido
concreto en un oído humano. Estas respuestas al impulso se denominan respuestas al
impulso relacionadas con la cabeza (HRIR, del inglés Head-Related Impulse
Responses), que también se conocen como funciones de transferencia relacionadas
con la cabeza (HRTF, del inglés Head-Related Transfer Functions). Las HRIR y las

7. Por ejemplo, el asfalto refleja un sonido con una respuesta a la frecuencia que es diferente al reflejo de
una alfombra.

[Link] 30
Todo lo que Necesitas Saber Sobre 3D Audio Audio binaural

HRTF son lo mismo. La única diferencia entre ellas es que las HRIR están en el
dominio del tiempo (como una ola) y las HRTF, en el dominio de la frecuencia (como
un espectrograma).

A lo largo de los años, muchos científicos han creado recopilaciones de estos


impulsos utilizando dos abordajes, y los han llamado conjuntos de datos HRTF:

utilizando micrófonos colocados en los oídos de personas reales (una cápsula


en cada oído);
utilizando prototipos de cabeza, con o sin torso, con una representación
precisa de los oídos, y cápsulas de micrófonos colocadas en el interior de los
oídos (ver figura 17).

Con estos abordajes, los científicos pueden captar las


respuestas al impulso del oído izquierdo y del derecho
en una serie de posiciones diferentes en la cabeza. A
partir de esos conjuntos de datos, los desarrolladores
de software pueden crear plugins binaurales y
software similar (motores de audio para juegos, etc.)
para crear la ilusión de que un sonido procede de un
posición concreta.

Por ejemplo, si tengo el sonido de un helicóptero (en


mono) y quiero que el oyente sienta que el sonido del
helicóptero viene de una dirección concreta, basta con
utilizar el conjunto de datos HRTF y encontrar la
posición grabada que se acerque a la dirección que Figura 17. Un micrófono binaural
quiero conseguir (o incluso interpolar entre posiciones (Neumann KU 100, cortesía de
Neumann)
del conjunto de datos). Después, tomo un par de
respuestas al impulso de esa posición (una respuesta
al impulso izquierda y una respuesta al impulso derecha) y las aplico al sonido del
helicóptero, lo cual generará dos sonidos: el sonido izquierdo (la respuesta al impulso
izquierda aplicada al sonido del helicóptero), que se enviará al lado izquierdo de los
auriculares, y el sonido derecho (la respuesta al impulso derecha aplicada al sonido
del helicóptero), que se enviará al lado derecho de los auriculares. El acto de aplicar
una respuesta al impulso a una señal de audio se denomina convolución. Con esto, el
oyente sentirá que el helicóptero viene de esa dirección.

Aunque la mayoría de las personas utilizan técnicas binaurales durante la


posproducción o la reproducción, también se pueden hacer grabaciones binaurales.
Una vez más, si colocamos micrófonos miniatura en los oídos humanos8, o si
utilizamos un prototipo de cabeza (como el de la figura 17) y lo situamos entre el

8. Estas cápsulas de micrófono se deben colocar lo más internamente posible, ya que, si no,

no captarán la verdadera respuesta del oído.

[Link] 31
Todo lo que Necesitas Saber Sobre 3D Audio Audio binaural

público de una sala de conciertos, podré grabar el audio directamente en formato


binaural. Después, cuando se envíen esos dos canales de audio a unos
auriculares, se podrá escuchar la misma escena de audio 3D que si se hubiese
asistido al concierto.

Personalización de la HRTF
Entonces, ¿esto quiere decir que todo el mundo puede experimentar un sonido
realista 3D gracias a los auriculares? Desafortunadamente, no todo el mundo.

La cabeza de cada persona es diferente, al igual que lo son sus oídos y otros
aspectos físicos que son únicos en cada individuo, lo que significa que puede haber
ligeras variaciones en la forma de los oídos que puede afectar a la llegada del sonido.
Y cada cerebro ha pasado muchos años escuchando el sonido con esas
características personales y no con otras.

Con los altavoces no tenemos ese problema. El sonido sale del altavoz y, aunque el
oído de cada persona lo oiga de una manera diferente, esa ligera diferencia es la
manera habitual para el cerebro de esa persona (el sonido que viene de esa dirección
siempre lo ha oído de esa forma). El problema de los auriculares con las HRTF de
otras personases que el cerebro escucha los sonidos de una forma ligeramente
diferente y poco habitual, y eso puede resultar extraño.

Si escucho audio binaural creado a partir del conjunto de datos HRTF captados de
otra persona, puede que tenga una experiencia fantástica con un sonido 3D perfecto
o que mi cerebro no lo tenga fácil a la hora de interpretar la información en conflicto
debido a las diferencias fisiológicas que tengo con la persona de la HRTF original.

Por ejemplo, para la misma posición (frente-centro), la figura 18 muestra las


diferencias del sonido que alcanza el oído interno de distintos individuos. Como se
puede apreciar, hay bastantes diferencias entre personas, incluso por encima de los
30 dB en algunos casos. Algunas tienen descensos a 6 Hz mientras que otras tienen
esos descensos por encima de los 10 Hz.

Si se aplica una HRTF similar a la de nuestros oídos, el cerebro lo identificará («Ya


conozco esta ecualización. Ocurre siempre que el sonido viene de esa dirección.) y
todo funcionará como debe. En otras ocasiones, la HRTF utilizada se asemeja al
comportamiento de nuestros oídos, pero en otra dirección («Esta ecualización me
resulta familiar… Creo que el sonido viene de esa dirección.), lo que genera un
información incorrecta. Por ejemplo, alguien aplica la HRTF de un sonido frontal pero
el cerebro lo identifica como un sonido que procede de atrás (lo que se denomina
confusión delante-atrás) o de una elevación distinta. En otras ocasiones, la HRTF es
tan distinta a lo que conoce nuestro cerebro que este se equivoca («No detecto

[Link] 32
Todo lo que Necesitas Saber Sobre 3D Audio Audio binaural

ninguna ecualización familiar.») y el cerebro no identificará ninguna dirección


concreta, por lo que sentiremos que ese sonido está en nuestra cabeza.

Figura 18. La HRTF del oído izquierdo de 45 personas para la misma posición exacta: frontal centro
(azimutal = 0, elevación = 0)

Una vez más, puede que para algunas personas la percepción de un sonido binaural
concreto sea tremendamente realista, para otras ligeramente realista (pero mejor que
el estéreo) y para otras, nada realista. Por ejemplo, cuando escucho un sonido
binaural, los sonidos frontales me suelen parecer elevados, quizá porque mis oídos
son ligeramente diferentes a los de la mayoría de las personas.

Por supuesto, muchas empresas intentan elegir los mejores conjuntos de datos HRTF
para sus productos, es decir, que eligen una HRTF que se adapta a un porcentaje
elevado de oyentes. Pero incluso con un conjunto de datos HRTF fantástico, siempre
habrá un porcentaje de oyentes que no disfrute del todo ese audio binaural con ese
conjunto de datos.

Esto significa que necesitamos cierta personalización de la HRTF, bien permitiendo


que el oyente seleccione el mejor conjunto de datos HRTF entre distintas opciones
(el que se haya grabado con alguien que tenga características físicas similares), o
bien permitiendo el acceso a una HRTF personal. Por supuesto, solo unos pocos
tienen la suerte de que se capten sus HRTF en un laboratorio, pero algunas empresas
ofrecen personalización de HRTF a partir de fotos, vídeos o incluso escáneres 3D de
la cabeza de la persona. En esos casos en lo que existe un conjunto de datos HRTF
personalizado, existe algo denominado SOFA, un formato de archivo definido por la
AES (Audio Engineering Society) que permite que cada persona tenga su propio
archivo HRTF y lo utilice en un sistema compatible.

[Link] 33
Todo lo que Necesitas Saber Sobre 3D Audio Audio binaural

Cómo utilizar el audio binaural


Es importante volver a mencionar que el audio binaural solo funciona si se reproduce
con auriculares. Si ese audio se reproduce con unos altavoces estéreo, se puede
llegar a conseguir un sonido estéreo aceptable, pero no una experiencia 3D ni nada
parecido.

El segundo aspecto importante que se debe tener en cuenta es que todos los
abordajes mencionados anteriormente (basados en canales, basados en objetos y
Ambisonics) se pueden convertir a audio binaural.

Por ejemplo, se puede convertir una señal 5.1 o 22.2 a una binaural, renderizar Dolby
Atmos en binaural o incluso convertir una señal Ambisonics de 3er orden en binaural.
De hecho, esta conversión de Ambisonics a binaural es lo que ocurre en la mayor
parte de aplicaciones de RV. Aunque la RV se puede probar con altavoces, la señal de
audio Ambisonics de una escena de RV se suele convertir a binaural y se reproduce
en los auriculares del visor VR.

BARRAS DE SONIDO

El audio binaural se creó para reproducir sonido 3D con auriculares, pero se ha


investigado mucho para intentar reproducirlo con altavoces. Muchas barras de sonido
utilizan algunos de esos conceptos, lo que permite probar el sonido 3D utilizando una
barra de sonido frontal.

La mayoría de las barras de sonido son capaces de reproducir un sonido más


inmersivo que el estéreo normal, pero peor que si se utilizase una configuración
completa de altavoces, especialmente para la gente que no está sentada en el punto
de escucha óptimo. No obstante, puede ser una alternativa interesante para la gente
que quiere una experiencia 3D pero que no quiere instalar una configuración
completa de altavoces 3D.

Pros y contras
La principal ventaja del sonido binaural es la capacidad de reproducir sonido 3D con
una configuración muy sencilla, con unos auriculares, sin necesidad de una gran
cantidad de altavoces: una experiencia 3D disponible en cualquier sitio, económica y
con una configuración eficiente.

[Link] 34
Todo lo que Necesitas Saber Sobre 3D Audio Audio binaural

La principal desventaja es que no funciona como debería en muchas personas,


debido a la falta de personalización, lo que puede dar lugar a confusiones delante-
detrás, sonido elevado (especialmente delante) y sensación de sonido «interior». Y la
segunda es que no es compatible con altavoces.

Una vez más, el audio binaural es una opción fantástica siempre y cuando la persona
conozca cuáles son sus necesidades de personalización.

[Link] 35
Todo lo que Necesitas Saber Sobre 3D Audio Conclusión

Conclusión
Hemos visto cuatro abordajes del sonido 3D: audio basado en canales, audio basado
en objetos , Ambisonics (también conocido como audio basado en escenas) y audio
binaural. Cada uno de estos abordajes presenta sus ventajas y sus desventajas, y
ninguno de ellos es capaz de sustituir a los demás en todas las situaciones, por lo
que hay que elegirlo con cuidado.

El audio basado en canales es ideal si se quiere una distribución fija de altavoces,


pero no es flexible ante múltiples configuraciones. El audio basado en objetos ofrece
la mejor resolución espacial con configuraciones flexibles, pero es necesario distribuir
cada flujo de audio por separado, lo que puede ser un problema si se tienen varias
fuentes de audio. Ambisonics es una buena opción para la reproducción de sonido
3D con pocos canales de salida, pero, si se quiere conseguir una buena resolución
espacial, necesita muchos canales. La binaural es la opción ideal para la
reproducción por auriculares, pero no funciona con altavoces y presenta el problema
de la personalización. Y no olvidemos los abordajes híbridos, que intentan mezclar lo
mejor de los dos mundos. Por ejemplo, Dolby Atmos utiliza camas (basado en canales)
y objetos (basado en objetos), y la mayoría de las aplicaciones de RV utilizan tanto
Ambisonics como Binaural.

Espero que ahora tengas una visión más amplia del sonido 3D (cómo funciona y cómo
se puede utilizar, cuáles son los diferentes sistemas y para qué se usan) y que
entiendas un poco mejor este mundo del sonido 3D que actualmente está en auge,
tanto en el cine como en la televisión, así como en los videojuegos, la música, la RV y
otras muchas aplicaciones. Estos son tiempos maravillosos para todos los que aman
el audio espacial. Y siempre podrás hacer tus pruebas con el software Sound
Particles , que admite la mayoría de estos formatos.

[Link] 36
Sound Particles es el software de sonido 3D
imprescindible que ya han utilizado los principales
estudios de Hollywood en producciones como
Dune, Juego de Tronos, Star Wars 9 y Frozen 2.
Gracias a los micrófonos virtuales, podrás para generar miles de sonidos. ¿Quieres
renderizar audio en cualquier formato, crear un campo de batalla? Basta con crear
desde mono a 22.2 pasando por un grupo de partículas con 10 000
Ambisonics de 6.ª generación o cualquier partículas (fuentes de sonido), importar 200
otra configuración personalizada.
Sound efectos sonoros bélicos de tu biblioteca de
Particles es el arma secreta de los estudios audio, añadir movimientos y efectos
de Hollywood para crear un sonido épico. sonoros aleatorios, y capturar el resultado
Una de sus características únicas es su con un micrófono virtual. Todo este proceso,
capacidad de utilizar sistemas de partículas listo en pocos minutos.

PRUEBA LA DEMO YA

Sound Particles es gratis para profesores, alumnos y centros educativos

Sound Particles S.A. Rua da Carvalha, 570, 2400-441, Leiria, Portugal


[Link] ● info@[Link] ● +351 244 245 830

También podría gustarte