Cómo crear una experiencia de sonido 3D en realidad virtual convincente

Luke Goodloomis
|
|
June 8, 2017
|
5
Min Read
Cómo crear una experiencia de sonido 3D en realidad virtual convincente

‍El papel del audio en la realidad virtual

A medida que la implementación de la realidad virtual (RV) aumenta, acumulando casos de uso a diario, queda claro que una parte fundamental de la experiencia inmersiva es el campo sonoro. ¿Cómo crear una experiencia de sonido 3D convincente en realidad virtual? En este artículo, TEECOM define las mejores prácticas para la adquisición, producción y distribución de audio al crear contenido de RV, incluyendo la sincronización y espacialización de audio y video.

Un audio realista y sincronizado aumentará la percepción de inmersión del usuario en el entorno de realidad virtual y reducirá los efectos secundarios fisiológicos comunes en las producciones actuales, como dolores de cabeza, mareos y fatiga. Las siguientes mejores prácticas pueden parecer elementales, pero cada paso es lo suficientemente importante como para ser respetado como un elemento independiente en la cadena de producción. Estas pautas no deben considerarse exhaustivas, sino que proporcionan un punto de partida para una mayor exploración a medida que este campo evoluciona. La metodología de producción de audio existente debe adaptarse a las idiosincrasias necesarias para una mezcla de RV exitosa.

How to Create a Convincing Virtual Reality 3D Sound Experience
©ISE2017

‍

Pautas de producción para un sonido 3D realista

Para crear una experiencia de realidad virtual convincente y mitigar los efectos secundarios fisiológicos del uso de un visor de realidad virtual, la cadena completa de señal de audio requiere más atención que en producciones anteriores. Es necesario examinar cada paso del flujo de trabajo de producción de audio. El mezclador de audio para RV debe ser capaz de monitorear y reproducir el audio mezclado y procesado en auriculares en tiempo real. Esto incluye cualquier compresión de exportación, procesamiento de función de transferencia relacionada con la cabeza (HRTF) y psicoacústica calibración.

Adquisición de audio

Evite los recursos de audio en formato MP3 u otros formatos de audio con pérdida. Esto incluye bibliotecas de audio existentes y nuevas adquisiciones de audio. El procesamiento requerido para las producciones de RV creará artefactos audibles en los elementos de audio e impedirá que el audio se coloque con precisión en un campo sonoro.

Evite grabaciones de sonidos localizados (pasos, clics, chirridos de puertas y otros efectos de sonido) que contengan ruido de sala, reverberación o convolución. Los efectos y el procesamiento necesarios para crear el entorno de sala de RV se aplicarán a cada sonido que mezcle cuando se procese para escucharlo en un entorno de 360 grados (4πr2). Si se aplican múltiples convoluciones a una grabación, la espacialización se distorsiona y será imposible lograr una localización precisa.

Utilice, como mínimo, grabaciones de 24 bits y 48 kHz. Incluso las grabaciones de 16 bits y 44.1 kHz pueden no satisfacer las altas necesidades de procesamiento de la RV. Las grabaciones con una frecuencia de muestreo más alta serán menos susceptibles a la distorsión de fase causada por las múltiples capas de filtros aplicadas durante el proceso de postproducción. Las profundidades de bits más altas sonarán más naturales cuando se procesen para la convolución. Es posible que deba replantearse qué bibliotecas de sonido está utilizando y cómo está capturando los recursos de audio. La ubicación del micrófono será clave en el proceso de grabación. La colocación debe ser lo suficientemente cercana a la fuente de sonido para evitar que se grabe el sonido de la sala y cualquier otro sonido no deseado, pero lo suficientemente alejada para capturar el sonido completo y no solo un elemento del mismo.

Si usted es un creador de bibliotecas de efectos de sonido, publique una biblioteca de sonidos que tenga un contenido robusto y resistente a un procesamiento posterior intenso. Idealmente, los sonidos deben grabarse de forma nativa en archivos de audio sin comprimir de 24 bits/96 kHz o, al menos, de 24 bits/48 kHz.

Postprocesamiento y la estación de trabajo de audio digital (DAW)

Evite importar recursos de una manera que altere la fase o distorsione el contenido de alta frecuencia del audio. El audio debe importarse de forma nativa al formato de archivo o convertirse únicamente a un formato similar sin compresión (por ejemplo, convertir .wav a .aiff o .wav64).

Evite aplicar filtros que alteren la fase o eliminen altas frecuencias, como la compresión dinámica, la compresión de archivos, los complementos de espacialización 3D de baja calidad y la ecualización compleja o intensa. Todos los efectos deben ser de fase lineal.

Si usted es creador de productos DAW o fabricante de complementos, considere lanzar un conjunto de complementos de posproducción de video de uso común con poca o ninguna alteración de fase. Cree un complemento que analice los recursos de audio y recomiende si el recurso de audio tiene las cualidades necesarias para soportar un procesamiento intenso sin dañar el sonido de una manera que afecte negativamente la experiencia de realidad virtual.

Asegúrese de que sus herramientas de producción de realidad virtual funcionen de forma nativa a un mínimo de 24 bits y 48 kHz (se recomiendan 24/96). Esta mayor profundidad de bits y frecuencia de muestreo ayudará a mitigar los efectos perjudiciales del intenso procesamiento necesario para crear el entorno de audio de realidad virtual.

Renderizado para reproducción en realidad virtual y exportación desde el DAW

Este paso puede dividirse en dos procesos dependiendo de los formatos exportados y la metodología de posprocesamiento.

  1. Evite utilizar un formato de mezcla único para todas las situaciones de reproducción. Por ejemplo, no mezcle para 5.1 y procese esa mezcla para realidad virtual. Cree mezclas independientes para cada formato de reproducción.
  2. Utilice un algoritmo de realidad virtual que se preste a ser convertido a un HRTF optimizado (O-HRTF) o personalizado (P-HRTF) con la menor distorsión posible.

Distribución al usuario final

Evite la compresión con pérdida al procesar el contenido para su distribución. Su producción se verá afectada si todo el trabajo y el cuidado puestos en preservar un audio preciso se pierden en la cadena de distribución. Lo ideal es que la frecuencia de muestreo de 48 kHz o superior se conserve en el formato de audio final. Esto ayudará a eliminar cualquier distorsión de fase introducida por los filtros de limitación de banda necesarios para el audio de 44.1 kHz, los cuales afectan la espacialización[1].

Hardware de reproducción: auriculares y visores

Utilice auriculares de alta calidad capaces de producir un escenario sonoro y una espacialización lo más precisos posible. THX y Oculus desaconsejan el uso de auriculares intraurales; sus pruebas han demostrado que estos no proporcionan un escenario sonoro preciso, aunque las investigaciones formales que utilizan P-HRTF y un sistema de reproducción calibrado no han respaldado estas anécdotas. Se requieren más estudios y pruebas.

Software de reproducción: HRTF y calibración

  1. Incorpore P-HRTF como parte del software de reproducción.
  2. Incluya una forma de calcular el tamaño de la cabeza del oyente. Esto podría ser tan sencillo como un dispositivo de medición integrado en la diadema del visor de realidad virtual.

Incluya un paso final de calibración del audio después de aplicar el P-HRTF y el tamaño de la cabeza. Cada par de auriculares y cada par de oídos humanos localizarán los sonidos en el mundo de realidad virtual con variaciones que van de leves a importantes. Además, experimentos recientes han demostrado que los P-HRTF no proporcionan resultados precisos debido a la forma en que el cerebro humano procesa el audio. Más del 25 por ciento de los sujetos no localizan los sonidos donde el otro 75 por ciento los escucha utilizando únicamente P-HRTF. Estas variaciones de localización van desde un sonido que debería estar localizado y se reproduce como una masa sonora, hasta un sonido que debería estar frente al oyente y parece provenir del interior de su cabeza o desde atrás.

El audio debe estar sincronizado con el video. La latencia máxima estimada debería apuntar a cerca de 2-3 ms. Gran parte del contenido disponible actualmente puede tener hasta 10 ms de latencia de audio. La siguiente tabla resume lo anterior:

VR Audio Best Practices

El audio al servicio de la experiencia inmersiva

Solo cuando se consideran estos elementos, junto con la resolución de video en relación con la agudeza visual y las frecuencias de cuadro, se logra una experiencia de realidad virtual convincente y que no resulte perjudicial.

La experiencia debe prevalecer sobre cualquier otra consideración. Debemos reconocer las limitaciones de nuestras herramientas y movernos dentro de los límites que estas imponen. Todos los elementos que componen una experiencia deben servir a la intención del creador y a la experiencia misma. Dejemos que el arte guíe a la tecnología. Como dice George Massenburg: "Si creemos que puede ser mejor, al menos deberíamos intentarlo".

[1] La audibilidad de los filtros de audio digital típicos en un sistema de reproducción de alta fidelidad. Documento AES 9174. 2014. Jackson, Helen M.; Capp, Michael D.; Stuart, Robert J.