Cualquiera que haya hecho locución o diseño de sonido con IA conoce la rutina: escribes un prompt, generas una versión, no funciona, generas otra vez, sigue sin funcionar, y vuelves a tirar los dados.
La generación de imágenes ya superó esta etapa: pasó de "a ver si sale algo bueno" a flujos de edición donde señalas exactamente lo que está mal y lo corriges. El audio sigue atascado en la fase anterior. Entender, generar y editar suele significar tres herramientas distintas, tres archivos exportados y tres líneas de tiempo que hay que cuadrar a mano.
Audio-Omni se construyó para cambiar eso: entender, crear y corregir, todo dentro de un mismo marco. El trabajo fue aceptado en SIGGRAPH 2026, con colaboradores de HKUST, Tencent WeChat Vision, la Universidad de Pekín y otros equipos. Zeyue Tian, responsable de algoritmos en Noiz, es uno de los autores del paper, y Noiz está convirtiendo progresivamente esa capacidad de investigación en funciones reales del producto.
Contenido
Qué puede hacer en la práctica: nueve tipos de generación, cinco de edición
En qué se diferencia de "un modelo gigante que lo hace todo"
Por qué los creadores necesitan las tres cosas a la vez
El CEO de Noiz, Chen Qian, describió sin rodeos el flujo de producción real en una entrevista:
En video corto, series cortas y locución publicitaria, casi nunca basta con "generar una vez y listo". Primero hay que entender qué está pasando en el material original y dónde caen los momentos emocionales clave. Luego se genera el diálogo o el sonido ambiente. Y al final, en la línea de tiempo, hay que ajustar una palabra, quitar una capa de ruido o añadir un golpe puntual.
Repartido entre tres modelos distintos, algo se pierde en cada paso: el modelo de comprensión no sabe qué se podrá editar después; el modelo de generación no sabe qué se analizó antes; el modelo de edición ni siquiera tiene acceso al contexto original. Mientras tanto, el creador es quien termina llevando archivos de un lado a otro entre tres interfaces distintas.
El enfoque de Audio-Omni es un marco unificado: ambiente general, música y voz procesados dentro del mismo sistema, con edición por instrucciones integrada desde el principio.
La arquitectura: cómo trabajan juntas las dos mitades
La estructura del paper se puede resumir en dos componentes que trabajan en conjunto:
Un modelo de lenguaje multimodal congelado (MLLM)
Se encarga de "pensar": entiende el contenido del audio, la escena y quién habla, y además puede recurrir a conocimiento general del mundo. Con un prompt como "el instrumento que tocaría el batería de Led Zeppelin", el modelo puede razonar que se trata de una batería y generar el sonido correspondiente. Ese tipo de razonamiento es muy difícil de entrenar solo con pares de texto y audio.
Un generador de difusión entrenable (DiT)
Se encarga de "hacer": convierte esa comprensión en audio de alta fidelidad. La semántica de alto nivel entra mediante cross-attention; el timing, el timbre y la sincronía con el video a bajo nivel se gestionan mediante empalme a nivel de señal, lo que facilita el ajuste labial y la coherencia con la imagen.
El equipo también construyó el conjunto de datos AudioEdit: más de un millón de ejemplos de edición por instrucciones, combinando minería de video real con síntesis programática, para que operaciones como "añade esto, quita aquello, cambia el estilo" finalmente tengan datos con los que aprender.
Un hallazgo interesante: al conectar con el MLLM, la penúltima capa suele funcionar mejor para la síntesis de audio que la última. La última capa está demasiado orientada a "predecir el siguiente token", lo que difumina el detalle acústico; la penúltima conserva más información útil para la generación. Es un dato valioso para cualquiera que combine modelos de lenguaje grandes con generación de audio.
Qué puede hacer en la práctica: nueve tipos de generación, cinco de edición
Lado de generación (selección)
Texto a ambiente, texto a música
Video a locución, video a banda sonora
Texto a voz, conversión de voz zero-shot
Instrucciones multilingües (chino, japonés, francés y más funcionan directamente como prompt)
Generación basada en conocimiento, continuación de estilo a partir de un audio de referencia
Lado de edición (selección)
Añadir: incorporar un nuevo elemento a un ambiente ya existente, como una patineta o el rugido de un león
Eliminar: quitar un componente específico, como una voz cantando o el paso de un avión
Extraer: aislar un sonido dentro de una mezcla, como la sirena de una ambulancia
Transferencia de estilo: convertir el ladrido de un perro en un golpe, manteniendo el patrón rítmico
Edición de voz: cambiar unas pocas palabras manteniendo el timbre lo más intacto posible
Para los equipos de series cortas, poder "corregir una línea sin regrabar toda la escena" ahorra muchísimo tiempo de posproducción. Para los creadores de video, "la imagen ya está lista, ahora añado el ambiente que le corresponde" se vuelve algo predecible, no una esperanza.
En qué se diferencia de "un modelo gigante que lo hace todo"
Los modelos de lenguaje multimodales son realmente buenos fusionando audio y video, pero el sonido tiene dimensiones físicas propias: espacialidad, textura del material, reverberación, alineación rítmica, que no viven en los mismos datos que los píxeles.
El equipo de Noiz ha defendido siempre el valor a largo plazo de un motor auditivo independiente: aunque la capa de producto sea un único punto de entrada, el sistema subyacente necesita entrenarse específicamente para el sonido y alinearse con sus propias leyes acústicas. Audio-Omni es una muestra concentrada de esa capacidad del motor; la capa de producto de Noiz la convierte en algo que los creadores pueden usar con un clic, no en una demo de paper académico.
Qué significa esto para los usuarios de Noiz
A corto plazo, notarás el cambio directamente dentro del Studio todo-en-uno de Noiz:
Al generar diálogos, el sistema entiende mejor en qué escena está esa línea
La banda sonora, los efectos de sonido y la voz se mantienen coordinados dentro del mismo proyecto, con menos saltos entre aplicaciones
A medida que se implementa la capacidad de edición, bajan los intentos de "generar otra vez a ver si sale" y también los pasos necesarios para llegar al resultado correcto
A largo plazo, Audio-Omni representa el paso del audio de "herramienta de generación" a "sistema de creación". Las herramientas de imagen ya demostraron que, una vez madura la edición, la capacidad de producción da otro salto. El audio está ahora en ese mismo punto de inflexión.
Código abierto y más lecturas
Página del proyecto: Audio-Omni
Paper: arXiv:2604.10708
Código y modelos: GitHub / Hugging Face
En paralelo, Noiz sigue avanzando en AudioX-Turbo, reduciendo el número de pasos en la inferencia por difusión para que los casos de uso interactivos en tiempo real sean realmente viables. La comprensión y la edición resuelven "si esto está bien"; la eficiencia de inferencia resuelve "si esto puede seguirle el ritmo a una interacción en vivo". Ambas líneas terminan convergiendo en el producto.
La próxima ronda de competencia en creación de audio no girará solo en torno a sonar más humano, sino a quién entiende mejor el material y necesita menos repeticiones. Audio-Omni junta comprensión, generación y edición en un solo marco, y con eso sienta las bases de todo ese flujo.
Si quieres una primera sensación de cómo es un flujo de audio unificado, empieza por el texto a voz de Noiz AI y prueba a combinar diálogo y ambiente dentro del mismo proyecto.
Prueba el texto a voz de Noiz AI →