Libertad sonora completa para humanos e IA: la visión de Noiz sobre la capa de sonido

Noiz quiere ocupar una capa de la pila de la AGI — la capa de sonido que escucha, entiende y responde — construida sobre tres caminos que convergen: inferencia en tiempo real, modelado unificado y memoria acústica.

Libertad sonora completa para humanos e IA: la visión de Noiz sobre la capa de sonido | Noiz

"Dar a humanos e IA libertad sonora completa."

Esa frase está escrita en la misión de Noiz. Suena ambiciosa, pero detrás hay una evolución muy concreta: desde una sola persona reproduciendo desde cero un paper de clonación de voz, hasta MockingBird en código abierto usado por desarrolladores de todo el mundo, y de ahí a un producto que hoy sirve a millones de creadores y desarrolladores, con la comprensión, generación y edición de audio integradas en un solo marco.

Si la AGI es una pila de capacidades superpuestas, Noiz quiere ocupar una capa específica: la capa de sonido, responsable de escuchar, entender y responder, conectando la creación de contenido, la inteligencia con cuerpo físico y la interacción con agentes.

Contenido

Todo empezó con un libro y MockingBird

El camino del fundador Chen Weijia hasta fundar Noiz fue muy personal. Después de que Yufu Tech fuera adquirida, buscaba una nueva dirección, y un libro de deep learning acumulando polvo lo devolvió al mundo de la voz. Sin GPU a mano y con su Python bastante oxidado, aun así reprodujo la clonación de voz desde cero y construyó MockingBird en chino, que ganó una tracción considerable en GitHub.

El repositorio de MockingBird apunta hoy a noiz.ai: la comunidad de código abierto fue el punto de partida; el producto es el terreno de batalla a largo plazo. De aquella etapa quedaron dos convicciones: primero, la distancia real entre la ingeniería que funciona y un paper académico; segundo, que una voz con emoción y expresividad genuinas merecía, por sí sola, una empresa entera.

En 2024, el equipo se comprometió a "profundizar en la capa de sonido de la IA", y Noiz AI tomó su forma actual. El nombre NOIZ viene de "noise" (ruido) — originalmente un término técnico dentro del modelo, que después se convirtió en el símbolo del equipo.

Tres giros de producto: generación, expresión, creación

La dirección de producto de Noiz ha pasado por tres etapas de crecimiento, cada una preguntándose cómo servir mejor lo que los usuarios realmente necesitan.

La primera pregunta fue: ¿puede la IA hablar como una persona?

Una vez que la clonación pudo producir habla, resultó no ser suficiente: también tenía que actuar — la emoción, el ritmo y el estilo debían ser controlables.

Después de eso: lo que los creadores realmente querían era producción de pista completa — doblaje, banda sonora, efectos de sonido y edición, todo dentro del mismo estudio.

Los tres giros se pueden resumir así:

  1. Generación → lograr que las palabras se pronuncien en voz alta

  2. Control y expresión → sonar como el personaje, como la marca, como esa escena

  3. Creación → una estación de trabajo de audio con IA completa

Como se cuenta en la historia del equipo en la "Copa del Rector" del x-lab de Tsinghua, dejaron de acumular funciones y se centraron en una sola cosa: si la expresión realmente funciona. Los usuarios registrados a nivel global superaron el millón en seis meses, con un ARR cercano a los 4 millones de dólares — prueba de que esa decisión tuvo respaldo real del mercado.

Qué significa "la capa de sonido" en el mapa técnico

Noiz ha hablado públicamente de tres líneas principales de trabajo:

Inferencia en tiempo real

El drama interactivo, los videojuegos, el streaming en vivo y la conversación con agentes necesitan audio de baja latencia. Trabajos como AudioX-Turbo comprimen la difusión multipaso a muy pocos pasos — generando 10 segundos de audio en aproximadamente 0.2 segundos en una RTX 4090 — sentando las bases para "reconstruir el sonido en tiempo real".

Modelado unificado de voz, música y efectos de sonido

El sonido es, físicamente, el mismo fenómeno sin importar la categoría. Solo un modelado unificado permite que voz, ambiente y banda sonora se coordinen dentro del mismo proyecto, al servicio de una escucha "de espectro completo".

Memoria acústica persistente

Los agentes y los sistemas con cuerpo físico necesitan recordar "cómo suena este espacio" y "qué timbre prefiere este usuario". Una capa de sonido construida solo sobre un TTS sin estado no puede sostener una interacción a largo plazo — la memoria acústica es la siguiente pieza del rompecabezas.

Desde Audio-Omni (un marco unificado de comprensión, generación y edición) hasta la serie AudioX (generación conjunta de audio y video), la investigación de Noiz nunca se ha detenido. Solo si la investigación avanza, el producto puede convertir esa capacidad en una interfaz que los creadores realmente puedan usar con un clic.

Escuchar, entender, responder

La "capa de sonido" se puede descomponer en un ciclo cerrado:

  • Escuchar: reconocer el contenido, la escena, la emoción y la fuente del sonido

  • Entender: combinar eso con conocimiento del mundo para saber qué función cumple ese audio en la narrativa

  • Responder: generar o editar el siguiente fragmento de sonido apropiado

Esto es distinto de un pipeline que solo hace "entra texto, sale audio". Un pipeline resuelve capacidad de producción; un ciclo cerrado resuelve interacción y creación. Chen Qian lo plantea así en entrevistas: la voz será una de las primeras interfaces en despegar en los próximos años, porque el hardware puede permanecer siempre activo con bajo consumo, y la separación de voces junto con el reconocimiento de emociones en campos sonoros complejos siguen siendo, en gran medida, territorio inexplorado.

Que el TTS Skill de Noiz lidere las instalaciones en plataformas como OpenClaw es una señal de que los desarrolladores ya tratan "un agente que puede hablar" como algo dado por sentado; el siguiente paso es la capacidad de audio nativa para agentes, ampliando el servicio de las personas a las máquinas y a las entidades de software.

Qué pueden sentir los creadores hoy

La visión se traduce en funciones de producto muy concretas:

  • texto a voz: doblaje para series cortas chinas, motion comics y video corto, con control de emoción, marcadores de pausa y presets de voz guardados

  • Diseño de voz: describe un sonido que la biblioteca no tiene

  • Clonación: fija un personaje a partir de una muestra de 3 a 10 segundos

  • Efectos de sonido y banda sonora: completa el ambiente y la acción

  • API / Skills: intégralo en flujos de trabajo y agentes

Para el creador individual, la capa de sonido significa no necesitar un estudio de grabación para producir una pista de audio profesional. Para los equipos, significa activos de voz reutilizables, localizables y accesibles mediante programación.

En qué se diferencia de "otra startup más de voz"

La voz con IA ya es una categoría propia y de peso, con empresas líderes valoradas en decenas de miles de millones de dólares. El posicionamiento de Noiz no es repetir el discurso de "suena más humano", sino profundizar en la emoción del contenido corto, el sonido integral y la fusión entre modelo y producto:

  • Capa de modelo: más de una docena de modelos de audio, con versiones menores que salen incluso cada tres días

  • Capa de producto: un Studio todo en uno, que reduce los saltos entre software de edición y bibliotecas externas de efectos de sonido

  • Capa de ecosistema: papers en código abierto, proyectos en GitHub, APIs para desarrolladores

Chen Qian lo ha descrito como "fusión modelo-producto": la iteración del modelo empuja el producto hacia adelante, y el feedback real vuelve a tirar del modelo. El audio tiene una dimensión artística, y la marca junto con el buen oído seguirán generando diferenciación a largo plazo — incluso cuando la capacidad subyacente converja, el flujo de trabajo y la comprensión del contexto todavía pueden marcar una distancia real frente a la competencia.


Desde reproducir un solo paper hasta exportar pistas de audio para millones de usuarios cada día, Noiz ha seguido enfocada en una sola cosa: darle al sonido el lugar que le corresponde dentro del mundo de la IA. La expresión necesita calidez, las escenas necesitan textura, y la interacción necesita entender de verdad y responder de verdad.

La "libertad sonora completa" no es un eslogan — es el resultado acumulado de generación, expresión y creación, apiladas una sobre otra. Cuando la capa de sonido queda completa, la imagen, el texto y la acción finalmente encajan en el mismo mundo.

Siguiente paso: abre el texto a voz de Noiz AI, guarda un preset de voz de personaje y trátalo como el primer activo de voz de tu proyecto.

Prueba el texto a voz de Noiz AI →

Contenido relacionado

Frequently Asked Questions

¿Qué significa exactamente "libertad sonora"?

En el lado creativo, cualquier personaje, emoción o ambiente puede expresarse. En el lado técnico, la generación, edición e interacción en tiempo real no están limitadas por cadenas de herramientas antiguas. En el lado de la interacción, humanos e IA se comunican con sonido natural.

¿Qué es Noiz AI?

Noiz AI es una herramienta de creación de sonido con IA para creadores, marcas y desarrolladores. Sus capacidades principales incluyen texto a voz, clonación de voz, diseño de voz y generación de efectos de sonido, usadas en video corto, podcasts, audiolibros, publicidad, contenido educativo, personajes de videojuegos y localización multilingüe.

¿En qué se diferencia en la práctica la "capa de sonido" de Noiz de un simple TTS?

El TTS solo resuelve "leer este texto en voz alta". La capa de sonido cubre toda la cadena de comprensión, generación y edición, y admite ambiente, banda sonora, interacción en tiempo real e integración con agentes, pensada para producir contenido de audio completo, no una sola línea.

Prueba Noiz gratis