"Dar a humanos e IA libertad sonora completa."
Esa frase está escrita en la misión de Noiz. Suena ambiciosa, pero detrás hay una evolución muy concreta: desde una sola persona reproduciendo desde cero un paper de clonación de voz, hasta MockingBird en código abierto usado por desarrolladores de todo el mundo, y de ahí a un producto que hoy sirve a millones de creadores y desarrolladores, con la comprensión, generación y edición de audio integradas en un solo marco.
Si la AGI es una pila de capacidades superpuestas, Noiz quiere ocupar una capa específica: la capa de sonido, responsable de escuchar, entender y responder, conectando la creación de contenido, la inteligencia con cuerpo físico y la interacción con agentes.
Contenido
Todo empezó con un libro y MockingBird
El camino del fundador Chen Weijia hasta fundar Noiz fue muy personal. Después de que Yufu Tech fuera adquirida, buscaba una nueva dirección, y un libro de deep learning acumulando polvo lo devolvió al mundo de la voz. Sin GPU a mano y con su Python bastante oxidado, aun así reprodujo la clonación de voz desde cero y construyó MockingBird en chino, que ganó una tracción considerable en GitHub.
El repositorio de MockingBird apunta hoy a noiz.ai: la comunidad de código abierto fue el punto de partida; el producto es el terreno de batalla a largo plazo. De aquella etapa quedaron dos convicciones: primero, la distancia real entre la ingeniería que funciona y un paper académico; segundo, que una voz con emoción y expresividad genuinas merecía, por sí sola, una empresa entera.
En 2024, el equipo se comprometió a "profundizar en la capa de sonido de la IA", y Noiz AI tomó su forma actual. El nombre NOIZ viene de "noise" (ruido) — originalmente un término técnico dentro del modelo, que después se convirtió en el símbolo del equipo.
Tres giros de producto: generación, expresión, creación
La dirección de producto de Noiz ha pasado por tres etapas de crecimiento, cada una preguntándose cómo servir mejor lo que los usuarios realmente necesitan.
La primera pregunta fue: ¿puede la IA hablar como una persona?
Una vez que la clonación pudo producir habla, resultó no ser suficiente: también tenía que actuar — la emoción, el ritmo y el estilo debían ser controlables.
Después de eso: lo que los creadores realmente querían era producción de pista completa — doblaje, banda sonora, efectos de sonido y edición, todo dentro del mismo estudio.
Los tres giros se pueden resumir así:
Generación → lograr que las palabras se pronuncien en voz alta
Control y expresión → sonar como el personaje, como la marca, como esa escena
Creación → una estación de trabajo de audio con IA completa
Como se cuenta en la historia del equipo en la "Copa del Rector" del x-lab de Tsinghua, dejaron de acumular funciones y se centraron en una sola cosa: si la expresión realmente funciona. Los usuarios registrados a nivel global superaron el millón en seis meses, con un ARR cercano a los 4 millones de dólares — prueba de que esa decisión tuvo respaldo real del mercado.
Qué significa "la capa de sonido" en el mapa técnico
Noiz ha hablado públicamente de tres líneas principales de trabajo:
Inferencia en tiempo real
El drama interactivo, los videojuegos, el streaming en vivo y la conversación con agentes necesitan audio de baja latencia. Trabajos como AudioX-Turbo comprimen la difusión multipaso a muy pocos pasos — generando 10 segundos de audio en aproximadamente 0.2 segundos en una RTX 4090 — sentando las bases para "reconstruir el sonido en tiempo real".
Modelado unificado de voz, música y efectos de sonido
El sonido es, físicamente, el mismo fenómeno sin importar la categoría. Solo un modelado unificado permite que voz, ambiente y banda sonora se coordinen dentro del mismo proyecto, al servicio de una escucha "de espectro completo".
Memoria acústica persistente
Los agentes y los sistemas con cuerpo físico necesitan recordar "cómo suena este espacio" y "qué timbre prefiere este usuario". Una capa de sonido construida solo sobre un TTS sin estado no puede sostener una interacción a largo plazo — la memoria acústica es la siguiente pieza del rompecabezas.
Desde Audio-Omni (un marco unificado de comprensión, generación y edición) hasta la serie AudioX (generación conjunta de audio y video), la investigación de Noiz nunca se ha detenido. Solo si la investigación avanza, el producto puede convertir esa capacidad en una interfaz que los creadores realmente puedan usar con un clic.
Escuchar, entender, responder
La "capa de sonido" se puede descomponer en un ciclo cerrado:
Escuchar: reconocer el contenido, la escena, la emoción y la fuente del sonido
Entender: combinar eso con conocimiento del mundo para saber qué función cumple ese audio en la narrativa
Responder: generar o editar el siguiente fragmento de sonido apropiado
Esto es distinto de un pipeline que solo hace "entra texto, sale audio". Un pipeline resuelve capacidad de producción; un ciclo cerrado resuelve interacción y creación. Chen Qian lo plantea así en entrevistas: la voz será una de las primeras interfaces en despegar en los próximos años, porque el hardware puede permanecer siempre activo con bajo consumo, y la separación de voces junto con el reconocimiento de emociones en campos sonoros complejos siguen siendo, en gran medida, territorio inexplorado.
Que el TTS Skill de Noiz lidere las instalaciones en plataformas como OpenClaw es una señal de que los desarrolladores ya tratan "un agente que puede hablar" como algo dado por sentado; el siguiente paso es la capacidad de audio nativa para agentes, ampliando el servicio de las personas a las máquinas y a las entidades de software.
Qué pueden sentir los creadores hoy
La visión se traduce en funciones de producto muy concretas:
texto a voz: doblaje para series cortas chinas, motion comics y video corto, con control de emoción, marcadores de pausa y presets de voz guardados
Diseño de voz: describe un sonido que la biblioteca no tiene
Clonación: fija un personaje a partir de una muestra de 3 a 10 segundos
Efectos de sonido y banda sonora: completa el ambiente y la acción
API / Skills: intégralo en flujos de trabajo y agentes
Para el creador individual, la capa de sonido significa no necesitar un estudio de grabación para producir una pista de audio profesional. Para los equipos, significa activos de voz reutilizables, localizables y accesibles mediante programación.
En qué se diferencia de "otra startup más de voz"
La voz con IA ya es una categoría propia y de peso, con empresas líderes valoradas en decenas de miles de millones de dólares. El posicionamiento de Noiz no es repetir el discurso de "suena más humano", sino profundizar en la emoción del contenido corto, el sonido integral y la fusión entre modelo y producto:
Capa de modelo: más de una docena de modelos de audio, con versiones menores que salen incluso cada tres días
Capa de producto: un Studio todo en uno, que reduce los saltos entre software de edición y bibliotecas externas de efectos de sonido
Capa de ecosistema: papers en código abierto, proyectos en GitHub, APIs para desarrolladores
Chen Qian lo ha descrito como "fusión modelo-producto": la iteración del modelo empuja el producto hacia adelante, y el feedback real vuelve a tirar del modelo. El audio tiene una dimensión artística, y la marca junto con el buen oído seguirán generando diferenciación a largo plazo — incluso cuando la capacidad subyacente converja, el flujo de trabajo y la comprensión del contexto todavía pueden marcar una distancia real frente a la competencia.
Desde reproducir un solo paper hasta exportar pistas de audio para millones de usuarios cada día, Noiz ha seguido enfocada en una sola cosa: darle al sonido el lugar que le corresponde dentro del mundo de la IA. La expresión necesita calidez, las escenas necesitan textura, y la interacción necesita entender de verdad y responder de verdad.
La "libertad sonora completa" no es un eslogan — es el resultado acumulado de generación, expresión y creación, apiladas una sobre otra. Cuando la capa de sonido queda completa, la imagen, el texto y la acción finalmente encajan en el mismo mundo.
Siguiente paso: abre el texto a voz de Noiz AI, guarda un preset de voz de personaje y trátalo como el primer activo de voz de tu proyecto.
Prueba el texto a voz de Noiz AI →