Cómo añadir una voz en off con IA a un video: guía de Noiz Studio
Una voz puede sonar bien por sí sola y, aun así, no encajar con la imagen. Si la narración llega después de una acción, sigue hablando de la escena anterior o va demasiado rápido en un tutorial, al público le cuesta relacionar las palabras con lo que ve. Conviene revisar dos cosas por separado: si la voz comunica bien el guion y si ese guion corresponde al plano actual.
Esta guía documenta un proyecto en inglés de AI Dubbing de Noiz Studio: añadimos una narración de apertura a una animación muda de 15 segundos en la que una niña lee un libro mágico. Subimos el clip, lo añadimos a la línea de tiempo, generamos un segmento de voz, lo previsualizamos y exportamos un MP4. Es un ejemplo concreto; no demuestra que la herramienta escriba la narración, ajuste su duración o sincronice los labios automáticamente.
En resumen: En un proyecto abierto, sube un video preparado. Pasa el cursor por su tarjeta en Assets y selecciona Add asset. Después, ve a Speech → + Add segment → Type this voice block, escribe el guion, elige una voz y pulsa Use; luego, selecciona Generate. Revisa la voz con Play en el segmento y después reproduce la línea de tiempo para comprobarla con el video. Para exportar, elige Export → Video → MP4 → 720p → Export.
1. Sube un clip preparado
El ejemplo empieza dentro de un proyecto abierto de AI Dubbing. Sube story-silent.mp4 desde Assets y comprueba que la miniatura corresponde a la animación elegida. El archivo se silenció localmente antes de subirlo; esa preparación ocurrió fuera de Noiz Studio. No es un paso para quitar el audio original dentro del producto.

Si tu video tiene diálogo, música o sonido ambiente, decide primero qué debe conservarse. Un ejemplo sin sonido no permite concluir cómo se procesa una banda sonora existente.
2. Añade el video a la línea de tiempo
Pasa el cursor por la tarjeta del clip en Assets. Cuando aparezca Add asset, haz clic. Subir un archivo y añadirlo a la línea de tiempo son acciones distintas. Antes de escribir, confirma que la vista previa y la línea de tiempo muestran el mismo clip.

El clip de muestra dura 15 segundos. Decide si la voz presentará la escena inicial o acompañará varias acciones. No des por hecho que un segmento generado cubrirá automáticamente todo el video.
3. Escribe pensando en la imagen
Selecciona Speech → + Add segment → Type this voice block y escribe un texto que corresponda a lo que ocurre en pantalla. Este fue el guion en inglés de la prueba:
Lily opened the old book, and tiny golden lights danced across the room. Every page held a secret, and tonight, her adventure was about to begin.

Se introdujo un único bloque en inglés de 145 caracteres. No se generó el guion a partir del video, no se sincronizaron palabras con cada acción y no se probaron varios hablantes. Guarda una copia del texto para compararlo con el resultado.
4. Elige una voz y genera
Abre el selector de voces, elige The Healer (Serena) y pulsa Use. Escucha si encaja con la historia y el público previsto; una voz recomendada es solo un punto de partida.

Pulsa Generate y espera a que aparezca el resultado del segmento. En esta prueba se generó una sola vez. Regenerate aparecía en la interfaz, pero no se probó; por eso no afirmamos cómo funciona ni cuánto cuesta.

5. Revisa la voz y el video completo
Primero pulsa Play en el segmento y compara lo que oyes con el guion. Después reproduce la línea de tiempo para comprobar la relación entre la narración y la animación. La primera escucha sirve para evaluar la voz; la segunda, para valorar su momento dentro del montaje.

La voz dura unos nueve segundos y la imagen, 15. Por tanto, el final conserva imagen sin narración; esto no demuestra un ajuste automático de duración. Revisa también nombres, acciones, ritmo y cualquier audio original que quieras mantener.
6. Exporta e inspecciona el MP4
Selecciona Export → Video → MP4 → 720p → Export. Abre el archivo exportado y confirma que incluye imagen y sonido y que el final es intencional.

El archivo de muestra se comprobó con una duración de 15.040998 segundos, una resolución de 1280 × 720 y audio estéreo de 44,1 kHz. Son datos de esta exportación, no una garantía para todos los proyectos.
Qué revisar según el tipo de video
Dramas cortos y cómics: Comprueba quién habla y cuándo entra cada frase. Esta prueba usa una sola voz narrativa; no verifica la asignación de personajes ni los turnos de diálogo.
Reseñas de películas: Contrasta cada afirmación con el plano y el orden de las escenas. Aquí no se probó cómo se maneja el audio original.
Videos sin presentador: Asigna una función informativa a cada imagen y procura que la narración se entienda sin depender del texto en pantalla.
Tutoriales de producto: Evita que la explicación se adelante a los controles. Deja tiempo para que el público siga cada acción.
Qué demuestra esta prueba
| Capacidad | Evidencia de este ejemplo |
|---|---|
| Subir un video y añadirlo a la línea de tiempo | Animación muda de 15 segundos |
| Escribir texto, elegir una voz y generar | Un segmento en inglés de 145 caracteres; voz Serena |
| Escuchar el segmento y previsualizar la línea de tiempo | Se realizaron ambas comprobaciones |
| Exportar un MP4 | Archivo comprobado: 15.040998 s, 1280 × 720, estéreo a 44,1 kHz |
| Quitar el audio original, escribir desde el video, ajustar duración, sincronizar labios o crear varios personajes | No se verificó en este flujo |
Empieza con una escena
Prepara un clip, añádelo a un proyecto abierto de Studio y escribe una narración para la acción visible. Revisa por separado el segmento y la línea de tiempo completa antes de exportar.
Abrir Noiz Studio. El enlace abre Studio; esta guía empieza dentro de un proyecto existente.
Guía relacionada: Traducir un video con IA.