動画にAIナレーションを追加する方法:Noiz Studioガイド
音声だけを聞けば自然でも、映像と合っているとは限りません。画面の動作よりナレーションが遅れたり、前の場面を説明し続けたりすると、視聴者は言葉と映像を結びつけにくくなります。原稿が音声として聞き取りやすいか、そして今のショットに合っているかを分けて確認しましょう。
このガイドでは、英語版のNoiz Studio AI Dubbingプロジェクトで行った作業を紹介します。魔法の本を読む女の子の15秒の無音アニメに、冒頭のナレーションを一つ追加し、タイムラインで確認してMP4を書き出しました。動画からの自動原稿作成、尺合わせ、リップシンクを示す例ではありません。
手順の概要: 開いているプロジェクトのAssetsに準備済み動画をアップロードします。素材カードにカーソルを合わせ、Add assetをクリックしてタイムラインに追加します。続いてSpeech → + Add segment → Type this voice blockから原稿を入力し、音声を選んでUse、Generateの順に操作します。セグメントのPlayで音声を確認したあと、タイムラインの再生ボタンで映像との関係を確認します。書き出しはExport → Video → MP4 → 720p → Exportです。
1. 準備した動画をアップロード
今回は、開いているAI DubbingプロジェクトのAssetsからstory-silent.mp4をアップロードしました。素材カードのサムネイルが、対象のアニメになっていることを確認します。動画はアップロード前にローカルで無音化したものです。この準備はNoiz Studioの外で行っており、製品内で元音声を除去する手順ではありません。

元動画に会話、音楽、環境音がある場合は、何を残すか先に決めてください。無音素材の例だけでは、既存の音声をどう扱えるかは判断できません。
2. 動画をタイムラインに追加
Assetsの素材カードにカーソルを合わせ、Add assetが表示されたらクリックします。アップロードとタイムラインへの追加は別の操作です。プレビューとタイムラインの両方に同じ動画が表示されてから、ナレーションを考えましょう。

今回の動画は15秒です。冒頭だけを説明するのか、複数の動作に合わせて情報を伝えるのかを決めます。生成した音声が動画全体を自動で埋めるとは限りません。
3. 映像に合う原稿を入力
Speech → + Add segment → Type this voice blockを選び、画面の動きに合う文章を入力します。今回の英語原稿はこちらです。
Lily opened the old book, and tiny golden lights danced across the room. Every page held a secret, and tonight, her adventure was about to begin.

入力したのは145文字の英語原稿一つです。動画から原稿を自動作成したり、単語を個々の動作に同期させたり、複数話者を試したりはしていません。生成結果と照合できるよう、原稿の控えも保存しておきましょう。
4. 音声を選んで生成
音声選択を開き、The Healer (Serena)を選んでUseをクリックします。おすすめ音声は候補の一つです。物語の雰囲気や想定する視聴者に合うかを確認してください。

Generateをクリックし、セグメントに結果が表示されるまで待ちます。この例では一度だけ生成しました。画面にRegenerateは表示されていましたが操作していないため、動作や費用については説明しません。

5. 音声と動画全体を確認
まずセグメントのPlayで音声を聞き、原稿と一致するか確認します。次にタイムライン全体を再生し、声が映像に合うタイミングで流れるか確認します。前者は音声自体の確認、後者は編集上の映像との関係を確認する操作です。

今回の音声は約9秒で、映像は15秒です。そのため、最後にはナレーションのない映像が残ります。これは自動的な尺合わせを示すものではありません。人物名、動作、テンポ、残したい元音声も確認しましょう。
6. MP4を書き出して確認
Export → Video → MP4 → 720p → Exportを選びます。書き出したファイルを開き、映像と音声がそろっているか、末尾の状態が意図どおりかを確認します。

今回のファイルは、長さ15.040998秒、解像度1280×720、音声44.1 kHzステレオでした。これは今回の書き出しで確認した値であり、すべてのプロジェクトで同じ設定になるという意味ではありません。
動画の種類ごとの確認ポイント
ショートドラマ・マンガ動画: 誰の声か、セリフがどの動作のあとに入るかを確認します。この例はナレーター一人のみで、複数人物の割り当てや掛け合いは検証していません。
映画解説: 各説明が現在のショットと場面の順序に合っているかを確認します。元の映画音声の処理は未検証です。
顔出しなし動画: 映像ごとに情報上の役割を持たせ、画面内の文字がなくてもナレーションだけで意味が通るようにします。
製品・操作チュートリアル: 読み上げが画面の操作より先走らないよう、視聴者が操作できる間を確保します。
今回確認した範囲
| 項目 | 今回の確認内容 |
|---|---|
| 動画のアップロードとタイムライン追加 | 15秒の無音アニメで実施 |
| 原稿入力、音声選択、生成 | 英語145文字の1セグメント、Serenaを選択 |
| セグメント再生とタイムライン再生 | 両方を実施 |
| MP4書き出し | 15.040998秒、1280×720、44.1 kHzステレオを確認 |
| 元音声の除去、動画からの自動原稿作成、尺合わせ、リップシンク、複数役 | この手順では未検証 |
まずは一つの場面から
動画を準備して、開いているStudioプロジェクトに追加します。画面に合う原稿を入力し、音声とタイムラインを別々に確認してから書き出しましょう。
Noiz Studioを開く。リンク先はStudioです。この記事の手順は既存プロジェクト内から始まります。
関連記事: AIで動画を翻訳する方法。