目で読むためでなく耳で聞くために書く
Noiz AIは人の話す速さで読み上げます。リスナーが聞けるのは一度だけです。主動詞が出てくるまでいくつもの従属節を頭に留めておかなければならない文は、リスナーを振り落としますし、生成された音声でもそのまま硬さとして出ます。
一息で言えない文は、2つに分けましょう。 これは長さの問題ではなく、リスナーが一度に追える情報量の問題です。複雑な文を分けるだけで、Noiz AIの出力のリズムはすぐに良くなります。
改善前:
「この機能は2024年後半にベータ版として初めて公開され、その後3回の更新を経て、現在ではすべての主要なファイル形式に対応しています。」改善後:
「この機能は2024年後半にベータ版として公開されました。その後3回の更新を経て、現在はすべての主要なファイル形式に対応しています。」Text-to-Speechに貼り付ける前に、すべての文を声に出して読みましょう。 ニュートラルな声で一度スクリプトを読んでみてください。つまずいた箇所や、読んでいて勢いがなくなる箇所があれば、その文を書き直します。それからNoiz AIに貼り付け、Speak It で短くテストしてから、本番のスクリプト全体を生成しましょう。
すべてのスクリプトで短縮形を使う
これがNoiz AIの出力の硬さを直す、いちばん手っ取り早い方法です。「Do not」はフォーマルに聞こえますが、「Don't」は人間らしく聞こえます。生成される音声でも、その違いはすぐに分かります。
硬い表現 | 自然な表現 |
|---|---|
You will not need any experience | You won't need any experience |
It is important to remember | It's important to remember |
We are going to cover | We're going to cover |
Do not skip this step | Don't skip this step |
Text-to-Speechに貼り付ける前に、下書きで検索・置換をかけましょう。「do not」「will not」「it is」「you are」を検索し、短縮形に置き換えます。この一手間だけで、声を変えずに自然さが目に見えて上がります。
感情タグでAIの語り口を導く
Noiz AIのText-to-Speechは、セグメントの先頭に角括弧で感情タグを付けられます。例えば[happy]、[calm]、[excited]、[sad]です。このタグは声にそのセグメントをどう表現するかを伝え、生成音声のテンポ、強弱、トーンを変化させます。
各セグメントの先頭に感情タグを付けましょう。 Text-to-Speechのエディタで、最初の文の前に角括弧のタグを置きます。
[calm]: You know what? For the first time, everything feels right.
タグが効くのは先頭だけです。文の途中や末尾に付けても効果はありません。セグメントの先頭に1つ置くだけで、そのセグメント全体の語り口に影響します。スクリプトの途中で感情を変えたいときは、+ Add Speaker で新しいセグメントを作り、その先頭に新しいタグを付けましょう。
テンプレートで実際の感情表現を確認しましょう。 Text-to-Speechのホーム画面には、Emotion Boost、Sad Monologue、E-commerce Promo、Excited Life Blogger といったテンプレートが用意されています。読み込んでタグの付け方を確認し、生成してどんな語り口になるかを聴いてから、自分のスクリプトを書き始めましょう。
感情タグはスクリプトの内容に合わせましょう。 問題を説明する文に[happy]タグを付けると、不自然な出力になります——語り口と言葉の内容がぶつかってしまうからです。ニュートラルなナレーションやチュートリアルでは、[calm]か、タグなしがいちばん自然な結果になることが多いです。
句読点で自然なテンポを作る
Noiz AIは句読点をテンポの目印として解釈します。カンマは短い呼吸、句点は完全な停止、ダッシュは文中の自然な間を作ります。句読点だけで、多くのクリエイターが思っている以上に語り口を制御できます。
自然に一息入れたい場所にカンマを置きましょう——文法上は必須でなくても構いません。「You don't need a studio, or a microphone, or any recording experience」は、カンマなしの同じ文よりも自然なリズムになります。
強調にはダッシュを使いましょう——ただし控えめに。 「There's one thing that makes the difference — and it isn't the voice」は、ダッシュなしの同じ文よりも力強く響きます。1ページに1〜2箇所、その効果に見合う文だけで使いましょう。
内容は2〜4文のセグメントに分けましょう。 + Add Speaker で作る各セグメントは、わずかな呼吸とペースの変化を伴う、自然な語り口のリセットになります。スクリプト全体を1つのセグメントに貼り付けないでください。ブロックを短くすると、朗読ではなく会話のように聞こえます。
文と文の間に特定の間隔が必要なときは、句読点とポーズマーカーを組み合わせましょう。
数字は書き言葉で書き出す
Noiz AIは見た目の通りに読みます。「30%」は正しく読まれることもあれば、そうでないこともあります。「2026」は「two thousand twenty-six」になるか「twenty twenty-six」になるか分かりません。こうした表記のばらつきは、生成音声において実際の影響以上に耳障りになります。
「30 seconds」ではなく「thirty seconds」と書きましょう。「5 steps」ではなく「five steps」と書きましょう。書き言葉として書き出した数字は、Text-to-Speechできれいに生成されます。
略語は初出で展開しましょう。「Search Engine Optimization (SEO)」を初出で書き、以降は「SEO」を使います。同じ略語がプロジェクト全体で繰り返し出てくる場合は、Noiz AIのモデルが毎回同じように読んでいるか確認し、そうでなければ使うたびにフルスペルで書きましょう。
書き出す前にスクリプトをテストする
スクリプトを貼り付け、Voice Libraryにある1,000種類以上の声から1つを選んで、よく書かれたAIボイスオーバー用スクリプトがどれほど違いを生むかを聴いてみましょう。良い語り口が見つかったら、その音声設定をプリセットとして保存すれば、他のプロジェクトでも使い回せます。
本番全体を生成する前に、冒頭の段落だけでSpeak It の30秒テストを行いましょう。最初のブロックが硬く聞こえたら、直すべきは声ではなくスクリプトです。書き直してから再生成しましょう。