「人間とAIに完全な声の自由を。」
これはNoizのミッションに書かれている一文だ。大きな言葉に聞こえるが、その裏には非常に具体的な進化の道筋がある。一人で音声クローンの論文を再現したところから、中国語版MockingBirdをオープンソース化して世界中の開発者に使われるようになり、そして今では数百万人規模のクリエイターと開発者にサービスを提供し、音声の理解・生成・編集を一つのフレームワークに収めるところまで来た。
AGIを多層の能力の積み重ねだとすれば、Noizが担いたいのはそのうちの一層——声音層だ。聴き取り、理解し、応答する役割を担い、コンテンツ創作、身体性を持つAI、エージェントとのインタラクションをつなぐ。
目次
一冊の本とMockingBirdから始まった
創業者の陳偉嘉(Chen Weijia)がNoizを立ち上げるまでの道のりは、非常に個人的なものだった。玉符科技が買収された後、彼は新たな方向を探していた。ある埃をかぶったディープラーニングの本が、彼を再び音声の世界へと引き戻した。GPUもなく、Pythonの腕もすでに鈍っていたにもかかわらず、彼はゼロから音声クローンを再現し、中国語版MockingBirdを作り上げ、GitHub上で大きな注目を集めた。
MockingBirdのリポジトリは、今ではnoiz.aiを指している。オープンソースコミュニティは出発点であり、プロダクトこそが長期的な戦場だ。その経験は二つのことを残した。一つは、エンジニアリングとしての実装と論文との間にある距離。もう一つは、感情があり表現力のある声には、それだけで一つの会社を作る価値があるということだ。
2024年、チームは「AIの声音層を深く掘る」ことを定め、Noiz AIが正式に形になった。NOIZという名前は「ノイズ」から来ている。もともとはモデル内部の用語だったが、後にチームのシンボルになった。
プロダクトの三度の転換:生成、表現、創作
Noizのプロダクトの方向性は三度の成長を経ており、そのたびに「ユーザーの本当の需要をどう満たすか」を問い直してきた。
最初に問われたのは、AIは人間のように話せるのか、という問いだった。
クローンによって声が出せるようになると、それだけでは足りないことが分かった。演じられる必要があり、感情、リズム、スタイルが制御可能でなければならない。
さらにその先で、クリエイターが本当に求めているのは、吹き替え、BGM、音効、編集を同じスタジオの中で完結できる、トラック全体の制作だと分かった。
三度の転換は次のようにまとめられる。
生成 → 文字を声にする
制御と表現 → キャラクターらしく、ブランドらしく、そのシーンらしく聞こえる
創作 → 完全なAI音声ワークステーション
清華大学x-lab「校長杯」チームのストーリーにあるように、チームは機能の数を積み上げるのをやめ、一つのことに集中した。表現が本当に成立しているかだ。半年でグローバルの登録ユーザーが100万人を超え、ARRは400万ドル近くに達した。この取捨選択に市場からの反応があったことを示している。
技術地図における「声音層」とは何か
Noizは公に三つの主要な路線について語っている。
リアルタイム推論
インタラクティブドラマ、ゲーム、生配信、エージェントとの対話——どれも低遅延な音声が必要だ。AudioX-Turboなどの研究は、多段階の拡散処理を極めて少ないステップ数まで圧縮し、RTX 4090上で10秒の音声を約0.2秒で生成できるレベルに達している。これは「声をリアルタイムで再構築する」ための基盤になる。
音声・音楽・音効を横断した統一建模
音は物理的には同じ現象だ。統一されたモデリングによってこそ、人の声、環境音、BGMが同じプロジェクトの中で協調でき、「全方位の聴感」にも役立つ。
持続的な聴覚記憶
エージェントや身体性を持つシステムは、「この空間はどんな響きか」「このユーザーはどんな音色を好むか」を記憶する必要がある。状態を持たないTTSだけの声音層では、長期的なインタラクションを支えることはできない。聴覚記憶は次の段階に必要なパズルの一片だ。
理解・生成・編集を統合するAudio-Omniから、音声と映像を同時に生成するAudioXシリーズまで、Noizの研究は止まることなく前進してきた。研究が前に進んでこそ、プロダクトはその能力をクリエイターが実際にクリックできるインターフェースへと落とし込める。
聴き取り、理解し、応答する
「声音層」は次のような閉じたループに分解できる。
聴き取る:内容、シーン、感情、音源を認識する
理解する:世界知識と結びつけ、この音声が物語の中で何を担っているかを把握する
応答する:次にふさわしい音声を生成または編集する
これは「テキストが入って音声が出る」だけのパイプラインとは違う。パイプラインは生産量の課題を解決する。閉じたループはインタラクションと創作の課題を解決する。陳前はインタビューで、音声は今後数年で最初に爆発するインターフェースの一つになると判断している。ハードウェアは常時稼働・低電力にできるし、複雑な音場での話者分離や感情認識は依然として手つかずの領域だからだ。
OpenClawなどのプラットフォームでNoizのTTS Skillのインストール数が先行しているという事実は、開発者が「話せるエージェント」をすでに標準機能として捉えていることを裏付けている。次のステップはエージェント専用のオーディオ機能であり、人間へのサービスから機械やソフトウェアという実体へのサービスへと拡張していくことだ。
クリエイターが今日感じられること
このビジョンは、プロダクト上では具体的な機能として表れている。
テキスト読み上げ:中国語の短編ドラマ、漫画動画、短尺動画の吹き替え、感情制御、ポーズマーカー、音色プリセットの保存
音声デザイン:ライブラリにない声を、言葉で描写する
クローン:3〜10秒のサンプルでキャラクターの声を固定する
音効とBGM:環境音とアクション音を補う
API / Skills:ワークフローやエージェントに組み込む
個人のクリエイターにとって、声音層とは、録音スタジオに行かなくてもプロ品質の音声トラックを作れることを意味する。チームにとっては、声の資産を再利用でき、ローカライズでき、プログラムから呼び出せることを意味する。
「音声だけのスタートアップ」との違い
Voice AIはすでに独立した大きな領域になっており、大手企業の評価額は数百億ドル規模に達している。Noizの立ち位置は、「より人間らしく聞こえる」という話を繰り返すことではなく、短尺コンテンツの感情、全方位サウンド、モデルと製品の一体化をさらに深めることにある。
モデル層:十数種類の音声モデル、マイナーバージョンは最短3日おきに更新
プロダクト層:一体型のStudioで、編集ソフトと外部の音効ライブラリの間を行き来する手間を減らす
エコシステム層:オープンソースの論文、GitHubプロジェクト、開発者向けAPI
陳前は「モデルと製品の一体化」についてこう語っている。モデルの進化がプロダクトを引き上げ、現実のフィードバックがそれをモデルへと引き戻す。音声には芸術的な側面があり、ブランドと聴覚的な美意識は長期的な差別化を生み続ける。基盤となる能力が似通ってきたとしても、ワークフローとシーン理解は依然として競合との距離を広げられる要素だ。
一本の論文を再現することから、数百万人のユーザーが毎日音声トラックを書き出すところまで、Noizがやってきたことはずっと一つだ。AIの世界の中で、声にふさわしい位置を持たせること。表現には温度が必要で、シーンには質感が必要で、インタラクションには聴き取れて答えられることが必要だ。
「完全な声の自由」はスローガンではなく、生成、表現、創作を積み重ねてきた結果だ。声音層が補われることで、映像、文字、動作がようやく同じ世界としてつながる。
次の一歩:Noiz AIのテキスト読み上げを開いて、キャラクターの音色プリセットを一つ保存し、あなたのプロジェクトにおける最初の声の資産にしてみてほしい。