Voice AIは、シリコンバレーのVCが公に「集団で見誤った」と認めている分野の一つだ。
Noizチームはこの道をより長く歩んできた。MockingBirdのオープンソース化、数百万人規模のユーザー、ARRは400万ドル近くに達している。以下の十項目は、クリエイター、投資家、同業者にとって最も記憶に留める価値があると私たちが考える視点だ。
目次
チームのDNA:アルゴリズムと聴覚的な美意識が同じ場所にある
Noizは約30人で、Z世代が中心。清華大学と北京大学出身者が半数近くを占める。創業者の陳偉嘉(Chen Weijia)は元Metaの初期ASRエンジニアで、その後玉符科技を共同創業し(後にテンセントに買収)、TikTokでもエージェント方向の開発に深く関わってきた。CEOの陳前(Chen Qian)は音楽業界に約20年携わり、北京大学中国音楽学社の指揮者を務めた経験もある。アルゴリズム責任者の田泽越(Zeyue Tian)は香港科技大学の博士であり、AudioX、Audio-Omniなどのトップカンファレンス論文の第一著者だ。
陳前はインタビューでこう語っている。音声モデルにはアルゴリズムだけでなく、聴覚的な美意識と芸術的な感性も必要だ。 チームには学内の歌唱コンテスト優勝者やインディーバンドの作曲経験者も多い。企業文化としては、純粋な機械的なワーカホリックを拒否している。まず生活そのものを愛していなければ、音の感情、質感、韻律に対する自然な感受性は育たないという考え方だ。
これはユーザーがNoizの「美意識」について繰り返し言及する理由を説明している。プロダクトは論文の指標をボタンに翻訳したものではなく、聴いた時にちゃんと合っているかを第一に置いている。
音声のガチャではなく、閉じたループの生産性を
業界はまだ「ガチャの段階」にいる。何度も生成しては運任せで、効率が低い。画像AIはすでに精密に編集できる成熟段階に進んでいる。音声も必然的に理解→生成→編集の三位一体へと向かっていく。
Noizのプロダクト層の目標はStudioだ。ユーザーは三つのツールを行き来する必要がなく、生成、編集、BGM付け、多言語ローカライズを一つの流れの中で完結できる。モデル層はすでに十数種類のフルスタックオーディオモデルをリリースしており、マイナーバージョンは最短3日おきに更新されている。Audio-OmniがSIGGRAPH 2026に採択されたことは、まさにこの「ガチャをやめる」という路線を論文という形で示したものだ。
聴覚エンジンは独立して存在しなければならない
マルチモーダルな大規模モデルは音声と映像をまとめて出力できるが、陳前は次の点を譲らない。光波と機械波は物理的に別のものだ。 画像エンジンと音声エンジンは、そもそもアーキテクチャのレベルで分かれている。視覚世界モデルには音声データがなく、物理法則に合った衝突音は生成できない。空間的な聴覚、360度の音場、距離による減衰なども、視覚データから学習することはできない。
独立した音声モデルと聴覚エンジンは、長期的に本当に必要とされるものだ。軽量な融合モデルはコストが低いが、専門的な創作や空間オーディオを支えることはできない。
短尺コンテンツは機能の一覧ではなく構造的な変数だ
ElevenLabsは長尺コンテンツにさらに特化しており、音色の安定性と映画的な質感を強みとする。Noizが賭けているもう一つの極は短編ドラマと短尺動画だ。5秒で視聴者を引き込み、高密度なリズムと強い感情の張りが求められる。これはメニューに「短編ドラマモード」を一つ追加するようなことではなく、モデル層から再訓練する必要がある。
データ層:短尺動画、短編ドラマ、EC向けのネイティブなコーパスを大量に取り込む
出力層:60点から95点までを全てカバーし、編集機能で瑕疵を補正する
感情層:喜怒哀楽の表現とドラマティックな張りを強化し、爽快感と感染力に合わせる
国内の40万人の短尺動画・漫画動画クリエイターの選択が、この路線に実際のニーズがあることを裏付けている。
マッチ度は明瞭さより重要だ
映画やドラマの吹き替えはスタジオ録音のようなクリーンな音質が求められる。一方でECの配音は、過度な明瞭さを追求すべきではない。適度な環境ノイズがあった方がリアルに聞こえる。ユーザーが求めているのは単に「よく聞こえるか」ではなく、マッチの質だ。声とシーン、プラットフォーム、感情が同じ波長にあるかどうかが問われる。
この判断はプロダクトのデフォルト設定に直接影響する。同じエンジンでも、解説動画向けと短編ドラマの対決シーン向けでは、パラメータのロジックが異なるべきだ。
モデルと製品の一体化は主体的な戦略であり、やむを得ない選択ではない
音声モデルベンダーの多くは、モデル層と製品層のデュアルトラックを採用している。Noizにとって、これは主体的な選択だ。モデルの改良は実際のユーザーシーンに直接合わせて進められ、製品からのフィードバックが逆に研究開発の方向を導く。これにより、高いシグナル対ノイズ比のフライホイールが形成される。モデルの進歩がアプリケーションの進化を後押しし、アプリケーションのデータがモデルの最適化を後押しする——エコシステムが成熟するのを待って製品を後から補うのではなく、両足で同時に歩む考え方だ。
基盤はコモディティ化できるが、美意識は永遠に私有化される
音声はテキストモデルのようにコモディティ化するのか。チームの見立てはこうだ。トレンドとしてはその方向にあるが、芸術的な属性が上限を決める。 音楽と同じように、音声を完全に標準化された商品にすることはできない。ブランド、聴覚的な美意識、シーンに応じた対応力、ツールチェーン、エコシステムが長期的な差別化を生む。短尺動画、映像作品、ハードウェアインタラクションなど、それぞれの細分領域には専用の音声ソリューションが生まれていくはずだ。
この領域はまだ正のサムゲームで、浸透率は10%にも届いていない
Lightspeedは、クリエイター層におけるElevenLabsの占有率を約60%と見積もっている。陳前の反論は、シェアで正面から対抗することではなく、市場全体を見ることにある。クリエイター層におけるAI音声ツールの浸透率はまだ10%にも届いていない。 ElevenLabsが単一四半期でARRを1億ドル増やしたという事実は、市場が拡大していること、つまりゼロサムではないことを示している。
Noizのグローバルユーザーはすでに100万人を超え、ARRは400万ドル近くに達している。正式に法人化してから半年ほどでシード、シードプラスの資金調達を完了し、投資家には北極光創投(Northern Light Venture Capital)やInnoangel Fundなどが含まれる。この数字は、この領域がまだ初期の拡大フェーズにあり、既存のパイを奪い合う段階ではないことを示している。
高品質なコーパスは長期的な壁になる
Noizは高品質なコーパスを最優先に置いている。合法的な取得は前提として、シーンに合わせて選別する能力こそが核心だ。アーキテクチャは重要だが、優秀な人材が揃っている場合、アーキテクチャ自体が永久的な壁になることは難しい。
短期の三つの重点:エンジニアリング、短尺コンテンツ、次世代エンジン
Noizは短期的に三つの重点を置いている。
Audio-Omniのエンジニアリング実装を進め、商用化へ
短尺コンテンツのシーンをさらに深耕し、差別化を固める
次世代AI音声エンジンの開発——ゲーム、バーチャル空間、身体性を持つデバイスやハードウェアの聴覚インタラクションをカバーする
短編ドラマ、漫画動画、高密度な短尺動画を作っているなら、この十項目の中で最も今すぐ使えるのは次の二つだ。マッチ度は明瞭さより重要、そして感情の張りは映画的な質感より重要。Noiz テキスト読み上げを開いて、同じ対決シーンのセリフを「解説調」と「ドラマ調」の両方で試してみれば、チームがどこにリソースを賭けているかが聞き取れるはずだ。