Voice AI 是硅谷 VC 公开承认「集体踏空」的赛道之一。
Noiz 团队在这条路上走了更久:MockingBird 开源、百万级用户、ARR 接近 400 万美元。下面十条,是我们认为最值得创作者、投资人和同行记住的观点。
Contents
团队基因:算法和声学审美必须同框
Noiz 近 30 人,以 00 后为主,清华、北大人才占近半数。创始人陈伟嘉曾任 Meta 早期 ASR 工程师,后联合创办玉符科技并被腾讯收购,曾在 TikTok 深耕 Agent 方向;CEO 陈前有近 20 年音乐行业经历,曾任北大中国音乐学社指挥;算法负责人田泽越为港科大博士,AudioX、Audio-Omni 等顶会论文第一作者。
陈前在访谈提到:语音模型不仅需要算法,也需要听觉审美与艺术感知。 团队里不少工程师是校园十佳歌手、独立乐队创作者。公司文化拒绝纯机械式工作狂——你得先热爱生活,才对声音的情绪、质感、韵律有天然感知力。
它解释了为什么用户反复提到 Noiz 的「审美感」:产品不是把论文指标翻译成按钮,而是把听起来对不对放在第一位。
不要音频盲盒,要闭环生产力
行业还在「抽卡阶段」:反复生成、碰运气、效率低。图像 AI 已经走到可精准编辑的成熟期;音频必然走向理解 → 生成 → 编辑三位一体。
Noiz 的产品层目标是 Studio:用户不用跳转三个工具,在同一套流程里完成生成、剪辑、配乐、多语言本地化。模型层已推出十几款全栈音频模型,小版本最快三天一更。Audio-Omni 被 SIGGRAPH 2026 接收,就是把这条「不要盲盒」路线写进论文里。
听觉引擎必须独立存在
多模态大模型能把音视频打包输出,但陈前坚持:光波和机械波在物理上是两种东西。 图像引擎和音频引擎底层逻辑天生分开。视觉世界模型没有声音数据,生成不了符合物理逻辑的撞击声;空间听觉、360° 声场、远近衰减,也没法靠视觉数据练出来。
独立的音频模型和听觉引擎,是长期刚需。轻量化融合模型成本低,但撑不起专业创作和空间音频。
短内容是结构性变量,不是功能清单
ElevenLabs 更专精长内容:音色稳定、电影质感。Noiz 押注的另一极是短剧、短视频:5 秒留人、高密度节奏、强情绪张力。这不是在菜单里加一个「短剧模式」,而是要从模型层重新训练:
数据层:大量引入短视频、短剧、电商原生语料
效果层:60 分到 95 分全覆盖,配合编辑能力修正瑕疵
情绪层:强化喜怒哀乐、戏剧张力,适配爽感与感染力
国内 40 万短视频、漫剧创作者的选择,验证了这条路径有真实需求。
匹配度比清晰度更重要
影视配音要棚录纯净音质;电商配音却不能追求过度清晰——适度环境噪才写实。用户要的不只是「听得清」,而是配对的质量:声音和场景、平台和情绪是否同频。
这条判断直接影响产品 defaults。同一套引擎,服务解说和服务的短剧对峙戏,参数逻辑应该不同。
模应一体是主动战略,不是无奈之举
语音模型厂商普遍采用模型层 + 产品层双轨。对 Noiz 而言,这是主动选择:模型迭代直接对齐真实用户场景,产品反馈反向指导研发,形成高信噪比飞轮。模型进步推着应用进化,应用数据推着模型优化——两条腿走路,不是等生态成熟再补产品。
底层可以商品化,审美永远私有化
语音会不会像文本模型一样商品化?团队判断:趋势在,但艺术属性决定了上限。 和音乐一样,语音无法变成标准化标品。品牌、听觉审美、场景化能力、工具链、生态,会形成长期差异化。短视频、影视、硬件交互等细分赛道,都会诞生专属音频方案。
赛道仍处正和博弈,渗透率还不到 10%
Lightspeed 称 ElevenLabs 在创作者群体占有率约 60%。陈前的反驳角度不是正面硬刚份额,而是看大盘:AI 语音工具在创作者群体的渗透率还不到 10%。 ElevenLabs 单季度 ARR 净增 1 亿美元,说明市场在变大,不是零和。
Noiz 的全球用户已破百万,ARR 接近 400 万美元,正式设立半年左右完成 seed、seed+ 融资,投资方包括北极光创投、英诺天使基金。数字说明赛道还在早期扩容,不是存量厮杀。
高质量语料是长期壁垒
Noiz把高质量语料放在第一位:合规获取之外,筛选与场景匹配能力是核心。架构很重要,但顶级人才在场时,架构本身很难成为永久壁垒。
短期三件事:工程化、短内容、下一代引擎
Noiz短期内有三个短期重心:
Audio-Omni 工程化落地,走向商用
深耕短内容场景,巩固差异化
研发下一代 AI 音频引擎,覆盖游戏、虚拟空间、具身与硬件听觉交互
如果你做短剧、漫剧或高密度短视频,这些判断里最容易立刻用的是两条:匹配度大于清晰度,以及情绪张力比电影感更重要。打开 Noiz 文本转语音,用同一段对峙台词,分别试「解说腔」和「戏剧腔」,你会听到团队把资源押在了哪里。