让人类与 AI 拥有完整的声音自由:Noiz 的「声音层」愿景

Noiz 想成为 AGI 技术栈里的「声音层」——负责听见、理解和回应,背后是实时推理、统一建模和声学记忆三条演进路线。

让人类与 AI 拥有完整的声音自由:Noiz 的「声音层」愿景 | Noiz

「让人类与 AI 拥有完整的声音自由。」

这是 Noiz 写在使命里的一句话。听起来宏大,背后却有一条很具体的演进线:从一个人复现语音克隆论文,到开源 MockingBird 被全球开发者使用,再到今天服务百万级创作者、开发者,并把音频理解、生成、编辑收进同一框架。

如果 AGI 是多层能力堆叠,Noiz 想占据的是其中一层:声音层。负责听见、理解、回应,连接内容创作、具身智能和 Agent 交互。

Contents

从一本书和 MockingBird 说起

创始人陈伟嘉成立Noiz的路径很个人化。玉符科技被收购后,他重新找方向;一本落灰的深度学习书把他带回语音。没有显卡、Python 也生疏,他还是从零复现了语音克隆,并做出中文版 MockingBird,在 GitHub 上获得大量关注。

Mockingbird 仓库如今指向 noiz.ai:开源社区是起点,产品是长期阵地。那段经历留下两件事:一是工程落地和论文之间的距离,二是有情绪、有表达力的声音值得单独做一家公司。

2024 年,团队锚定「深耕 AI 声音层」,Noiz AI 正式成型。域名 NOIZ 来自「噪声」,本是模型里的术语,后来成了团队符号。

产品的三次转向:生成、表达、创作

Noiz 的产品路线,经历三次成长,每一次都在探索怎样更好地满足用户的需求。

最早问的是:AI 能不能像人一样说话

克隆能发声之后,发现还不够:得能演,情绪、节奏、风格可控。

再往后:创作者要的是整轨生产,配音、配乐、音效、剪辑在同一工作室里完成。

三次转向可以概括为:

  1. 生成 → 把字读出来

  2. 可控与表达 → 像角色、像品牌、像那场戏

  3. 创作 → 完整 AI 音频工作台

清华 x-lab「校长杯」团队故事里提到:团队不再堆功能数量,而是专注一件事,表达是否成立。半年内全球注册用户破百万,ARR 接近 400 万美元,说明这条取舍有市场反馈。

「声音层」在技术地图上是什么

Noiz 公开谈及三条主线:

实时推理

互动剧、游戏、直播、Agent 对话,都需要低延迟音频。AudioX-Turbo 等 work 把多步扩散压到极少步数,4090 上生成 10 秒音频可到 0.2 秒量级,为「实时重建声音」打基础。

跨语音、音乐、音效的统一建模

声音在物理上是同一类现象。统一建模才能让人声、环境、配乐在同一项目里协调,也为「全维度听感」服务。

持久声学记忆

Agent 和具身系统需要记住「这个空间听起来什么样」「这个用户偏好什么音色」。声音层若只有无状态 TTS,撑不起长期交互;声学记忆是下一阶段的拼图。

Audio-Omni(理解、生成、编辑大一统)到 AudioX 系列(音视频联合生成),Noiz始终没有停下研究探索。只有研究向前推,产品才能把能力收进创作者点得动的界面。

听见、理解、回应

「声音层」可以拆成闭环:

  • 听见:识别内容、场景、情绪、声源

  • 理解:结合世界知识,知道这段音频在叙事里干什么

  • 回应:生成或编辑出下一段合适的声音

这和只做「文本进、音频出」的管道不同。管道解决产能;闭环解决交互与创作。陈前在访谈里判断:语音会是未来几年最先爆发的交互界面之一,硬件可常开、低功耗,复杂声场里的人声分离与情绪识别仍是蓝海。

Noiz 在 OpenClaw 等平台的 TTS Skill 装机量领先,侧面说明开发者已在把「会说话的 Agent」当标配;下一步是Agent 专属音频能力,从服务人扩展到服务机器与软件实体。

创作者今天能感知到什么

愿景落在产品上,是具体功能:

  • 文本转语音:中文短剧、漫剧、短视频配音,情绪控制、pause marker、音色预设保存

  • 音色设计:库里没有的声音,描述出来

  • 克隆:3~10 秒样本锁定角色

  • 音效与配乐:补齐环境与动作

  • API / Skills:嵌入工作流与 Agent

对个体创作者,声音层意味着不用进录音棚也能出专业音轨;对团队,意味着声线资产可复用、可本地化、可编程调用。

和「只做语音的创业公司」的差异

Voice AI 已是独立大赛道,头部公司估值达百亿美元量级。Noiz 的定位不是重复讲「更像真人」,而是在短内容情绪全维度声音模型与产品一体上加深:

  • 模型层:十几款音频模型,小版本可三天一更

  • 产品层:Studio 一站式,减少在剪辑软件和外站音效库之间来回跳

  • 生态层:开源论文、GitHub 项目、开发者 API

陈前提过「模应一体」:模型迭代牵引产品,真实反馈再拉回模型。音频有艺术属性,品牌和听觉审美会形成长期差异,即便底层能力趋同,工作流与场景理解仍可拉开距离。


从复现一篇论文,到百万用户每天导出音轨,Noiz 做的始终是一件事:让声音在 AI 世界里占有应有的层级。表达要有温度,场景要有质感,交互要听得懂、答得出。

「完整的声音自由」不是一句口号,是生成、表达、创作一路叠上去的结果。声音层补上了,画面、文字、动作才凑得齐同一片世界。

下一步:打开 Noiz AI 文本转语音,保存一套角色音色预设,当作你项目的第一份声线资产。

试试 Noiz AI 文本转语音 →

相关内容

Frequently Asked Questions

「声音自由」具体指什么?

创作侧:任意角色、情绪、环境都能表达;技术侧:生成、编辑、实时交互不受旧工具链限制;交互侧:人与 AI 用自然声音沟通。

Noiz AI 是什么?

Noiz AI 是面向创作者、品牌和开发者的 AI 声音创作工具,核心能力包括文本转语音、声音克隆、音色设计和音效生成,可用于短视频、播客、有声书、广告、教育内容、游戏角色和多语言本地化。

Noiz 的「声音层」和只用 TTS 有什么实际差别?

TTS 只解决「把字读出来」;声音层覆盖理解、生成、编辑全链路,支持环境声、配乐、实时交互和 Agent 集成,适合完整音频内容生产。

免费试用 Noiz