Audio-Omni:从「反复抽卡」到理解、生成、编辑一条链

Audio-Omni 把音频的理解、生成和编辑收进同一个框架,让创作者不用再靠反复抽卡来对结果。

Audio-Omni:从「反复抽卡」到理解、生成、编辑一条链 | Noiz

做过 AI 配音或音效的人,多半熟悉这套流程:输入提示词,生成一版,不对,再生成,还不对,继续抽。

图像领域已经走过这个阶段:从「碰运气出图」,到能指哪改哪的编辑工作流。音频还在前半段。理解、生成、编辑往往三个工具、三份导出文件、三次对时间轴。

Audio-Omni 想改的是这件事:在一个框架里完成「听懂 → 做出 → 改对」。这项 work 已被 SIGGRAPH 2026 接收,港科大、腾讯微信视觉、北大等团队参与;Noiz 算法负责人田泽越等为论文作者,Noiz 也将相关能力逐步工程化进产品。

Contents

创作者为什么需要「三位一体」

Noiz CEO 陈前在访谈里把真实生产链路说得很直白:

短视频、短剧、广告配音,往往不是「生成一段完事」。要先理解素材在说什么、情绪在哪;再生成对白或环境声;最后在时间轴上改一个词、去掉一层杂音、加一声撞击。

拆成三个模型,每一步都有损耗:理解模型不知道后面能不能改;生成模型不知道前面分析了什么;编辑模型又吃不到前面的上下文。创作者则在三个界面之间来回导文件。

Audio-Omni 的路径是统一框架:同一套系统里处理通用环境声、音乐和语音,并支持指令级编辑。

技术架构:两块协作怎么运转

论文里的结构可以概括成两块协作:

冻结的多模态大模型(MLLM)

负责「想」:理解音频内容、场景、说话人,还能调动世界知识。比如提示「齐柏林飞艇鼓手演奏的乐器」,模型能推理出架子鼓,再生成对应声音。这类能力单靠「文本配音频」的数据很难练出来。

可训练的扩散生成器(DiT)

负责「做」:把理解结果变成高保真音频。高层语义走交叉注意力注入;底层时序、音色、视频对齐走信号级拼接,方便对口型、对画面。

团队还构建了 AudioEdit 数据集:超过 100 万条指令编辑样本,用真实视频挖掘 + 程序化合成两条线,让「加一声、去一声、换风格」有数据可学。

一个有趣结论是:接 MLLM 时,倒数第二层特征往往比最后一层更适合音频合成。最后一层太偏向「预测下一个词」,声学细节容易被抹平;倒数第二层保留了更多可合成的信息。这对「大模型 + 音频生成」的拼接方式很有参考价值。

能做什么:九类生成 + 五类编辑

生成侧(节选)

  • 文生环境声、文生音乐

  • 视频配音、视频配乐

  • 文本转语音、零样本音色转换

  • 跨语言指令(中文、日语、法语等提示均可)

  • 知识增强生成、参考音频风格的上下文续写

编辑侧(节选)

  • 添加:在原环境音里加入滑板、狮吼等新元素

  • 移除:去掉歌声、飞机声等指定成分

  • 提取:从混合音里抽出救护车警笛等

  • 风格迁移:狗叫改成敲击声,保留节奏轮廓

  • 语音编辑:改几个词,音色尽量不变

对短剧团队来说,「改一句台词不用整段重录」直接省掉大量后期时间。对视频博主来说,「画面已定,补一条贴合的环境声」也更可预期。

和「一个大模型包打天下」有何不同

多模态大模型确实在融合视听,但音频有独立的物理维度:空间感、材质感、混响、节拍对齐,和像素不是同一套数据能糊在一起的。

Noiz 团队一直强调独立听觉引擎的长期价值:即便上层产品是一个入口,底层仍需要专门为声音训练、专门对齐声学规律。Audio-Omni 是引擎能力的一次集中亮相;Noiz 产品层则把它变成创作者点得动的功能,而不是论文 demo。

对 Noiz 用户意味着什么

短期看,你能在 Noiz 一站式 Studio 里感受到方向变化:

  • 生成对白时,系统更清楚「这段在什么场景」

  • 配乐、音效与语音在同一项目里协调,少跳转

  • 编辑能力上线后,「抽卡」次数会下降,「改到对」的步数会下降

长期看,Audio-Omni 代表音频从「生成工具」走向「创作系统」。图像已经证明,编辑能力一旦成熟,产能会再上一个量级。音频正在同一拐点上。

开源与延伸阅读

Noiz 同期还在推进 AudioX-Turbo 等方向,压缩多步扩散的推理步数,让实时交互场景更可落地。理解与编辑解决「对不对」,推理效率解决「能不能跟得上交互」。两条线最终都会在产品里汇合。


音频创作的下一段竞争,不只比谁更像真人,更比谁更懂素材、更少返工。Audio-Omni 把理解、生成、编辑收进同一框架,是在为这条链路搭底座。

想先感受统一音频工作流的方向,可以从 Noiz AI 文本转语音 入手,在同一项目里试对白与环境声的搭配。

试试 Noiz AI 文本转语音 →

相关内容

Frequently Asked Questions

Noiz AI 是什么?

Noiz AI 是面向创作者、品牌和开发者的 AI 声音创作工具,核心能力包括文本转语音、声音克隆、音色设计和音效生成,可用于短视频、播客、有声书、广告、教育内容、游戏角色和多语言本地化。

和只用 TTS 工具有什么区别?

TTS 解决「把字读出来」;Audio-Omni 覆盖环境声、音乐、语音的理解与编辑,适合完整音轨生产。

Noiz 在论文里的角色?

团队核心作者参与研发,并将研究能力转化为创作者可用的音频引擎与 Studio 功能。

免费试用 Noiz