打开 Text-to-Speech 选音色
打开 Text-to-Speech 编辑器
从 Noiz 侧边栏 Product 分组下点 Text-to-Speech。工作区分成两块:
左侧面板 —— 输入脚本、管理说话人
右侧面板(Settings) —— 挑音色、模型和生成选项
选一个音色
右侧面板会显示当前选中的音色、最近用过的音色,以及 Clone Your Voice 和 Design New Voice 的快捷入口。
点任一音色即可选中。每个音色卡片显示支持的语言以及年龄段、性别、语气或用途的标签。想浏览完整库,从侧边栏 Playground 下打开 Voice Library,按语言、性别、用途等筛选。
选择 AI 模型
音色设置下面选模型。Noiz 目前提供 Emotion Engine-v2,为自然表现力和情感细节优化过。选定模型在整段会话都生效。
在编辑器里写脚本
单人说话
在主文本框里输入或粘贴脚本。每个分段支持最多 1000 个字符,字符计数显示在面板底部。
多人说话
要做对话或多人旁白:
在当前分段下方点 + Add Speaker。
会出现一个新分段块,带独立的说话人标签和文本框。
用说话人下拉给每个分段选不同的音色。
每换一个说话人或者场景就重复一次。
不同角色用不同音色,让对白式内容更有辨识度也更好跟。
情感标签(部分音色支持)
部分音色支持情感标签,用来引导单句的语气。标签放在句子最开头:
[happy]: 你知道吗?第一次,一切都刚刚好。
标签放在句中或句尾不会生效。也可以用面板底部的预设提示按钮——Emotion Boost、Sad Monologue、E-commerce Promo、Excited Life Blogger——直接套现成的示例脚本。
停顿标记和音色预设
用 pause 停顿标记 控制换气点和句间节奏。找到项目适用的音色、语速和表达设置后,保存成命名音色预设,以后的会话就能从同一份配置起步。
点 Speak It 生成音频
脚本和设置都好了,点 Speak It。Noiz 会自动生成两版音频。
两版都听一下,挑更适合你内容的那版——它们在语速、重音或情感表达上可能不同。每版都有独立的播放和下载按钮。
如果两版都不满意,再点一次 Speak It。不同生成之间的细微差异是有意为之——模型加入自然的随机性,让输出更像真人。
预览并下载音频
工作区底部有一条常驻播放条,显示当前进度、拖拽条、频谱图,以及好评/差评评分按钮。
满意后点 Download 保存音频文件。导出为高质量音频格式,兼容主流剪辑软件,包括 Premiere、DaVinci Resolve、GarageBand。
提升生成效果的实操建议
清晰。 句子写短。短句、标点到位的句子生成出来更干净、更自然。
节奏。 有意识地用标点。句号、逗号在生成音频里会形成自然停顿。要精确到某个节拍,把标点和停顿标记搭配用。
先试听。 下载前一定先听,确认语气和节奏符合预期。
语言。 非英文脚本,选一个明确训练过对应语言的音色,不要只依赖多语言标签。
存好脚本。 编辑器不会跨会话自动保存。脚本记得存到外部文本文件或文档里。
先把开场段落粘进去点 Speak It,两版都听一下,再生成完整脚本。