谁适合用 AI 声音克隆
想让所有内容保持统一品牌声音的视频创作者
需要覆盖多语言市场的多语言创作者
想搭建可复用配音工作流的播客和教育者
不想花钱租录音棚,直接把脚本变成配音的写作者和营销人员
打开 Voice Clone 开始声音克隆
登录 noiz.ai,打开左侧边栏。在 Playground 下点 Voice Clone。
上传或录制你的声音样本
Voice Clone 分三步:Add Voice → Preview → Save。你从第一步开始。
方式 A —— 上传文件。 把文件拖到上传面板,或点击浏览。Noiz AI 支持视频文件(MP4、MOV 等)和音频文件(MP3、WAV、M4A)。上传视频时会自动提取音轨。
方式 B —— 直接录制。 点击录音面板打开浏览器内录音器,自然说话至少 3 秒后停止。
关键:只能有一个说话人。 上传的片段里必须只有一个主要声音。多人对话——两位主持人的访谈、群聊——会得出混杂或不稳定的克隆结果。
尽量用耳机或外接麦克风。笔记本内置麦会收进风扇声和房间回音,直接影响克隆质量。
试听推荐片段,选择最佳样本
上传或录制完成后,Noiz AI 会分析音频,给你一个推荐片段——通常是人声最清晰的一段。你会看到片段名、起止时间和播放器。
先听一遍推荐片段。确认是自然清晰的人声,没有叠加音乐或明显的背景噪音。
如果推荐片段效果好,点 Next。如果长录音里有更好的段落——比如播客整期录音——点 Select manually 自己选时间段。
对于长音频,手动选一段说话人放松、清晰、有表现力的部分,通常比开头几秒的短片段做出更饱满的克隆。
试听克隆效果,确认后保存
到 Preview 步骤时,Noiz AI 会确认音色已经生成。你可以听样本,也能换文本再试。
用 Listen 听克隆效果,或用 Try another text 输入自己的句子测试。预览文本可以随意改。不满意就点 Back 换个片段或重新录。
试听不占用克隆名额——只有最后一步点 Save 时才算真的用掉一个克隆额度。
命名并保存你的克隆音色
给音色取个名字(必填)。可以补上语言、性别、年龄段——这些只是音色库里的过滤标签,不会限制音色本身怎么发音。
加上 Labels 帮你整理音色库——比如"开心系"、"社交视频"、"游戏与虚构角色"。Labels 是可搜索的组织标签,纯粹用来分类。
信息填好后点 Save。保存后你会看到确认页,可以选 Use this voice 直接进 Text-to-Speech,或 Clone another voice 继续克隆。
在 Text-to-Speech 里使用你的克隆音色
打开 Text-to-Speech,在 My Voices 下拉里选你保存的克隆音色——从 Voice Library 里找。
脚本语言不必和克隆样本一致。Noiz AI 支持 8 种语言生成:英语、中文、粤语、日语、韩语、法语、德语、西班牙语。
脚本较长时,用 + Add Speaker 把内容拆成段落。想要更有情感的表达就打开 Smart Emotion,复杂项目里进 Pro Editor 做精细控制。
完整脚本前先在 Text-to-Speech 里跑一句测试——克隆质量最容易在第一句显露出来。
录出更好的样本,克隆质量更稳
推荐做的:
用耳机或外接麦克风
在安静、回音少的房间录音
说话保持自然的情感——克隆会继承你的表达风格
使用只有一个主要说话人的片段
避免:
嘈杂环境里用笔记本内置麦
有背景音乐或多人重叠说话的片段
干瘪、单调的朗读——源文件里的情感会带进克隆
两人对话或群体录音
源片段里的能量会传给克隆。安静的录音得到平静的克隆;明亮直接的商业口吻会让模型更好地参考广告级的语气。