Eleven v3 行为规律 · v1
入档:2026-08-05 触发项目:《1000人后室大逃亡》配音工序,4 个角色音色定版 性质:v3 的路径选择与克隆行为实测。参数级的咬字/口水音调优见 TTS旁白也能蒙眼质检_ASR拼音级评分_v1,两篇不重叠。
一句话
有指定音色的角色走 IVC,只有文字描述的才走 Voice Design;这一步选错,后面调什么参数都救不回来。
1 · 三种音色来源,怎么选
| 路径 | 输入 | 适合 | v3 支持 |
|---|---|---|---|
| IVC(Instant Voice Clone) | 1–2 分钟干净人声 | 音色本身是内容:梗、指定的人、要被认出来的声音 | ✅ |
| Voice Design | 文字描述 → 3 个候选,seed 可复现 | 只有气质要求、没有指定音色 | ✅ |
| PVC(Professional) | 30 分钟以上录音训练 | 高保真复刻 | ❌ 不支持 v3 |
PVC 不支持 v3 但 IVC 支持——所以要克隆不必退回 v2,audio tags 和 Text to Dialogue 都保得住。这一条决定了整个路径:本项目锁定 v3、放弃 PVC。
⚠️ 官方对 PVC 的限制说明至今写着 “during this research preview stage”,而 v3 已在 2026-02-02 转正。措辞是旧的,限制是真的,投产前值得再查一次。
2 · 🔴 路径选错的代价(实测量级)
同一个角色、同一段参考音频,两条路径做出来的东西差多少:
| 基频中位 | 与原参考偏差 | |
|---|---|---|
| 原参考录音 | 184 Hz | — |
| IVC 克隆 | 180 Hz | −0.4 个半音 |
Voice Design(带 reference_audio,prompt_strength=0.65) | 130 Hz | 🔴 −6.0 个半音 |
差半个八度,是另一个人。 注意 Voice Design 那一版是带了参考音频的,仍然偏这么多——因为它的本质是”按描述生成一个神似的新声音”,参考音频只是底子之一。
判据见 指定对象与气质描述_生成路径分岔律_v1。
3 · IVC 素材要求(官方 + 实测)
官方原话:「audio quality is the most important aspect to consider when using instant voice cloning」。
- 单一说话人,不能混进第二个人(混了会得到一张谁都不像的平均脸)
- 无背景噪声或干扰
- 音量清晰、麦克风质量一致
- 1–2 分钟为宜;30 秒也可能够,超过 10 分钟反而会让克隆不稳
- v3 专属建议:素材要包含更宽的情绪范围,中性与夸张的都要有
💡 由此推出一条反直觉的操作:别为 IVC 做”精选”。本项目一开始挑了 5 处语气最贴角色的陈述句拼成 21.7s,反而不如直接用 75s 原片——精选恰好把情绪范围削窄了,与官方建议正好相反。
4 · remove_background_noise 什么时候开
POST /v1/voices/add 有 remove_background_noise 参数,走 ElevenLabs 的 audio isolation 模型。官方警告:素材本来不含背景噪声时,开了会让质量更差。
实测坐实了这条警告——三个角色、两个版本各做一遍再听感定版:
| 角色 | 素材底噪 | 选中版本 |
|---|---|---|
| 口播录音克隆 | −45 dB(偏高) | 降噪版 |
| 游戏语音克隆 ×2 | −60 dB(干净) | 都是原样版 |
所以底噪读数有明确的决策含义:语句间隙跌到 −50 dB 以下就别开,跌不下去才开。拿不准就两个版本都做——建 voice 不消耗字符额度,只占语音槽位(上限 30 个)。
5 · audio tags:中文台词能用,中文 tag 更稳
官方文档完全没有涉及跨语言使用 audio tags,而 v3 有一个已记录的失效模式:音色与要求的表演不匹配时,模型会把标签当普通文本念出来。真发生的话,成片里会出现角色一本正经念出 “laughs”,且要到剪辑时才发现。
实测:3 个音色 × 4 组(无 tag / 中文台词+英文 tag / 中文台词+中文 tag / 英文对照)= 12 次,零泄漏。
| 音色 | stability | [sighs] | [叹气] | A/B 时长差 |
|---|---|---|---|---|
| 口播克隆 | natural | 无叹气声 | 无叹气声 | −3.1% |
| 游戏语音克隆 | natural | 听得见叹气 | 听得见叹气 | +6.6% |
| 游戏语音克隆 | creative | 无叹气声 | 听得见叹气 | +24.5% |
三条可用结论:
- 安全性没问题,tag 不会被念出来,可以放心写
- 中文 tag 至少不比英文差:
[叹气]三个音色里两个生效,[sighs]只有一个。原来的假设「只能用英文 tag」被实测推翻 stability: creative让 tag 响应明显更强(+24.5% vs −3.1%/+6.6%),印证官方说的「audio tags 在 Creative 下响应最好」。需要靠 tag 演的段落可以临时切过去
⚠️ 但别假设 tag 一定生效——同一个 [sighs],在一个音色上是实打实一声叹气,在另一个上只有 −3.1% 时长的变化。关键情绪点仍要试听。
6 · API 踩坑
prompt_strength必须与reference_audio成对出现,单独传直接 400:You cannot provide 'prompt_strength' without 'reference_audio'- Voice Design 的永久
voice_id恰好等于generated_voice_id(POST /v1/text-to-voice用候选 ID 换永久音色后)。看起来像 bug,其实不是——去/v2/voices列表里能查到它,category 是generated - 成本极低:Voice Design 每次出 3 个候选、按预览文本收一次费。本项目 12 个候选 + 4 次克隆 + 3 轮 tag 探针 + 若干试听,总共 12,014 字符(v3 是 $0.10/1000 字符,alpha 期八折已于 2025-06 结束)
关联文档
- 指定对象与气质描述_生成路径分岔律_v1(本档第 2 节的判据来源,跨图像/声音通用)
- TTS旁白也能蒙眼质检_ASR拼音级评分_v1(同工具,管参数级咬字/声调质检;本档管路径选择与克隆)
- 2026-08-05_后室大逃亡配音工序_四音色定版复盘(本档的来源案例,含完整过程与踩坑)
- 自动化产出双重验收_机器验参数人眼验内容_v1(本档第 5 节的 tag 泄漏检测就是这条律的实例)
- Suno_v5.5_行为规律(同层:另一个音频工具的行为档案)