参数行为档案

Eleven v3 行为规律 · v1

入档:2026-08-05 触发项目:《1000人后室大逃亡》配音工序,4 个角色音色定版 性质:v3 的路径选择与克隆行为实测。参数级的咬字/口水音调优见 TTS旁白也能蒙眼质检_ASR拼音级评分_v1,两篇不重叠。

一句话

有指定音色的角色走 IVC,只有文字描述的才走 Voice Design;这一步选错,后面调什么参数都救不回来。

1 · 三种音色来源,怎么选

路径输入适合v3 支持
IVC(Instant Voice Clone)1–2 分钟干净人声音色本身是内容:梗、指定的人、要被认出来的声音
Voice Design文字描述 → 3 个候选,seed 可复现只有气质要求、没有指定音色
PVC(Professional)30 分钟以上录音训练高保真复刻不支持 v3

PVC 不支持 v3 但 IVC 支持——所以要克隆不必退回 v2,audio tags 和 Text to Dialogue 都保得住。这一条决定了整个路径:本项目锁定 v3、放弃 PVC。

⚠️ 官方对 PVC 的限制说明至今写着 “during this research preview stage”,而 v3 已在 2026-02-02 转正。措辞是旧的,限制是真的,投产前值得再查一次。

2 · 🔴 路径选错的代价(实测量级)

同一个角色、同一段参考音频,两条路径做出来的东西差多少:

基频中位与原参考偏差
原参考录音184 Hz
IVC 克隆180 Hz−0.4 个半音
Voice Design(带 reference_audioprompt_strength=0.65130 Hz🔴 −6.0 个半音

差半个八度,是另一个人。 注意 Voice Design 那一版是带了参考音频的,仍然偏这么多——因为它的本质是”按描述生成一个神似的新声音”,参考音频只是底子之一。

判据见 指定对象与气质描述_生成路径分岔律_v1

3 · IVC 素材要求(官方 + 实测)

官方原话:「audio quality is the most important aspect to consider when using instant voice cloning」。

💡 由此推出一条反直觉的操作:别为 IVC 做”精选”。本项目一开始挑了 5 处语气最贴角色的陈述句拼成 21.7s,反而不如直接用 75s 原片——精选恰好把情绪范围削窄了,与官方建议正好相反。

4 · remove_background_noise 什么时候开

POST /v1/voices/addremove_background_noise 参数,走 ElevenLabs 的 audio isolation 模型。官方警告:素材本来不含背景噪声时,开了会让质量更差。

实测坐实了这条警告——三个角色、两个版本各做一遍再听感定版:

角色素材底噪选中版本
口播录音克隆−45 dB(偏高)降噪版
游戏语音克隆 ×2−60 dB(干净)都是原样版

所以底噪读数有明确的决策含义:语句间隙跌到 −50 dB 以下就别开,跌不下去才开。拿不准就两个版本都做——建 voice 不消耗字符额度,只占语音槽位(上限 30 个)。

5 · audio tags:中文台词能用,中文 tag 更稳

官方文档完全没有涉及跨语言使用 audio tags,而 v3 有一个已记录的失效模式:音色与要求的表演不匹配时,模型会把标签当普通文本念出来。真发生的话,成片里会出现角色一本正经念出 “laughs”,且要到剪辑时才发现。

实测:3 个音色 × 4 组(无 tag / 中文台词+英文 tag / 中文台词+中文 tag / 英文对照)= 12 次,零泄漏

音色stability[sighs][叹气]A/B 时长差
口播克隆natural无叹气声无叹气声−3.1%
游戏语音克隆natural听得见叹气听得见叹气+6.6%
游戏语音克隆creative无叹气声听得见叹气+24.5%

三条可用结论

  1. 安全性没问题,tag 不会被念出来,可以放心写
  2. 中文 tag 至少不比英文差[叹气] 三个音色里两个生效,[sighs] 只有一个。原来的假设「只能用英文 tag」被实测推翻
  3. stability: creative 让 tag 响应明显更强(+24.5% vs −3.1%/+6.6%),印证官方说的「audio tags 在 Creative 下响应最好」。需要靠 tag 演的段落可以临时切过去

⚠️ 但别假设 tag 一定生效——同一个 [sighs],在一个音色上是实打实一声叹气,在另一个上只有 −3.1% 时长的变化。关键情绪点仍要试听。

6 · API 踩坑

关联文档

类型/档案工具/ElevenLabs主题/TTS主题/语音克隆