《1000人后室大逃亡》配音工序 · 四音色定版复盘(2026-08-05)
项目仓库:
E:\backrooms-1000(复盘原件在docs/阶段性报告/2026-08-05-配音工序复盘.md) 范围:GenJi + 猛攻哥A/B/C 四个角色。主持人与学生A–E 由其他协作者产出,不在本文范围。
事实记录
- 执行:2026-08-05,11:01–15:09,9 个提交
- 目标:把斯塔写在 xlsx「音色参考」列的需求,落成可直接生成台词的 Eleven v3 音色
- 结果:
- 4 个角色全部定版并过审
- tag 探针通过:3 音色 × 4 组 = 12 次,零泄漏
- 第一版方案全部作废,12 个候选里只有 1 个幸存
- 消耗:字符额度 12,014 / 265,950(4.5%),语音槽位 27/30
- 数据来源:定版决定与”完全错误”的判断 = 用户听感反馈;基频/底噪/tag 泄漏 = 本机自测;素材要求 = ElevenLabs 官方文档;干员设定 = 萌娘百科 + 官方心理评估 + B 站评论区
时间线
| 时间 | 动作 | 结果 |
|---|---|---|
| 11:01 | 同步 xlsx,发现「音色参考」列从未进过仓库 | 找回 10 个角色的配音需求 |
| 11:25 | 出方案:四个角色全走 Voice Design | 后被推翻 |
| 11:32 | 查干员资料,重写描述(补上蜂医的北京腔) | 功课有效,方向仍错 |
| 11:46 | 生成 12 个候选 + 加客观测量 | 修掉一个测量伪影 |
| 12:42 | 试听:“完全错误” → 推翻路径改走 IVC | 9 个候选作废 |
| 14:12 | GenJi 定版;威龙/蜂医素材验收通过 | 底噪 −60 dB,转录确认单一说话人 |
| 14:40 | 四个全定版;tag 探针跑通 | 12 组零泄漏 |
| 15:09 | 收口,同组成员的参考归档 | 发现两边并行做了同一件事 |
一、路径错了,功课救不回来
判断:Voice Design 是主路径,IVC 是备胎「必须还原某个特定真人时才用」。
为什么错:斯塔写【三角洲行动威龙的声音】不是气质描述,是指定一个观众要认出来的东西。完整规律见 指定对象与气质描述_生成路径分岔律_v1。
代价:12 个候选作废 9 个,与原参考差 6 个半音。改走 IVC 后 0.4 个半音。
这次最该记住的细节:11:32 那一步,我查了两个干员的官方心理评估、萌娘百科、B 站语音合集的上千条评论,挖出了「蜂医中配是北京腔、儿化音遍地」这种真正有用的特征,把描述改得很扎实。功课做得越足,越掩盖路径本身的错误——因为它让人觉得”我已经很认真了”。
功课是在已选定的路径内优化,不能替你验证路径。
二、幸存的那一个不能证明路径对
猛攻哥A 是 12 个候选里唯一通过审核的。但它幸存不是因为 Voice Design 路径对,而是因为它恰好是四个角色里唯一没有指定音色的(需求只写了【充满力量感,爽朗的肌肉男声音】)。
路径与需求属性匹配才是原因。 把”我的方案里有一个成功了”写成”我的方案有效”,是复盘里最容易犯的归因错误。
三、客观指标救了一次,也失效了一次
救的那次:基频偏差在 GenJi 上完美区分好坏方案——Voice Design −6.0 半音 vs IVC −0.4 半音,一眼看出不是调参数的量级。
失效那次:同一把尺子搬到游戏语音上直接崩了。原素材量出的基频众数堆在搜索区上限 380–400 Hz(占 14.9%/16.0%),而正常录音只占 0.6%。
- ❌ 先怀疑是无线电滤波(战术语音常见的高通处理会削掉基频)——被低频能量数据否掉:威龙 −6.5 dB、蜂医 −8.5 dB,正常录音 −5.3 dB,只差 1–3 dB
- ✅ 更可能是战斗喊话本身:人喊叫时基频大幅升高,而玩家对这两个干员的普遍观感正是「全面战场的语音全是喊的」
处置:明说失效,不硬给一个数让人拿去做决定。那两个角色纯靠耳朵定版。
教训:一个测量方法在 A 场景好用,不代表在 B 场景成立。换场景先拿已知答案的样本标定。 指标出现在搜索区边界上的堆积,几乎一定是伪影而非真值;量出物理上不可能的值(男声众数 380 Hz)时,先怀疑测量、别怀疑素材。
四、两个工具 bug,同一个病根
① 静默跳过 = 谎报”没问题”(当天在两处独立出现)
- 资产同步脚本的「缺主图」判据是”任意列有图就不报”,漏报了主图格是文字的两个资产
- 音色分析脚本的
measure()取不到基频就返回None,调用方直接continue,三个候选被静默跳过
② 边界情况会伪装成正常值
--check-ivc 的底噪判据被片头空白骗过——参考音频在 −50 dB 下检出 3 段静音,全在开头 0.11–1.74s 之内,1.85s 之后整整 73 秒一段都没有。差点把底噪偏高的录音判成”干净”,进而漏掉降噪。
修法:排除首尾各 2 秒,只认中间的语句间隙。检测”某事件是否存在”时,要看检出的位置是否合理,不能只看有没有。
五、「参考」和「成品音色」是两件事
收口时才发现,同组成员并行做了三个 4–5 秒的音频参考,两边完全不知情。合并后量下来,三个角色的基频差 5–17 个半音。
| 是什么 | 该长什么样 | |
|---|---|---|
| 音色参考 | 组内对齐”这角色什么声音”的参照物 | 几秒样本就够 |
| 成品音色 | 能直接生成台词的 voice_id | 走 IVC/Voice Design,要定版归档 |
本次把「参考」直接做成了「成品」,跳过了中间对齐这一步。成品迟早要做所以工作不算废,但顺序错了。
更根本的一点是用户指出的:威龙/蜂医的官方游戏语音本身就是参考,何必先克隆一版再当参考用。 拿到”参考”类需求,先问一句「现成的有没有」。
六、做对的部分
- tag 探针跑了 3 个音色而不是 1 个。因为官方说失效模式与音色相关,只测一个就外推是不成立的。12 组零泄漏的结论因此才站得住
- 能自动判读的就自动判读:tag 有没有被念出来,用 ASR 转录检测即可,不必靠耳朵。人耳留给机器分不出的部分(“叹了口气”和”假装叹了口气”)
- 拿不准就两个版本都做再比:降噪/不降噪各做一版,建 voice 不花字符额度,只占槽位。三个角色的定版结果反过来验证了官方那句”素材本来干净时降噪会更差”
- 落选的全部保留:复盘时把 Voice Design 候选和 IVC 结果放一起听,能直接听出路径错在哪,比看那张差 6 个半音的表更直观
如果重来
11:25 出方案之前,先花 10 分钟做两件事:
- 问一句「同组有没有人在做这个」
- 对每个角色问一句「这个声音要不要被观众认出来」
任何一个先问了,都能避免 9 个候选作废 + 两边重复劳动。
关联文档
- 指定对象与气质描述_生成路径分岔律_v1(本案例提炼出的一句话律,⭐⭐)
- Eleven_v3_行为规律_v1(本案例沉淀的工具档案:路径选择、IVC 素材、tag 实测)
- TTS旁白也能蒙眼质检_ASR拼音级评分_v1(同工具的参数级质检;本案例的 tag 泄漏检测是同一思路的新应用)
- 自动化产出双重验收_机器验参数人眼验内容_v1(第三节”指标失效”是对这条铁律的边界补充)
- 交付前实测证伪律_v1(同族:看起来合理的判断要拿实测证伪)
- 04_方法论与洞察索引
- 2026-08-08_后室大逃亡S45-S48_运镜与跨镜一致性返工复盘 —— 同项目后续;本文定版的 GenJi 音色在那一轮被用来救 S48b 的台词