《1000人后室大逃亡》S45–S48 收尾段 · 运镜与跨镜一致性返工复盘(2026-08-08)
项目仓库:
E:\backrooms-1000(规范原件在production/README.md第十/第十一条, prompt 原文在production/prompts/,交付包在delivery/S45-S48_送审_20260808/) 范围:S45a / S45b-1 / S45b-2 / S45c / S46a / S46b / S47a / S47b / S48a / S48b 共 10 个镜号。 S1–S10 与 S11–S16 由其他协作者负责,不在本文范围。
事实记录(不可修改区)
- 执行:2026-08-08 傍晚,两轮,2 个提交(
2dad6d1、a2e00a0) - 背景:这一段原本无人认领修复(用户原话:「S45及以后是空缺的」,后澄清「空缺是指没有人负责修复」)
- 目标:
- 第一轮 —— 回应斯塔的第三轮总结意见第 2 条:「机位无变换,无运镜拍摄手法,没有特效。几乎无法传达出任何情绪或镜头语言。」
- 第二轮 —— 处理斯塔当天打回的三条,外加新增结构要求「S45 应衔接新版 S44」
- 生成次数:14 次(S47b×1 · S47a×2 · S45a×2 · S46b×1 · S48a×1 · S45b-1×3 · S45b-2×1 · S48b×3)
- 结果:
- 第一轮 6 条全部交付;斯塔当天打回 3 项(S48b 铭牌乱码、S48b 台词读音、S45b-2 人物崩坏)
- 第二轮全部返工完成并于当晚送审,🔴 评审结果未知
- 本复盘写于评审前。任何「修好了」的说法都只代表本机自测结论,不代表过审。
- 唯一由评审确认的正向结论:无(第一轮的运镜方向未被否定,但也未被确认)
- 积分:会话内观察到 14438 → 7876,但该账号由三人共用,观察窗口内有 217 分是他人消耗, 本次实际消耗无法干净测量,不要引用这个差值。
- 数据来源:
- 「无运镜」意见、三条打回、「语调不自然」、「S45 应衔接 S44」= 斯塔/用户反馈
- 字高 6px/16px、切点检测、CFR/VFR、脸部年龄感对照 = 本机自测(PIL / ffprobe /
tools/detect-cuts.py) - 🔴 音频正确性完全无法自测(我听不了音频),读音对错与语调自然度全部依赖用户耳朵
作品回顾
创作思路
斯塔的意见是全片级总结,不针对某镜。我把它翻译成一条可执行判据: 清点这 10 镜的机位,把「固定机位」的挑出来,逐条设计匀速运镜。 清点结果:8 条固定、2 条已有运镜(S46a 穿越机、S48b 推近)。
同时立了一条自我约束:不替斯塔做剪辑结构决定。 S45c 与 S45b-2 的存废、S46b/S48a 的左右排布,只给判断依据不拍板。
执行过程
| 轮次 | 动作 | 结果 |
|---|---|---|
| 一 | S47b 加匀速垂直升起 | ✅ 一次过,本批最好 |
| 一 | S47a 加贴地推轨 | v2 推太近读成集装箱 → v3 加「还要看得见什么」后对 |
| 一 | S45a / S46b / S48a 加缓推 | 三条全部切边(切头顶/切肩) |
| 二 | S48b 铭牌乱码 | 量出字高 → 改空白板,一次过 |
| 二 | S45b-2 人物崩坏 | 定位到缺角色资产图 → 补挂即修好 |
| 二 | S45 接新版 S44 | S45a 用 S44 的走廊帧、S45b-1 用 S44 的尾帧 |
| 二 | S45b-1 追逐方向 | v4 几何自相矛盾 → v5 单写【空间关系】后对 |
| 二 | S48b 台词读音 | 原生三版各坏一处 → 改走 Eleven 定版音色 |
结果分析
有效的(本机自测层面)
| 动作 | 证据 |
|---|---|
| 全景/大远景加匀速运镜 | S47b 起手贴金币堆看不出规模 → 升起后整个广场被埋,量感这次给出来了 |
| 显式幅度上限句 | S45a v3 切头顶 → v4 加「宁可推得很少也不要切头顶」后五条不变量全成立 |
| 补挂角色资产图 | S45b-1 单变量重出,狂奔尖叫的正脸立刻回到资产图那张年轻的脸 |
| 先写【空间关系】再写动作 | S45b-1 v5 一次对,且天然接上下一镜的后退跟拍 |
| 字高不够就做成空白板 | S48b 画面乱码清零,且 logo 反而更干净 |
我自己造成的返工(5 项,占 14 次生成的相当比例)
这一节比上一节更有价值。
- 🔴 把「读成绷匠箱」理解成画面上的字,去量了铭牌像素高度,按第六条改成空白板。 画面确实修好了,但斯塔说的是配音——整个轴错了。中文「读成」两义都通,我没问。
- S45b-1 v4 的 prompt 自相矛盾:改了他的奔跑方向,却留着旧版「怪物从画面深处涌出」, 变成他朝怪物来的方向跑。
- S48b v5 读音修过头:为纠正一个声母,加了「一字一顿、语速放慢、词间停顿」, 字对了但语调僵成机械朗读,被打回。
- 交付包里留了未修的 S45b-2 没做标记,用户当成已修版审了一遍,白看。
- 先断言 S45c 与 S45b-2「结构性重复」,看帧后发现是两个不同空间,自行推翻。
共同点:1、2、3、5 都是「没先看/没先问就下判断」。4 是交付卫生问题。
一个必须记住的负面结果
S48b 为修读音跑了三版,没有一版同时满足:
| 版本 | 台词 | 画面 |
|---|---|---|
| v4 | ❌ 「工具箱」念成「绷具箱」 | ✅ |
| v5 | ✅ 字对 | ⚠️ 语调僵硬 |
| v6 | ? | ❌ 背景人群退化成扁平卡通矢量小人 |
v6 只改了读音要求那一段,画面却跟着崩了。最终按项目规范把台词交给 Eleven v3
(定版 JiMZ7UhCO95g7SzxDMni),画面用 v4。
方法论沉淀
构图不变量锁得住位置,锁不住幅度 ⭐⭐
核心:写「主体在画框哪个位置」能生效,但不约束镜头推进的量;模型会一路推到主体填满画框, 位置关系全对、景别全丢。
来源:S45a v3 / S46b v3 / S48a v3 用同一套不变量话术,三条全部切边; 而 S16 / S47a v3 / S47b 同样话术全部成立。分界线是起手景别。
验证状态:⭐⭐ 二次验证。 ⚠️ 三条失败虽同时发生,但同批次、同一天、同一模型,不算独立样本,所以不升格铁律。 修复句(显式幅度上限)只验证过一次(S45a v4),单独算 ⚠️ 初次发现。
操作规则:
- 不变量除了写「主体在哪」,必须写「全程还要看得见什么」,且列到边缘物件。
- 给幅度一个显式上限,并明说宁可推少:「如果再推这条就要破了,就在破之前停下。」
- 近景/中近景起手的推镜,1、2 两条必写;全景起手时第 1 条通常自动满足。
反例/边界:全景起手的环绕、升起、缓推按老写法就够,不必加上限句。 另外近景推镜的收益本身就小——这一轮运镜带来的提升几乎全在全景那几条, 近景对白镜保持固定机位不是缺陷。
改运动方向,要把所有引用旧几何的句子一起改 ⚠️
核心:prompt 里的空间关系是一张网,不是一串独立句子。改了主体的运动方向, 「谁在谁身后」「摄影机在哪一侧」「威胁从哪来」全都要重算。
来源:S45b-1 v4 把动作从「往前冲」改成「转身朝画面深处冲刺」, 却留着「怪物从大厅深处涌出」——生成结果里谁追谁看不出来。
验证状态:⚠️ 初次发现(1 次失败 + 1 次修复)。
操作规则:涉及追逐、进出画、正反打的镜头,**先单写一段【空间关系】**把 摄影机/主体/威胁三者的相对位置钉死,再写动作。 S45b-1 v5 的四句:「摄影机在他正前方 · 怪物全部在他身后 · 他朝摄影机跑 · 摄影机随他后退」。
附带收益:几何写死之后,它和下一镜(后退跟拍)自然接上了,省掉一次接缝返工。
尾帧接力管不住小尺度下的面部重建 ⭐⭐
核心:靠上一镜的尾帧传角色,在主体变小、且在运动的镜头里会一步崩掉, 不是渐进漂移。尾帧管空间/光线/服装/姿态的连续性,管不住脸。
来源:S44b 尾帧是一张完美的 GenJi 大特写(脸高约 250px), S45b-1 却直接把他做成了脸颊凹陷、法令纹极深、方下颌的中年人(看着 35+)。 这两镜的 prompt 只挂了尾帧和怪物图,没挂角色资产图。
验证状态:⭐⭐ 二次验证。 2 次失败观察(S45b-1 v2 / S45b-2 v2)+ 3 次修复验证(S45b-1 v3、v5,S45b-2 v3); 且与同日另一起独立事故同源——S12 返工时漏挂打印机资产图, prompt 写着「米白色家用喷墨打印机」,出来是一台大型办公复印机。 两起不同资产、不同镜头,同一个根因:返工时丢了参考图。
操作规则:
- 🔴 凡有锚点角色出镜,角色资产图一律挂上,不管上一镜尾帧多清楚。
- 同时用文字把脸写死(文字赢过参考图):年龄段、脸型、脸颊、下颌线、法令纹有无、眉形、发量。
- 用一句反例封住漂移方向:「不要做成三十五岁以上、脸颊凹陷、法令纹很深、方下颌的中年男人。」
- 补一句动态约束:「他在奔跑/大喊/侧身躲闪/离镜头变远的时候,也必须还是同一张脸。」
反例/边界:背影镜、剪影镜、脸小于几十像素且不入焦的镜头不受此限。
评审意见说「读成 X」,先问清是画面上的字还是声音 ⚠️
核心:中文「读成」两义都通。问一句的成本远低于按错的轴返工一轮。
来源:斯塔原话「工匠箱被读成了绷匠箱」,我按画面文字查了一整轮, 他说的是配音把「工具箱」念成「绷具箱」。
验证状态:⚠️ 初次发现。
操作规则:凡评审意见里出现「读成/念成/写成/显示成」这类动词, 先确认是视觉层还是听觉层。 ⚠️ 这条对「听不了音频」的协作者尤其重要——声音类意见只能靠评审的耳朵,更要问准。
读音修正只该动目标音素,不要连语速语气一起指挥 ⚠️
核心:为修一个字的声母,顺手加了「一字一顿、语速放慢、词间加停顿」, 字对了但表演一起被改掉了。
来源:S48b v5,被斯塔判「修的过火了,语调不自然」。
验证状态:⚠️ 初次发现。
操作规则:只描述目标音素(「『工』的声母是 g,不是 b」), 并显式把其余交回自然口语(「语气语速断句全部按正常说话来,不要一字一顿、不要刻意放慢」)。
更根本的落地:配音本来就该走 Eleven v3,视频模型自带音轨只是占位。 在视频模型里反复调 TTS 是走错了层——S48b 三版原生尝试没有一版同时满足, 最终仍是 Eleven 解决的。
改 prompt 一段,可能引起完全无关的另一段退化 ⚠️
核心:S48b v6 只改了读音要求那一段,背景人群从写实退化成扁平卡通矢量小人。
验证状态:⚠️ 初次发现,但代价明确。
操作规则:改动 prompt 后不要只验你改的那一处, 把上一版已经通过的项目也逐条复检一遍再交。
附:字高判据再获一组数据点(强化既有规则)
S48b v3 的铭牌实测:英文 FLOVA COORONATOR 字高 6px(占画幅高 0.83%)、
中文「六边形能力增强工具箱」16px(2.22%)。两者都低于「≤20px 一律后期叠加」的下限,
所以必崩,与 prompt 怎么写无关。
⚠️ 这一镜还有一个结构性死局:它的运镜是「推到 logo 占满画面」, 等字够大的时候铭牌已经被推出画外——不存在「又在画内又够大」的窗口。 遇到这种镜头不要反复试,直接做成空白板 + 后期叠字。
下次改进
如果重来,最想改哪一步: 在动手之前先问清「读成」是字还是音。那一个问句能省掉一整轮返工, 也不会让斯塔在第二轮里又看到同一个问题。
下次同类型任务的行动清单:
- 接手一段之前先清点机位,把固定机位的挑出来——这一步这次做对了,保留。
- 返工前先拉出上一版实际挂过的参考图清单,新集合必须是超集。 角色图是最容易漏、漏掉代价最大的一张。
- 评审意见里的动词有歧义就先问,尤其视觉/听觉之分。
- 近景推镜要么写幅度上限,要么就别加运镜。运镜预算优先给全景。
- 追逐/进出画的镜头先单写【空间关系】。
- 改一处后全项复检,不要只验改动点。
- 交付包里不许留未修的旧文件不做标记——这次让用户白审了一遍。
- 配音问题直接走 Eleven,不要在视频模型里调 TTS。
关联文档
- 2026-08-05_后室大逃亡配音工序_四音色定版复盘 —— 同项目,Eleven v3 四音色定版的来路
- 图生视频_ForwardOnly原则
- Eleven_v3_行为规律_v1
- Seedance2_5_行为规律_v1
- Flova_平台档案_编排层不是模型层_v1 —— 本次全程走 Flova,平台侧的能力边界
- 2026-08-08_后室大逃亡S43长镜头_归因未遂与生死线次序复盘_v1 —— 同项目、同日的另一段(S43 长镜)复盘,讲归因与决策次序