自动化产出双重验收:机器验参数,人眼验内容 · v1
一句话律:自动化产出的素材,「文件存在且参数正确」和「内容正确」是两件独立的事——机器只能验前者,后者必须过人眼。
为什么这条容易被跳过
自动化跑完会给你一个绿色的”✓“。那个勾的含义是**“我按脚本做完了”,不是”结果是对的”**。
两者之间的落差,恰恰发生在最贵的地方:脚本执行了每一步,每一步都没报错,产物参数全对——但画面里什么都没有。
实证
Codex 教程实战六自动化录屏,19 段素材。4 条通过了机器校验但内容全错:
| 现象 | 机器看到的 | 实际内容 |
|---|---|---|
| 拖拽没生效 | 16.4s,参数正常 | 输入框根本是空的,附件压根没附上 |
| 播放器开到主屏 | 时长正常 | 录的那块屏上什么都没有,全黑 |
| 面板已展开 | 35.8s,参数正常 | 看不到”点击→展开”的动作,开头就是结果 |
| 全屏没生效 | 33.6s,参数正常 | 只是浮动窗口叠在别的应用上,四周露着侧栏 |
同一项目更早一次自动录制,产出 3 个 mp4,全部参数正常,最后被整体废弃(_作废_Claude自动录制/)。那次没有第二道关卡。
下一批(清单 2/3/4,三个项目 19 段)又拦下 2 条,都出在最后三段、流程最熟的时候:
| 现象 | 机器看到的 | 实际内容 |
|---|---|---|
| 上一条废弃 take 的残留在画面里 | 43.9s,参数正常 | 开头就是「你在 9s 后停止了」,同一句提示词出现两遍 |
| 提示词没发出去 | 34.9s,参数正常 | 快门按下时提示词还躺在输入框里、发送键在转圈 |
两批合计 6 条参数全对、内容全错。
第三批(操作部分 26 段):这次是整批
接手一批已录好的素材做重录,26 条 mp4 参数 100% 合格——1920×1080 / 60fps 全过,时长也正常。抽帧之后:
| 镜号 | 应该是什么 | 实际录到什么 |
|---|---|---|
| 318 / 321 / 322 / 323 | Codex 各种界面操作 | 全黑画面 |
| 319 | 左上角切换 GPT/Codex | 微信 + WorkBuddy |
| 324 / 326-331 | 做 PPT、许愿式提示词 | 全是 ChatGPT 定价页(上一条开的窗口没人收走,一直霸着录制屏) |
| 332-338 | 七段中文提示词逐条输入 | 输入框自始至终是空的(type_keys 走 VkKeyScanW,CJK 返回 -1 直接跳过,而调用方不检查返回值) |
| 339 / 340 | 滚动展示完整需求、发送 | 空会话,没东西可滚可发 |
如果只看 ffprobe,这 26 条是一批完美素材。
前两批是”19 条里拦下 4 条 / 2 条”,这批是整批 26 条参数全对、内容几乎全错。三批合计 32 条。
操作规则
- 两道关卡分开设
- 机器关:文件存在、时长在预期区间、分辨率/帧率/大小正常
- 人眼关:抽帧目视,至少看开头、中段、结尾
- 机器关过了不等于可以跳过人眼关——本条的全部价值就在这句
- 判废的产物不删,加
.FAILED后缀保留,便于事后追因(删了就查不出是哪一步断的) - 能在过程中当场校验的,不要等录完再验。例:拖放是最容易悄悄失败的一步,拖完立刻比对目标区域像素变化,低于阈值就当场判废,别把整条跑完
- 能写成断言的内容判据,就别只靠事后抽帧。“提示词到底发出去没有”完全可以机检(发送后按钮应转成停止态),加了这道当场断言之后,这类失败当场判废,不用等人看。人眼关是兜底,不是第一道防线——见 UI自动化的固定坐标必须绑前提断言_v1
- 长产物(>3min)标注”未完整终审”。抽帧只能证明某几帧对,证明不了中间没异常——不要把抽帧通过写成终审通过
- 给机器关补一条”内容非空”的粗判据。ffprobe 只看容器和流参数,画面全黑照样满分。第三批在 ffprobe 之后加了一道”抽一帧算纯黑像素占比 >55% 判废”,318/321/322/323 那种全黑片机器就能拦下,不用等人眼。粗判据挡不住”内容错”,但挡得住”内容无”,成本几乎为零——而”内容无”恰恰是自动化最常见的失败形态
- 接手别人录好的素材,先抽帧再信任。第三批的 26 条是带着”参数全部合格”的结论交接过来的,那个结论是真的,但它只覆盖参数层。交接结论要看清它验的是哪一层
- 机器关的第三道:内容指纹,把”内容错位”也纳入机器可拦范围(2026-08-14)。开录前抓一张参照帧,停录后取视频开头帧,同一条 ffmpeg 管线灰度比对——录到壁纸/录错屏/窗口没绘制的废片当场判废。至此机器关三道各拦一类:ffprobe 拦参数、黑屏占比拦”内容无”、指纹拦”内容错位”;人眼只剩”内容对不对”
- 判据阈值必须两端实测标定,直觉会差一个量级(2026-08-14)。内容指纹阈值凭直觉预设 45%(“完全不同的画面总得差一半”),实测:正常水位 1%,完全不同的两个白底页面(定价页 vs 对话页)灰度差只有 14.3%——45% 会把全部错位废片放行,这道防线等于没建。人眼看”完全不同”看的是语义,灰度比对看的是像素,白底页面 80% 的像素都是同样的白。正例反例各标定一次再定阈值(终值 8%),反例要选最难分的,不是最容易分的
边界
- 参数已知且固定的产物(如按已知时长播完一个视频文件),机器关的置信度较高;但窗口位置、全屏状态、焦点归属这些仍然只有眼睛能验。
- 本条不是”自动化不可靠”,而是”自动化的可靠性边界在参数层”。该自动化的照样自动化,只是别让绿勾替你签字。
- 🔴 补充(2026-08-05):机器关本身也会失效,而且失效时给的是”看着像真值的假数”。 原文假设的是「机器验参数是可靠的,只是不够」。实际还有一档更糟的情况——测量方法换了一类信号就崩,但仍然吐出一个数。 实例:基频测量在正常人声录音上完美区分了好坏方案(差 6.0 个半音 vs 0.4 个半音),搬到游戏战斗语音上,量出的基频众数堆在搜索区上限 380–400 Hz(占 14.9%,正常录音只占 0.6%)——对男声物理上不可能。若照单全收,会拿一个纯伪影去做定版决策。 三条自保:① 换一类信号先拿已知答案的样本标定;② 指标出现在搜索区边界上的堆积,几乎一定是伪影;③ 量出物理上不可能的值时,先怀疑测量、别怀疑素材。 详见 2026-08-05_后室大逃亡配音工序_四音色定版复盘 第三节。
同构案例
这条律在别的域有完全同构的版本:
- 素材审片:素材审片也能蒙眼_盲选靠标题定案靠眼睛_v1——文件名只配盲选,定案靠抽 3 帧读图
- TTS 质检:TTS旁白也能蒙眼质检_ASR拼音级评分_v1——机器量咬字声调,人只验收一次
三者共享同一个骨架:机器负责把候选压到可人审的规模,最终裁决权归人。
验证状态
⭐⭐⭐ 三次验证(铁律)· 四验加固
- 首验:本项目更早一次自动录制,3 个 mp4 参数正常但整体被废(无第二道关卡)
- 二验:实战六 19 段录制,第二道关卡拦下 4 条参数全对、内容全错的素材
- 三验:清单 2/3/4 三项目 19 段录制,又拦下 2 条;且这 2 条出现在流程最熟、最容易松手的收尾阶段
- 四验(最极端):操作部分 26 段重录,接手时那批参数 100% 合格、内容几乎 100% 错误。前三次是”在合格品里挑出坏的”,这次是”整批都是坏的,而机器一条都没拦下”
关联文档
- 2026-07-31_Codex教程实战六_自动化录屏19段复盘(本律的来源案例,含完整失败清单)
- 2026-08-01_Codex教程清单2-4_三项目19段录屏复盘(三验案例)
- 2026-08-13_Codex教程操作部分_26段重录复盘(四验案例:整批 26 条参数全对、内容全错)
- 2026-08-14_Codex教程录制链路打磨_复盘(机器关第三道”内容指纹”与阈值标定教训的来源)
- UI自动化的固定坐标必须绑前提断言_v1(一体两面:那条管事前断言,本条管事后验收)
- 素材审片也能蒙眼_盲选靠标题定案靠眼睛_v1(同构:素材域)
- TTS旁白也能蒙眼质检_ASR拼音级评分_v1(同构:TTS 域)
- 2026-08-05_后室大逃亡配音工序_四音色定版复盘(边界补充的来源:机器关本身失效、吐出伪影当真值)
- 蒙眼剪辑法_方法论笔记(母方法论:机器做量,人做裁决)
- 04_方法论与洞察索引