方法论与洞察

压缩保留簇,丢弃孤例 · v1

入档:2026-08-05 触发:微博爆款帖「AI 公司买绝版书→切书脊→扫描→销毁原件」查证 + 凯文·凯利《作为新媒介的潜空间》(2026-07-14) 对读 性质:AI 行为机制 → 创作定位的认知级反思(外部事件查证 + 外部理论批读) 验证状态:⚠️ 首次(跨三案例推演成型:Monnem design 载重词 ✅ / 马嘉祺低频退化 ✅ / 孤本不可重建 = 推论未实测) ❌ 已证伪一个应用方向:本律不能用来判断一门学科 / 职业的存亡(2026-08-05 被古典文献学专业者当场否掉,详见「边界」第一条) 定位:把库里三条散落的观察统一到同一个变量上——冷门风格词的压缩律_v1低频退化与频率定律、本篇


一句话

决定一样东西在模型里命运的,不是它”冷门还是大众”,而是它在训练数据里的「簇密度」=样本量 × 簇内同质度。 压缩靠的是共性,所以它保留簇、丢弃孤例——推到极端:一个东西之所以珍贵是因为它和世上任何别的东西都不冗余,而”不冗余”正是压缩第一个丢掉的属性。


反直觉点:一个必须先解开的矛盾

库里已有 冷门风格词的压缩律_v1:冷门专有名词(Monnem design指纹又窄又利、一调就准,因为它”在训练集里只对应一小撮高度同质的高质量图”。

本篇却说:独异的东西在压缩中损失得最彻底。

两句话表面直接打架。解开它,才有本律——变量根本不是”冷门 ↔ 大众”这一根轴,而是「簇」。

簇形态样本量 n簇内同质度在模型里的命运创作上怎么用
大众词
cinematic portrait photography
极大极低(什么都有)语义被均摊、风格被拉平出图泛,堆词也难出彩——别指望它给风格
冷门载重词
Monnem design
中等(数百~数千)极高指纹又窄又利最佳杠杆区,一个词锁一整套美学(冷门风格词的压缩律_v1
低频实体
小众人名 / 冷门型号
知识在、表达通道退化补词典兜底(低频退化与频率定律
孤例
孤本 / 孤证 / n=1
1无簇压不进去,也无法从邻近重建模型结构性到不了——不可替代性就在这里

冷门词好用,不是因为它冷门,是因为它「小而密」:样本少但高度同质,于是簇心锐利、不和别的簇混。孤本是 n=1,根本没有簇——没有任何冗余可以借力重建。

所以这条轴是倒 U 型,不是线性:中间那段(小而密)是甜区,两端(大而散 / 无簇)都拿不到东西。


案例底料一 · 事实核查:Project Panama

2026-07 一条微博刷屏(1.5 万赞):AI 公司买绝版书、液压切刀切书脊、高速扫描、原书粉碎。查证结论:比传闻更真,但最戳人的一句仍未证实。

已由解封法庭文件与《华盛顿邮报》(2026-01-27) 坐实:

未被证实的部分(Snopes 评级「大体属实,但存在未确定成分」):

衍生的反常激励(观察成立,机制要说准):法律不是”奖励销毁”,它执行的是一次购买 = 一份副本;但结果上,销毁原件确实是让 fair use 抗辩变干净的最省事路径。


案例底料二 · KK《潜空间》:压缩完整论是销毁的意识形态前提

凯文·凯利在《作为新媒介的潜空间》里写:

“这张微小的卡片容纳了人类集体所知的一大部分。” “然后,它丢弃了书本、文本和图像,只保留这个由方向和向量组成的复杂网络。”

在 KK 那里第二句是比喻。Project Panama 把它做成了字面意思。

而第一句正是销毁行为的意识形态前提:如果压缩是完整的,原件就是冗余的。

反证就藏在 KK 自己的解释里:他说压缩之所以可能,是因为”大多数事物与其他事物共享许多共同属性”(猫狗共享毛皮/耳朵/尾巴)。重叠越多 → 压缩率越高。反推一步就是:重叠越少 → 损失越彻底。

于是”我们已经扫描过了,信息还在”这句话——恰恰在最需要它成立的那一类东西上最不成立。量产畅销书被销毁,信息损失≈0(与万本别的书高度重叠);只剩三本的地方志被销毁,损失的正是模型压不进去的那一部分,因为没有任何”邻近的箭头”可用来重建它。


如何使用(创作侧)

  1. 找载重风格词时,判据补一条:不只问”够不够冷门”,要问”这个词背后是不是一小撮高度同质的图”。冷门但簇内杂乱 = 无效冷门,出图照样飘。(补丁给 冷门风格词的压缩律_v1 的步骤 3)
  2. 想让自己的风格被认出、被调用 → 造簇,别做孤例。 一张惊艳的孤图不会成为风格;一组同质的作品才会。这正是 生成时代作品作者版权重定义 说的”形式本体 / 被命名 / 被调用”在压缩层面的机制解释——被命名的前提是你先有一个足够密的簇。
  3. 反过来用:不可替代性 = 无簇性。 判断”AI 会不会吃掉某件事”,问它的价值来自簇还是来自孤例——来自簇的迟早被压进去,来自孤例的结构性到不了。(呼应 真实摄影手段作为AI时代的稀缺性
    • 仅限用于具体素材 / 具体工序,不能用于整门学科或职业。理由见「边界」第一条——这是本律唯一已被证伪的用法,而且是作者本人踩的。
  4. 判断”信息还在吗”:先问这东西的冗余度。高冗余 → 数字副本基本等价;n=1 → 副本只留下可编码的那一层,只存在于物本身的信息随原件一起走

方法论层 · KK 这篇的读法(把隐喻当机制的典型)

伪机制解释识别_四层拆解法_v1 四层裁决:

KK 的说法裁决
现象潜空间可作为一种新的创造力媒介;跨域类比、留白发现、复古潜空间✅ 立得住,且”复古潜空间”(老模型 failure mode 变风格资产)已在发生
机制”数万亿参数意味着数万亿个方向”。方向在激活空间(d_model 量级,几千~几万),参数是权重,两者不是一回事;更接近真相的是 superposition(叠加):在有限维里塞进远多于维数的特征,代价是互相干扰
根因因为潜空间连续,所以能轻松跨域连接🟡 半对。连续是真的,但邻近性是语义/统计邻近,不是因果结构邻近——跨域类比只产候选,验证仍须回领域内做
药方在提示里”把它推向更猫的方向”混同。prompt 是语言条件化(不可加、不可逆、不正交);真正沿向量移动是 activation steering。在 MJ 里加权重 / 挂 --sref 属于前者,抱着”我在推坐标”的心理模型会让调参失败时归错因

读 KK 的正确姿势:当词典,不当说明书。 他的强项是造可命名的概念(“潜空间渗透者""留白发现”),弱项是把隐喻当机制。


边界 / 存疑


关联文档

外部来源


版本

升级触发:

类型/协作工具链主题/AI理论来源/外部报道