LLM 的「统计自一致性」裂缝 —— 推理期聚合失真的发现

评测方法LLM统计推理 · 2026-07-17 ArXiv 速读

为什么重要:2026-07-17 ArXiv 上线了一篇用全概率定律评测 frontier LLM 的新工作,发现了一个此前未被命名的失败模式 —— macro fallacy:模型从子群体细粒度回答重构出的估计,反而比直接询问群体的估计更接近人类参考数据。这个发现把"参考数据稀缺时的 LLM 评测"从经验主义变成了有数学骨架的可量化问题,是评测方法论级别的贡献。

一句话核心:LLM 知道子群体的统计,但不会自动把子群体知识正确聚合到群体层级 —— 这道裂缝是 reference-free 的(无需人工标注即可暴露),可以作为新一代 LLM 评测基线。

核心论文解读

① Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

② Pretraining Data Can Be Poisoned through Computational Propaganda

两个工作的内在关联

主题串联:2607.15277 暴露的是 LLM 推理期的可靠性裂缝 —— 模型内部的统计知识存在,但不能正确聚合。2607.15267 暴露的是 LLM 训练期的可靠性裂缝 —— 训练数据本身可以被 web-scale 攻击污染。两条裂缝指向同一个底层问题:当前 LLM 的可靠性缺乏端到端的数学/概率骨架支撑。

把这两篇并排读很有价值:

相关工作与延伸方向

方向代表工作 / 现象与今日两篇的关系
Reference-free 评测 Self-Consistency(Wang et al.)、SelfCheckGPT 2607.15277 是这条线的新成员,但加了数学骨架(全概率定律),比纯采样一致性更严谨
训练数据投毒 Backdoor Attacks、DataPoisoning 系列 2607.15267 把战场从"数据集"拉到"web"
人口统计偏差 Bias Benchmark for QA(BBQ)、StereoSet 2607.15277 的 macro fallacy 在群体偏差方向有天然联系
Web 清洗管线 CommonCrawl 的 dedup / quality filter 2607.15267 提出的投毒向量对现有清洗管线是挑战

我的判断

对 JC 的价值
注意

结论:今天最有意思的不是某个单一突破,而是"LLM 可靠性"作为一个研究主题正在从经验性的 benchmark 转向数学骨架 + 攻击向量双线推进。2607.15277 和 2607.15267 同日上线不是巧合 —— 这是社区共识的窗口期。