Program-as-Weights:0.6B 小模型如何匹配 32B 大模型

编译时推理参数高效本地部署2026-07-06 · cs.LG / cs.CL

为什么重要。PAW 把 LLM 从"每次调用都要推理的求解器"重新定义为"按需编译 LoRA 适配器的工具制造机"——一旦某类任务被自然语言规范"编译"成几十 MB 的适配器,本地 0.6B 模型就能复现 32B 模型效果,内存缩减约 50×、MacBook M3 跑 30 tok/s。这意味着大量对延迟/成本/隐私敏感的"模糊函数"场景(日志告警、JSON 修复、意图排序)第一次有了"编译产物"形态的离线方案,开发者不再需要为每个小工具调一次云端 API。

核心论文解读

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

作者:Yuntian Deng(领衔,含完整的 PAW 团队)· 分类:cs.LG / cs.CL · 代码:随论文同步开源 FuzzyBench(10M 示例)

关键技术点

局限性

PAW 的真正信号不是"0.6B 干翻 32B",而是把模型调用从 I/O 接口 升级为 构建产物——一次编译、反复调用、纯本地。这与之前 LoRA 微调完全不同:LoRA 是再训练,PAW 是再生成,生成物是一个可分发、可版本化、可缓存的 LoRA 文件。

相关工作

Guiding Symbolic Solvers with Recurrent Reasoning Models (G-RRM)

方向:神经符号混合 · 作者:Timo Bert 等

SE-RRM(symbol-equivariant recurrent reasoning model)作为神经求解器给 SAT/Sudoku 求解器提供分支引导,在 9×9 Sudoku 上把 backtracking 加速 33.3×,Glucose 4.1 加速 1.70×。与 PAW 同属"小模型 + 外部引擎"路线,但 PAW 用小模型执行模糊函数,G-RRM 用小模型引导精确求解器。两者都验证了"用合适的工程组合替代堆参数"。

DramaSR-LRM: Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

方向:LRM + 多模态工具 · 作者:Zhilin Wang / Lingxi Xie 等 · 接收ICML 2026

DramaSR-LRM 让大推理模型自主聚合声纹/语言/视觉线索,完成 532K 对白行、900+ 角色的归属任务。代表"重推理 + 工具调用"路径——和 PAW 的"轻推理 + 编译产物"形成对比。两者一起读可以看到当前 LLM 应用的两极分化趋势。

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

方向:参数级 unlearning · 作者:Matteo Boglioni 等 · 基准:OLMo-1B / OLMo-7B

在 OLMo 系列上注入合成 PII 到预定义参数,用 gradient ascent 等方法 unlearning,发现现有 SOTA 在参数级精度严重不足、易被 resurfacing 攻击重新挖出。LACUNA 进一步揭示:只要 localization 做对,简单的梯度方法就能做到强擦除。这与 PAW 的"参数即程序"思路互为印证——既然参数可以被精准定位/编辑,把它当作可编译产物就是自然延伸。

技术坐标

方案模型规模运行时位置适用任务关键约束
直接 Prompt 32B32B云端 API通用开放任务延迟、成本、隐私
DramaSR-LRMLRM(未明示)云端 + 工具调用多模态归属/推理需要强推理链
G-RRMSE-RRM(小)本地 + SAT solver约束满足/逻辑题需要 symbolic 后端
PAW0.6B + LoRA 适配器纯本地模糊函数(日志/JSON/排序)任务需可被"规范"化

我的判断

PAW 不会替代通用 LLM,但会切走一大块"准 LLM 任务"。当一个任务能写成"输入 X,输出 Y,允许近似正确",且每天会被调用上千次,云端 32B 的成本/隐私/延迟就会反噬——这正是 PAW 的甜蜜区。判断落地节奏取决于三件事:① 编译器本身的开源质量和工具链成熟度;② FuzzyBench 覆盖的任务族多广;③ 是否有大厂(尤其端侧芯片厂)把它原生集成进端 SDK。
需要冷静看的三点。①"0.6B ≈ 32B"是在 FuzzyBench 这类特定任务上的等效,不是通用能力等价——别误读为"小模型全面碾压"。② 编译器 4B 的成本没透明披露,如果每次"编译"实际跑出 30 秒+,落地体验未必优于直接调 API。③ LoRA 适配器作为分发产物的版权/供应链治理是空白——分发方是否能看到原始规格书、是否能复现,工业场景会有合规风险。

对 JC 的可操作启示:

参考资料