为什么重要:当前 LLM 应用的主流模式是"per-input API call"——每次推理都打一次远程模型,既贵又不可重现还把数据送出门。2026 年 7 月初 ArXiv 上两篇论文分别从两个不同角度给出破局方案:PAW 把 LLM 重新定义为"工具制造者(tool builder)"而非"问题求解者",用一次编译产出可离线复用的本地神经网络程序;RECONTEXT 则不训练任何模型,仅靠推理时的证据重放就能在 128K 上下文上稳定提升小模型表现。两篇合在一起,勾勒出"小模型 + 推理时增强"的清晰工程化路径。
论文:Program-as-Weights: A Programming Paradigm for Fuzzy Functions
作者:Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng(University of Waterloo / Cornell / Harvard)
资源:GitHub · 在线 Demo · FuzzyBench 10M 数据集
问题动机:现代代码库里充斥着 gpt("extract answer", text) 这种"用 LLM API 当函数"的反模式。痛点有四:
核心范式:三步编译流水线
| 阶段 | 执行者 | 产出 |
|---|---|---|
| 1. 规约 | 开发者用自然语言描述函数 | 自然语言伪程序 |
| 2. 编译 | 4B Qwen3 LoRA Compiler(训练后) | LoRA 适配器(~23MB) |
| 3. 执行 | 0.6B Qwen3 解释器(冻结不变) | 本地推理结果 |
关键洞察是"双半结构":每个 PAW 程序同时含一个自然语言伪程序(离散,处理歧义)+ 一个 LoRA 适配器(连续,提供细粒度行为控制)。前者屏蔽用户输入的拼写错误和模糊性,后者补足文字无法表达的行为细节。
性能数据(论文报告):
| 指标 | PAW (0.6B + LoRA) | 直推 Qwen3-32B |
|---|---|---|
| FuzzyBench 准确率 | 73.78% exact match | 68.70% exact match |
| 推理内存 | ~430MB GGUF 共享 + 23MB LoRA | ~20GB(~50×) |
| 推理速度(M3 MacBook) | 30 tokens/s | 本地无法运行 |
| ToolCall-15 得分 | 93% | — |
FuzzyBench 数据集规模:10M 样本,29 个主题版本,覆盖 800+ 类任务(分类、格式转换、解析、模糊匹配、NL 命令、agent 工具调用、创意生成)。这是目前公开最大的"模糊函数"数据集,且任务类型贴近真实开发场景。
5 个真实应用验证:
多模态扩展:仅替换 compiler 为 VLM,interpreter 不变,PAW 即可处理图像条件模糊任务。架构解耦做得很干净。
关键限制:
论文:Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
作者:Yanjun Zhao 等
资源:GitHub: ReContext
问题动机:LLM 上下文窗口从 32K → 128K → 1M 不断膨胀,但论文指出一个关键 gap:"context access ≠ context utilization"——模型能看到相关信息 ≠ 能用好这些信息。具体表现为:在 128K 长上下文里,模型经常忽略已经出现在输入中的关键证据。
RECONTEXT 核心机制(三步训练免费流程):
| 步骤 | 动作 | 产出 |
|---|---|---|
| 1. 检索 | 用模型内部相关性信号(attention scores) | query-conditioned 证据池 |
| 2. 组织 | 递归选择 evidence,构造 evidence pool | 压缩后的精炼证据 |
| 3. 重放 | 把 evidence pool 在最终生成前重放给模型 | 最终答案 |
关键设计:
理论框架:联想记忆(Associative Memory)
论文给出了一个干净的理论映射:
| 认知科学概念 | RECONTEXT 实现 |
|---|---|
| 上下文 = 记忆存储(memory store) | 完整的 128K 输入 |
| 问题 = 检索线索(retrieval cue) | query |
| Attention = 线索-痕迹关联 | 内部 attention score |
| Replay = 痕迹再激活 | evidence pool 重放 |
这个映射的价值在于它把"为什么 ReCONTEXT 能 work"从工程黑盒升级到了可解释的认知模型——重放不是新点子,但在长上下文里它被赋予了清晰的理论定位。
实验结果:
| 基座模型 | RECONTEXT 平均排名 | 数据集 |
|---|---|---|
| Qwen3-4B | 最佳平均排名 | 8 个长上下文基准 |
| Qwen3-8B | 最佳平均排名 | 8 个长上下文基准 |
| Llama3-8B | 最佳平均排名 | 8 个长上下文基准 |
三个不同规模的基座模型都取得最佳平均排名——方法可迁移性已经被验证,不是某个特定模型的特化技巧。
关键限制:
把这两篇论文放在更大的方法论谱系里看,2026 年上半年的趋势越来越清晰:
| 方向 | 代表 | 核心思想 |
|---|---|---|
| 训练时增强 | 常规 SFT/RLHF | 把能力烧进参数 |
| 训练时增强(参数高效) | LoRA / Prefix tuning | 少参数多任务 |
| 推理时增强(PAW 路径) | PAW / Toolformer | 训练一次,重复使用,永久离线 |
| 推理时增强(无训练) | RECONTEXT / CoT / ToT | 不更新参数,只换推理策略 |
| 上下文工程 | Prompt cache / Skill files | 结构化提示模板 |
PAW 走的是"训练时 LoRA + 推理时专用解释器"的混合路线,本质上是把"训练成本"和"推理成本"做了时间分离——训练一次性、推理无限次且免费。这是软件工程里"编译一次,运行无数次"的标准范式,被 PAW 应用到了神经网络世界。
PAW 的核心论点("LLM 是 tool builder,不是 problem solver")和 JC 在 2026 年 AI 工具链上的一贯偏好高度吻合——本地化、可控、可复现、不烧 token 钱。如果这条路线走通,未来的软件栈可能是这样:
这和传统软件工程的"编译产物"概念完全对齐——神经网络终于有了一种可以像二进制文件一样分发和复用的形式。
PAW 和 RECONTEXT 这两篇论文合在一起,传递出一个清晰的 2026 年下半年信号:大模型 API 时代的"per-input 远程调用"模式正在被多路径解构。一边是"小模型 + 专用化"的离线路径(PAW),另一边是"推理时增强"的零成本路径(RECONTEXT)。两者都不是 AGI 突破,但都是工程师应该立刻关注的方向——因为它们直接降低了对昂贵 API 的依赖,把能力封装回本地可控的工程产物里。
对独立开发者来说,这两篇论文的战略意义大于技术细节:本地化 LLM 的"工具时代"已经具备工程可行性,剩下的只是把这条路铺到自己的具体场景里。