「AI 做科研」正在从演示走向体系化竞争:一条路线把科学能力训练进基座模型(科学智能体基座),另一条路线把科学严谨性构建进多智能体流程(全模态 AI 科学家)。本周 arXiv 同时出现这两个方向的重量级工作——上海 AI Lab 的 Intern-S2-Preview-397B 与 NUS/Oxford 的 OmniScientist,外加美团对 7 个前沿模型长程研发能力的系统评估。三者合起来回答了同一个问题:自主科研离我们还有多远,瓶颈在模型、流程还是评估本身。
arXiv:2608.13505(cs.LG / cs.CL / cs.CV)· InternLM / 上海 AI 实验室 · 模型:huggingface.co/internlm/Intern-S2-Preview-397B · 代码:github.com/InternLM/Intern-S1(843 stars)
主模型 397B(另有 35B 高效版),目标是把「科学多模态理解 + 推理 + 生成 + 长程工具交互」压进单一模型。训练管线是全文最硬核的部分:
关键评测数字(自报):
| 基准 | 得分 | 对比口径 |
|---|---|---|
| Biology-Instructions | 56.92 | 领先(含闭源) |
| Mol-Instructions | 52.37 | 领先 |
| SciReasoner | 63.97 | 领先 |
| MolecularIQ / MicroVQA | 61.49 / 68.81 | 开源最佳 |
| MMLU-Pro / MMMU-Pro | 89.75 / 80.46 | 开源最佳 |
| SciTS 时序理解 | 9 任务中 7 个超 1T 的 Intern-S1-Pro | PHU01 F1 36.8→66.9 |
| GIFT-Eval 零样本预测 | MASE 0.785 | 对标专用时序模型 |
核心主张:科学能力可以像通用能力一样被 RL「训练出来」——以 397B 的规模在多个科学基准上超越/追平万亿参数前辈与闭源模型,说明科学智能体基座路线在工程上已经跑通。
arXiv:2608.13558(cs.AI / cs.CL)· 新加坡国立大学 + 牛津 · 项目页:omni-scientist.github.io · 代码:github.com/Omni-Scientist/OmniScientist
与 Intern-S2 相反,OmniScientist 不训练新模型,而是构建一个直接从异构原始证据做研究的确定性流水线:感知层 + 三个自主 agent(选题/实验/写作),每阶段用 ReAct 循环让观测真正影响研究问题、实验设计与最终主张。
几个示例发现能直观说明「直接感知」的价值:地震学里 21.7% 被标记为噪声的迹线其实含相干瞬变(极化与跨通道一致性是关键线索);心音数据集里「元数据捷径」在留一队列评估下 AUC 从 0.60 崩到 0.35——模型学的是录音棚而非心脏;材料学随机划分比留一材料族划分误差低 3.1-7.0×。
注意:6.3 分是作者自设演示套件 + 自家评委的结果,非外部盲评基准;36 案例中感知型占 28 个,学科覆盖偏向视觉/信号类数据。
arXiv:2608.13417(cs.AI)· 美团 + 中科院
这篇不是新系统,而是对「自主研究能力」的冷静测量:7 个前沿模型 × 36 个长程任务,用规则化指标(非 LLM 裁判)把单次 run 拆成 Solution Framing / Execution / Feedback Control 三维,并做受控对比检验经验复用。
结论相当克制:
价值:给「AI 科研能力」提供了超越最终分数的诊断语言——未来评估应同时报告过程指标(framing/execution/feedback)与经验复用效应,否则分数会掩盖真正的瓶颈位置。
huggingface.co/danish-foundation-models/DFM-Mimir。低资源语言 + 数据合规路线的范本。① 两条路线不是二选一,而是「上限」与「可信」的分工。Intern-S2 证明科学能力可以 RL 进基座(上限高、成本高、黑盒);OmniScientist 证明严谨性可以构建进流程(依赖骨干模型、但每个结论可审计)。最可能的终局是融合:基座提供领域能力,流程层提供可证伪性与溯源。
② anti-HARKing 与执行溯源将成为 AI 科学家的「安全气囊」。Agent 自主性越高,自我欺骗风险越大(先跑结果再编假设、多重比较挑显著项)。OmniScientist 把检查写进代码而不是靠 prompt,这个方向应该成为所有科研 agent 的默认配置。
③ Beyond Final Scores 的结论值得警惕:方法论新颖性依然稀缺。「agent 更像优化器」意味着我们离真正的 AI 发现(而非 AI 加速执行)还有距离——评估框架的成熟(过程指标 + 经验复用)是推动下一步进步的必要条件。
④ Memory Decoder 式外挂记忆(冻结骨干 + token 级路由融合)是低成本领域专业化的务实路径,对预算有限的团队尤其有参考价值;时间序列数值预测分支的设计(专用分支而非文本 token 生成)也值得做科学数据的工程团队借鉴。
局限:Intern-S2 为 preview 技术报告,关键数字为自报、无第三方复现;OmniScientist 的 6.3 分来自自家演示套件与自家评委;两者代码仓库均较新,复现成本高。美团评估虽口径严谨,但 36 个任务偏工程优化类,对「真正开放的探索性研究」覆盖有限。