科学智能双路线:全模态 AI 科学家、科学基座模型与长程研发评估

2026-08-14 · 每日调研

为什么重要

「AI 做科研」正在从演示走向体系化竞争:一条路线把科学能力训练进基座模型(科学智能体基座),另一条路线把科学严谨性构建进多智能体流程(全模态 AI 科学家)。本周 arXiv 同时出现这两个方向的重量级工作——上海 AI Lab 的 Intern-S2-Preview-397B 与 NUS/Oxford 的 OmniScientist,外加美团对 7 个前沿模型长程研发能力的系统评估。三者合起来回答了同一个问题:自主科研离我们还有多远,瓶颈在模型、流程还是评估本身。

核心论文解读

1. Intern-S2-Preview:科学智能体基座模型(官方技术报告)

arXiv:2608.13505(cs.LG / cs.CL / cs.CV)· InternLM / 上海 AI 实验室 · 模型:huggingface.co/internlm/Intern-S2-Preview-397B · 代码:github.com/InternLM/Intern-S1(843 stars)

主模型 397B(另有 35B 高效版),目标是把「科学多模态理解 + 推理 + 生成 + 长程工具交互」压进单一模型。训练管线是全文最硬核的部分:

关键评测数字(自报):

基准得分对比口径
Biology-Instructions56.92领先(含闭源)
Mol-Instructions52.37领先
SciReasoner63.97领先
MolecularIQ / MicroVQA61.49 / 68.81开源最佳
MMLU-Pro / MMMU-Pro89.75 / 80.46开源最佳
SciTS 时序理解9 任务中 7 个超 1T 的 Intern-S1-ProPHU01 F1 36.8→66.9
GIFT-Eval 零样本预测MASE 0.785对标专用时序模型

核心主张:科学能力可以像通用能力一样被 RL「训练出来」——以 397B 的规模在多个科学基准上超越/追平万亿参数前辈与闭源模型,说明科学智能体基座路线在工程上已经跑通。

2. OmniScientist:全模态全学科 AI 科学家

arXiv:2608.13558(cs.AI / cs.CL)· 新加坡国立大学 + 牛津 · 项目页:omni-scientist.github.io · 代码:github.com/Omni-Scientist/OmniScientist

与 Intern-S2 相反,OmniScientist 不训练新模型,而是构建一个直接从异构原始证据做研究的确定性流水线:感知层 + 三个自主 agent(选题/实验/写作),每阶段用 ReAct 循环让观测真正影响研究问题、实验设计与最终主张。

几个示例发现能直观说明「直接感知」的价值:地震学里 21.7% 被标记为噪声的迹线其实含相干瞬变(极化与跨通道一致性是关键线索);心音数据集里「元数据捷径」在留一队列评估下 AUC 从 0.60 崩到 0.35——模型学的是录音棚而非心脏;材料学随机划分比留一材料族划分误差低 3.1-7.0×。

注意:6.3 分是作者自设演示套件 + 自家评委的结果,非外部盲评基准;36 案例中感知型占 28 个,学科覆盖偏向视觉/信号类数据。

3. Beyond Final Scores:长程 AI 研发的系统性评估框架

arXiv:2608.13417(cs.AI)· 美团 + 中科院

这篇不是新系统,而是对「自主研究能力」的冷静测量:7 个前沿模型 × 36 个长程任务,用规则化指标(非 LLM 裁判)把单次 run 拆成 Solution Framing / Execution / Feedback Control 三维,并做受控对比检验经验复用。

结论相当克制:

价值:给「AI 科研能力」提供了超越最终分数的诊断语言——未来评估应同时报告过程指标(framing/execution/feedback)与经验复用效应,否则分数会掩盖真正的瓶颈位置。

相关工作

我的判断

① 两条路线不是二选一,而是「上限」与「可信」的分工。Intern-S2 证明科学能力可以 RL 进基座(上限高、成本高、黑盒);OmniScientist 证明严谨性可以构建进流程(依赖骨干模型、但每个结论可审计)。最可能的终局是融合:基座提供领域能力,流程层提供可证伪性与溯源。

② anti-HARKing 与执行溯源将成为 AI 科学家的「安全气囊」。Agent 自主性越高,自我欺骗风险越大(先跑结果再编假设、多重比较挑显著项)。OmniScientist 把检查写进代码而不是靠 prompt,这个方向应该成为所有科研 agent 的默认配置。

③ Beyond Final Scores 的结论值得警惕:方法论新颖性依然稀缺。「agent 更像优化器」意味着我们离真正的 AI 发现(而非 AI 加速执行)还有距离——评估框架的成熟(过程指标 + 经验复用)是推动下一步进步的必要条件。

④ Memory Decoder 式外挂记忆(冻结骨干 + token 级路由融合)是低成本领域专业化的务实路径,对预算有限的团队尤其有参考价值;时间序列数值预测分支的设计(专用分支而非文本 token 生成)也值得做科学数据的工程团队借鉴。

局限:Intern-S2 为 preview 技术报告,关键数字为自报、无第三方复现;OmniScientist 的 6.3 分来自自家演示套件与自家评委;两者代码仓库均较新,复现成本高。美团评估虽口径严谨,但 36 个任务偏工程优化类,对「真正开放的探索性研究」覆盖有限。