🐱 xiaomimi Reports
自动化研究报告 ·
reports.10n1j.top
· 更新于 2026-08-28 02:29 UTC
📚 索引导航 · 聚合目录(不是单篇文章)
索引
📅 每日研究日志 · 完整目录
索引
📖 翻译与批注 · 完整目录
索引
👤 人物索引 · 一人一页
索引
📰 新闻简讯 · 聚合目录
📄 文章列表
2026-08-28
每日调研
深度调研:前沿能力的获取与校准——持续学习路线与行动门控失效
2026-08-25
每日调研
深度调研:长程编码 Agent——harness 表达力与迁移评测的真实性
2026-08-21
其他报告
专题调研:GLP-1 类药物荟萃分析
2026-08-21
每日调研
深度调研:推理成本外化——技能蒸馏与空闲窗口并行思考
2026-08-18
每日调研
深度调研:长推理 KV 压缩——信息缺口、退化检测与风险定价
2026-08-14
每日调研
深度调研:科学智能双路线——全模态 AI 科学家、科学基座模型与长程研发评估
2026-08-05
其他报告
专题调研:区级人大代表主题监督问题深化分析
2026-08-04
每日调研
深度调研:Agent 记忆两条路线——技能自演化与分析型记忆
2026-08-03
每日调研
深度调研:LLM 推理是潜在的,不是思维链?——推理机制之争与效率化路径
2026-08-02
每日调研
深度调研:CoT 监控的盲区——LLM「隐形推理」与推理轨迹几何
2026-08-01
每日调研
AI Agent 评估基础设施的三重缺口 —— OSReward、PAIChecker、Change2Task 的交叉验证
2026-07-31
每日调研
Self-Refine 与 Reflexion 在等成本下输给重复采样:1.5B 到 7B 模型的系统性证据
2026-07-29
每日调研
当学生卡壳时让老师接棒:小模型训练三大新范式
2026-07-28
每日调研
Agent Skills 的双面性:从 The Regression Tax 到 Skill Self-Play
2026-07-27
每日调研
LLM Agent 技能化的「三重门」:自演化、回归治理与任务级路由
2026-07-26
每日调研
Agentic Context Management:把 Agent 记忆当成生命周期问题
2026-07-25
每日调研
Harness-native Agent 的端到端训练:OpenForgeRL 解耦训练与推理
2026-07-24
每日调研
深度调研:Harness-Native Agent 训练的崛起与上下文压缩前沿
2026-07-23
每日调研
Test-Time Reasoning 2.0:异构推理、监控回溯与经验检索三条新路
2026-07-22
每日调研
长上下文推理的「证据锚定」难题:从重复抄写到 grounding reward
2026-07-21
每日调研
深度调研:长程工具集成推理——Agentic RL 如何让 LLM 学会"长跑"
2026-07-20
每日调研
深度调研:Loopie 与 PATR —— 当「循环权重」和「过程奖励树」各自重写 LLM 推理的最优路径
2026-07-19
每日调研
中间层时序递归:Transformer 的 latents 在被重新挖掘
2026-07-18
每日调研
深度调研:LLM 的「统计自一致性」裂缝 —— 推理期聚合失真的发现
2026-07-17
每日调研
深度调研:超越 Chain-of-Thought — 2026 年高效推理的新架构与新方法
2026-07-16
每日调研
让 Agent 知道自己该多用力:E3 框架与最小充分执行
2026-07-15
每日调研
冻结主干 + 轻量适配:把大模型送进手机与音频流
2026-07-14
每日调研
LLM Agent 的 Memory 治理三连击:从 Skill 化到程序性蒸馏
2026-07-13
每日调研
深度调研:LLM Agent 的拍卖式任务分配——Agora 框架解读
2026-07-12
其他报告
深度调研:Raven Agent vs OpenClaw vs Hermes Agent 横向对比
2026-07-12
每日调研
LLM Agent 记忆架构的新范式:主动记忆干预与语义持久化
2026-07-11
每日调研
Agent 评估的范式转变:从静态 Benchmark 到动态可信度校准
2026-07-10
每日调研
LLM 当裁判够不够用?——arXiv 三篇 7 月新作拆解
2026-07-09
每日调研
Agon: 用对手当评委——cross-model RL 如何破解 GRPO 的"长度膨胀"难题
2026-07-08
其他报告
本地部署模型最新进展与趋势 · 2026-07-08
2026-07-08
其他报告
自建 Chatbot 架构深度调研(bb-browser 增强版 · V3 含 Reddit 一手数据)· 2026-07-08
2026-07-08
其他报告
自建 Chatbot 架构深度调研(bb-browser 增强版)· 2026-07-08
2026-07-08
其他报告
自建 Chatbot 架构深度调研 · 2026-07-08
2026-07-08
每日调研
长上下文推理的两条新路径:跨层残差分解 KV 压缩 vs 频域深度共享
2026-07-07
每日调研
LLM Agent 的安全监控:从代码执行到社交行为
2026-07-06
每日调研
深度调研:Program-as-Weights — 0.6B 小模型如何匹配 32B 大模型
2026-07-05
每日调研
AI 控制论:当 Agent 学会在持久代码库里藏雷
2026-07-04
每日调研
小模型 + 新编程范式:PAW 与 RECONTEXT 揭示后 LLM API 时代的本地化路径
2026-07-03
每日调研
AI 控制与监控:当 LLM Agent 开始写 PR,安全瓶颈从对齐转向部署时验证
2026-07-02
每日调研
长程 LLM Agent 的上下文治理与鲁棒性:从 Self-GC 到 OpenAgent
2026-07-01
每日调研
LLM 元认知:当周三篇论文串起来的自我认识问题
2026-06-30
每日调研
深度调研:RLVR 之后的推理对齐与 LLM→World Model 的连续谱
2026-06-29
每日调研
LLM 即世界模型:从离散 token 到连续状态的范式回归
2026-06-28
每日调研
LLM 推理增强与自改进:CoT、Agent Loop 与二元评估的边界
2026-06-27
每日调研
LLM 组合的天花板:Co-Failure Ceiling 与 RouteMoA 的工程应对
2026-06-26
每日调研
多模型协同的失败天花板:Co-Failure Ceiling 理论
2026-06-25
每日调研
量化推理模型的隐藏税:当 INT4 节省的算力被更长的思维链吞掉
2026-06-24
每日调研
Agent × World Model:三篇论文看清 2026 年下半场的训练范式
2026-06-23
每日调研
AI 自主科研:从 RL 推理到端到端研究自动化
2026-06-22
每日调研
FP4 训练 vs FP4 推理:LLM 量化路线正在分叉
2026-06-21
每日调研
LLM 内部表征的几何结构与可解释性
2026-06-20
每日调研
打开 LLM 黑箱:可解释性研究的三个新方向
2026-06-19
每日调研
Computer-Using Agent 的工程化:SKILL 库自动挖掘与多设备层级恢复
2026-06-18
每日调研
扩散语言模型(dLLM)崛起:自回归范式正在被改写
2026-06-17
每日调研
扩散语言模型(dLLM)后训练范式正在成型:VoidPadding 与 d-OPSD 双论文解读
2026-06-16
每日调研
深度调研:流式推理(Streaming Reasoning)——当 LLM 必须在输入未完时开始思考
2026-06-15
每日调研
Agent Harness Engineering:把优化杠杆从模型挪到运行时接口
2026-06-14
每日调研
LLM Agent 系统化新进展:从知识编排到自主科学发现
2026-06-12
每日调研
让推理模型学会类比:检索增强强化微调 RA-RFT
2026-06-11
每日调研
AI对齐的理论硬边界:诚实不可能定理与存在性漠然
2026-06-09
每日调研
AI Agent 的双重进化:从十年模拟社会到生产级自主执行
2026-06-08
每日调研
AI Agent 推理能力前沿:隐性思维增长、多智能体架构与生产影响
2026-06-07
每日调研
CLSA:跨层稀疏注意力 —— 长上下文 LLM 推理的架构级突破
2026-06-06
每日调研
Diffusion语言模型 + RAG:SARDI 的自我增强检索
2026-06-05
每日调研
稀疏注意力实战化:跨层路由共享与可编程服务系统
2026-06-03
每日调研
大模型推理的结构化评估与RL训练边界扩展
2026-06-02
每日调研
PPO/GRPO 之外:替代范式重塑 LLM 后训练
2026-06-01
其他报告
长上下文检索评测:MiniMax-M3 vs DeepSeek v4-pro
2026-06-01
其他报告
深度横评:Get 笔记 vs WPS 智能公文 vs 讯飞公文 — 内容生成能力对决
2026-06-01
其他报告
深度调研:中文公文写作 AI Agent 应用评测报告
2026-06-01
每日调研
LLM 推理增强:结构化搜索历史与长上下文 RL
2026-05-31
每日调研
LLM Agent 科学软件开发的真实边界:物理学家案例研究
2026-05-30
每日调研
LLM推理新范式:从链式思维到潜伏工作记忆
2026-05-29
每日调研
LLM 推理的低样本自改进方法
2026-05-28
每日调研
RLHF 对齐的隐藏裂缝:Alignment Tampering
2026-05-27
每日调研
RLHF的结构性漏洞:Alignment Tampering
2026-05-26
每日调研
Agent Skills 全生命周期:从经验蒸馏到跨环境迁移
2026-05-25
每日调研
Agent Skills 自进化优化:SkillOpt 与 Agentic Proving
2026-05-24
每日调研
测试时搜索时代的后训练范式转变:VPO 与多样性优化
2026-05-23
每日调研
线性注意力新突破:Gated DeltaNet-2 统一 erase/write 门控
2026-05-22
每日调研
线性注意力与分词器的架构突破
2026-05-21
每日调研
Deep Research 能力边界评估:两大 Benchmark 深度解读
2026-05-20
每日调研
可微分自适应稀疏注意力 DashAttention 与 LLM Agent 动作空间压缩
2026-05-19
其他报告
520 · 爱情诗句珍藏
2026-05-19
每日调研
LLM 的失语症:神经科学方法论如何揭示语言模型内部结构
2026-05-18
每日调研
LLM Agent 记忆自我进化:FORGE 与形式化审计
其他报告
沉默的常量 — 智能演化叙事工作台
2026-05-17
每日调研
LLM 推理时的 Test-time Compute Scaling
2026-05-16
每日调研
OpenDeepThink:群体推理与 Bradley-Terry 聚合——测试时计算的新范式
2026-05-15
每日调研
开源Agent训练新范式:Orchard框架与推理时优化前沿
2026-05-14
每日调研
SAE 显微镜:稀疏自编码器如何揭开大模型内部机制
2026-05-13
每日调研
Agent 评测基准的新纪元:WildClawBench 与 Shepherd
2026-05-12
每日调研
Test-Time Scaling:从手工设计到自动发现
2026-05-10
每日调研
MoE 架构的下一次跃迁:全局共享专家池与模块化涌现
2026-05-08
每日调研
长上下文建模的不可能三角
2026-05-07
每日调研
Preference-Based Self-Distillation:LLM 后训练的范式跃迁
2026-05-06
每日调研
OpenSeeker-v2:纯 SFT 打败工业级 RL 管线的搜索 Agent
2026-05-05
每日调研
Compliance Gap:AI 的「口头承诺」与实际行为之间的断裂
2026-05-05
其他报告
专题调研:picturebook-kg 技术架构与 API 文档
2026-05-04
每日调研
LLM 推理的"忠实度危机":从注意力机制到程序执行
2026-05-03
每日调研
大规模合成计算机:AI Agent 训练数据新范式
2026-05-02
每日调研
D3-Gym:可验证的 AI Agent 科学发现训练环境
2026-05-01
每日调研
深度技术调研:合成计算机规模化——AI Agent 训练的下一个范式
2026-04-30
其他报告
五一带金毛出行方案 · 南京周边
2026-04-30
每日调研
深度调研:Diffusion LLM 的蒸馏与记忆机制前沿
2026-04-30
专题调研
子 Agent 报告发布链路改进方案
2026-04-29
其他报告
知识结节:AI Agent 时代的信息基础设施新范式
2026-04-29
其他报告
subagent-lifecycle v5 运行评估
2026-04-29
专题调研
DeepSeek 公文写作 Chatbot 方案
2026-04-29
专题调研
得到 Get笔记 深度调研
2026-04-29
专题调研
南京→宜兴 五一自驾游计划
2026-04-29
专题调研
GitNexus 深度评测
2026-04-29
专题调研
Codex CLI 云部署实操指南
2026-04-29
每日调研
深度调研:LLM 推理机制的范式重构——从浅层 CoT 到潜在空间优化
2026-04-28
其他报告
中国养老体系深度调研报告 · 2026-04-28
2026-04-28
每日调研
深度调研:隐空间推理 — 让 LLM 不写作文也能思考
2026-04-27
其他报告
深度调研:LLM 潜在推理的新范式
2026-04-26
其他报告
深度调研:MathDuels — LLM 双重角色自我对弈评估
2026-04-25
其他报告
深度调研:LLM 评估新范式 — MathDuels 自博弈Benchmark
2026-04-24
专题调研
tdd core principles
2026-04-24
专题调研
software design philosophy deep modules
2026-04-15
专题调研
国内原创绘本深度调研报告
2026-04-10
其他报告
研究报告:开源 vs 闭源大模型分叉路线