最近,AutoResearch(自主科研)这个话题特别火。
这股热度并不是突然冒出来的。
科研本身就是一件极度消耗精力的事。文献调研、假设提出、实验设计、代码实现、结果分析、图表整理、论文写作,每一个环节都需要研究者投入大量时间和认知资源。
3月份,Andrej Karpathy 就开源过一个名为 autoresearch 的项目,让AI Agent能够在单GPU上自主进行机器学习实验循环。这个项目特别火爆,在github上已经涨到 83.7k stars。
昨天,DeepSeek研究员陈德里(DeepSeek-R1、DeepSeek-Coder、DeepSeek-MoE 架构等核心贡献者)又分享了一次新的尝试。
他开发了一个叫“Deli AutoResearch SKILL”的技能,通过CodeAgent,仅用6天就生成了一篇完整的综述论文。

论文标题:
From Copilots to Colleagues:A Survey of Autonomous Research Agents
论文地址:
https://victorchen96.github.io/auto_research_survey.pdf
据他透露,这篇论文生成过程历时6天,进行了108轮交互,而他“大脑 CPU 时间”不到 2 小时,最终产出2234行LaTeX、103条参考文献和46页内容。

- 来源:https://x.com/victor207755822/status/2059269472297623843
如果说 Karpathy 的 autoresearch 展示的是“实验闭环”,即 AI 能否在真实训练环境里自动改代码、跑实验、优化指标;
那么陈德里的 Deli AutoResearch SKILL 展示的则是“知识生产闭环”,即 AI 能否围绕一个研究主题,自主完成文献调研、结构规划、内容组织、图表生成和综述写作。
一个偏向实验自动化,一个偏向论文生产流程。
两者叠加在一起,说明 AutoResearch 的热度并不是概念炒作,而是 AI 正在进入重塑科研范式的新阶段。
01
从学术圈到工业界:
AutoResearch热潮正在国内兴起
如果把目光从卡帕西和陈德里的个人实践再往外看,会发现 AutoResearch 并不是一个孤立热点。
其实已经有一批团队,正在从不同方向把“AI 做科研”这件事往前推。
有的团队关注的是:AI 能不能像一个研究生一样,从零开始提出想法、跑实验、写论文。
比如日行迹智能 CEO 孙天祥,就是首个类 ChatGPT 中文语言模型 MOSS 的核心开发者。他打造的 FARS,更像是一座“自动科研工厂”。
2026 年 2 月,FARS 做了一场持续 228 小时的全球直播:系统从零开始自主提出 244 个假设,最终完成 100 篇学术论文,所有成果全部公开。平均算下来,大约每 2 小时 17 分钟产出一篇论文,总成本约 10.4 万美元。

项目链接:
https://analemma.ai/fars/
这个数字当然不能简单理解成“AI 已经可以批量生产高质量论文”。
它真正值得关注的地方在于:科研这件事第一次被拆成了一条可以持续运行、可以公开观察、可以计算成本的自动化流水线。
过去我们讨论 AI 科研,更多停留在概念层面。而 FARS 把问题变成了一个更具体的工程问题——给定算力、工具和智能体组织方式,AI 到底能把科研流程推进到哪一步?
西湖大学张岳团队提出的 DeepScientist,则更强调长周期科学发现。

项目链接:
https://github.com/ResearAI/DeepScientist
它不是简单让 AI 写一篇论文,而是让系统围绕一个研究目标,持续生成研究想法、筛选假设、执行实验、积累发现记忆,并最终形成完整论文。
论文中显示,DeepScientist 在 DeepReviewer 模拟评审中达到 60% simulated acceptance rate;由 3 位具备 ICLR 评审经验的研究者组成的小型 program committee 也认为,其输出在想法生成和科学贡献上具有一定价值。
这类工作说明,高校侧真正关心的已经不是“AI 能不能写论文”这个表层问题,而是 AI 能不能具备一套更接近研究者的长期能力:发现问题、提出假设、验证假设、积累经验,再进入下一轮探索。
上海人工智能实验室推出的 InternAgent,则把视野放得更宽。

项目链接:
https://github.com/InternScience/InternAgent
它试图做一个通用科学发现 Agent 底座,把想法生成、方法构建、实验规划和工具执行放进同一个闭环框架中,并在反应产率预测、分子动力学、电力功率流估计、时间序列预测、转录预测、增强子活性预测、情感分类、二维图像分类、三维点云分类、二维语义分割、三维自动驾驶、视觉语言模型微调多类任务中进行验证。
这类系统的意义在于,它不再只服务某一个单点任务,而是在探索一种更通用的科研智能体范式,不同学科任务虽然形式不同,但背后都可以被抽象为“提出问题-调用工具-执行实验-分析反馈-继续迭代”的循环。
而工业界走的则是另一条路线:把 AI Agent 接入真实实验室。
晶泰科技的方向很典型,它把 AI 模型与机器人实验平台结合,构建智能自主实验平台,让 AI 负责实验设计和决策,让机器人负责合成、检测和数据记录。官方资料显示,这类平台可以实现 7×24 小时高通量实验执行,人效提升 5 倍、数据收集能力提升 40 倍,并已经在化学合成、配方筛选、中药分析、新材料等场景落地。

来源:
https://www.xtalpi.com/approach_auto_lab/
这意味着,科研 Agent 不只是停留在屏幕里的“数字研究员”,而是开始进入真实实验环境。
英矽智能发布的 LabClaw 也是类似方向。

来源:
https://insilico.com/main_sc
它通过 5 个协作式 AI 智能体与 28 项专业技能模块,连接疾病靶点发现、化合物筛选、自动化实验执行、数据分析和报告生成等环节,试图构建一套干湿实验全链路智能闭环。更重要的是,系统在关键节点引入 Human-in-the-Loop 审批机制,保证 AI 在提高自主性的同时,仍然受到必要的科学审查和合规控制。
从这些案例可以看到,中国在 AutoResearch 上并不是简单跟随海外热点。
高校和研究机构更多在探索“AI 科学家”的长期自主发现能力;工业界则更关注如何把 AI Agent 接入自动化实验室、生物医药、新材料和生物制造流程。
这两条路线一起将科研从“人脑驱动的手工作业”,推向“人类判断+Agent 执行+实验闭环”的新工作流。
02
综述解读:
自主科研智能体到底是什么?
回到陈德里这篇综述,它最有价值的地方,不是单纯罗列了一批系统,而是为快速发展的自主科研智能体领域建立了一套分析框架。
文章将 Autonomous Research Agents 定义为:给定一个高层研究目标后,系统能够在较少甚至无需人类持续干预的情况下,独立执行科学研究的迭代循环,包括假设生成、实验设计、执行、分析和改进。
这篇综述排除了普通辅助工具,代码补全工具、文献搜索工具、对话式问答工具,本身都不算真正的自主科研智能体。因为它们只是帮助研究者完成某一步,而不是主动推进科研流程。
真正的 Research Agent,需要具备三类能力。
第一,它要能处理开放式问题。科研任务不是一道有标准答案的选择题。很多时候,问题本身都需要被重新定义。
第二,它要有新颖性要求。科研不是把已有信息重新排列,而是要提出某种超出现有知识的贡献。
第三,它要具备可验证性。一个结论不能只是听起来合理,还要能通过实验、代码、数学推导或专家评审来验证。
这也是为什么科研 Agent 比一般任务型 Agent 更难。写一段代码,可以用测试用例验证。回答一道数学题,可以对照标准答案。但判断一个研究想法有没有价值,往往需要时间、同行评议和真实领域知识。
03
从 L1 到 L5:
科研 Agent 正在走向更高自主性
这篇综述最清晰的贡献是类比自动驾驶 SAE 分级,提出了 L1 到 L5 的科研智能体自主等级体系。

表注:科研智能体自主等级分类体系。“Human Role(人类角色)”一列表示,在初始目标设定之外,人类还必须提供哪些支持或介入。
L1 是自动补全层级,以 GitHub Copilot、TabNine 等代码补全工具为代表,主要在 token 或代码行粒度上提供补全建议,人类仍完全掌控任务方向与正确性判断。
L2 是任务执行层级,以带工具调用能力的 ChatGPT、Claude 等对话式助手为代表,可以拆解明确任务、调用工具并合成信息,但关键步骤仍需要人类持续确认。
L3 是带检查点的多步自主层级,以 Claude Code、Cursor Agent 等代码智能体为代表,可以在预设检查点之间自主完成 10–100 步操作,例如浏览代码库、编辑文件、运行测试和修复错误;人类主要负责目标设定和阶段性审查。
L4 是有自我修正能力的全自主层级,以 Devin、AI Scientist、SWE-Agent 等为代表,系统接收研究目标后,可以连续运行数小时甚至数天,完成实验执行、失败恢复、策略修正和最终成果生成,人类主要负责最终结果评估。
L5 是自我驱动科研层级,指智能体不仅能执行研究任务,还能自主选择研究问题、规划长期研究议程,并在长期过程中积累和复用自身成果。
综述的判断非常克制:当前系统大多处于 L3 到 L4,L5 还没有真正实现。
阻碍 L5 的关键,不只是模型能力不够,而是长期知识积累、可靠自我评估和可扩展智能体架构仍然没有完全解决。
这点很重要。
它提醒我们,AutoResearch 虽然很火,但不能被包装成“AI 已经全面取代科学家”。
更准确的说法是,AI 已经能在部分科研流程中形成高强度执行力,但离真正自主提出长期科研议程,还有很长距离。
04
四种架构:
科研 Agent 是怎么工作的?
综述还总结了当前自主科研智能体的四类主流架构:单智能体循环、多智能体协作、层级编排和工具增强执行。

图注:自主科研智能体的四种主流架构模式。
单智能体循环,是最基础的形态。一个 Agent 反复执行“计划—行动—观察—反思”的循环。它结构简单,适合边界清晰的小任务,但面对复杂科研流程时,容易受限于上下文、错误恢复和任务复杂度。
多智能体协作,则更像一个科研小组。不同 Agent 扮演不同角色,例如文献调研员、实验设计者、代码实现者、审稿人、结果分析者。它的优势是可以相互补充和校验,缺点是沟通成本和系统复杂度更高。
层级编排架构类似“管理者-执行者”的结构,上层 Agent 负责目标规划和任务拆解,下层 Agent 负责具体执行。这样可以避免一个模型同时承担所有认知负担,也更适合长链条任务。
工具增强架构,则是让 Agent 接入真实工具。比如代码环境、浏览器、数据库、文件系统、实验平台,甚至机器人实验室。没有工具,Agent 只能“说”;接入工具后,Agent 才能“做”。
目前较先进的科研 Agent 往往不是单独采用某一种架构,而是混合使用。例如,用层级架构做规划,用工具系统做执行,用多智能体做互审,用单智能体循环完成局部推理。
这也解释了为什么 AutoResearch 会突然成熟。
它不是单个大模型能力提升的结果,而是模型、工具、记忆、检索、代码执行、评估系统和工作流编排共同成熟后的产物。
05
总结:Agent 接管的是科研重体力,
不是科学判断
陈德里这篇综述最特别的地方,在于它本身就带有一种“元实验”色彩。
文章讨论的是自主科研智能体,而文章部分内容又由 Deli AutoResearch SKILL 生成。也就是说,研究者一边分析科研 Agent 的能力边界,一边亲身测试科研 Agent 到底能走多远。
但越是这样的案例变多,越需要把话说清楚。
AutoResearch 的价值,不是让 AI 代替科学家获得灵感。
它更现实的作用,是接管科研中大量重复、繁琐、长链条的执行环节。比如查文献、搭框架、写代码、跑实验、生成图表、整理结果、生成初稿、检查引用、修改格式。
这些工作过去会严重消耗研究者的注意力。现在,Agent 可以把它们变成一个更自动化、更可追踪、更可复用的流程。
但科学判断仍然属于人——什么问题值得研究,什么结果真正重要,哪些结论经得起验证,哪些方向有长期价值,哪些边界不能突破,这些都不是简单靠 token 消耗和自动迭代就能解决的。
综述也明确指出,自主科研智能体仍面临认知循环、上下文限制、新颖性评估、可复现性、安全风险和成本等关键挑战。

所以,AutoResearch 最合理的定位不是“AI 取代研究者”。而是让研究者从大量科研重体力中释放出来,把更多精力放回真正需要人类判断的地方。







