Token导航 LogoToken导航

AI 进化史回顾:从技术视角看近年发展

更新时间 2026-09-27来源 浮之静正文 1.1万字阅读约 34分钟1 张图片
图片

用个人技术视角,带大家快速回顾近几年 AI 发展历程...

推荐阅读:技术栈推荐:围绕 AI 反馈闭环做选型、Agent 开发指南:技术太多,该怎么学?、DSH:DeepSeek Harness 架构解析、第一个 Agent 从 Pi 开始、深度思考:架构腐朽 & Loop Engineering、浅谈 AI 编程、浅谈 AI 超级应用、Agent 趋势浅思:原生化 & CLI 化、Agent Memory 架构本质、深度解析:Harness Engineering、从 Prompt Engineering 到 Context Engineering、深度解析:Anthropic MCP 协议

AI 四年发展史

2022 年 11 月 30 日,ChatGPT[1] 公开上线。到 2026 年 9 月,还不到四年。最初,我们围绕聊天框工作:提出问题、补充背景、反复追问,再把回答复制到真正干活的地方。写文章需要自己整理材料,写代码需要自己运行调试。提示词工程(Prompt Engineering)成为最容易上手的技巧,人们研究怎样交代角色、提供示例、限定格式,让 AI 回答得更准确。那时,AI 负责生成,人负责把后面的事做完。

2023—2024:聊天框接上了外部世界

2023 年,开发者开始给模型接入资料和工具。LangChain[2] 等框架将模型调用、知识检索和程序执行连接起来,检索增强生成(RAG)让 AI 可以参考外部知识回答问题,工具调用则让它能够借助软件完成操作。AutoGPT[3]、BabyAGI[4] 等早期项目进一步探索连续执行:接收一个目标,生成任务、调用工具,再根据结果决定下一步。人们开始尝试把“接下来该做什么”也交给模型判断。

到了 2024 年,如何组织这些操作,成为更实际的问题。n8n[5]、Dify[6] 将模型接入可视化工作流,把查询、提取、生成和更新系统串起来;LangGraph[7] 则为循环执行、状态保存和人工介入提供更细的控制。预先安排好流程与模型动态判断开始结合:确定的步骤交给程序,需要理解和选择的环节交给模型,关键节点再由人确认。

同一时期,AI 与软件连接的方式也在扩展。2024 年 10 月,Anthropic 开放电脑操作能力[8]的公开测试,让模型通过截图、鼠标和键盘使用图形界面;11 月 25 日,又发布 MCP[9],为 AI 应用连接外部工具和数据提供共同协议。模型既可以通过接口调用软件,也开始尝试直接操作为人设计的界面。后来浏览器 Agent、桌面助手和工具生态的发展,都能在这里找到早期铺垫。

2025:开始把完整任务交给 Agent

进入 2025 年,模型能力与部署条件的变化,让更多尝试成为可能。持续发展的 DeepSeek、GLM、Qwen、Llama 等开源与开放权重模型,为开发者提供了自行部署和改造的选择。DeepSeek-R1 及其基于 Qwen、Llama 的蒸馏版本,又把一部分推理能力带进更小的模型。旗舰模型继续提高能力上限,小型模型则不断扩展个人设备能够承担的任务。

配合量化,以及 Ollama、LM Studio、llama.cpp、MLX 等工具,本地部署逐渐成为一条实用路线。个人可以根据电脑的内存和算力选择模型,在自己的设备上处理资料、辅助编程,再接入知识库和自动化程序。云端服务之外,AI 开始成为可以下载、配置、替换和组合的个人计算能力。

软件开发是任务交接最明显的地方。Cursor、Claude Code、Codex 将编程体验从代码补全推进到读取仓库、跨文件修改、运行命令和执行测试。2025 年 4 月开源的 Codex CLI[10],还把终端编程 Agent 的实现公开出来,让开发者能够研究和修改模型、工具与本地执行环境之间的连接。人们提出的要求也随之变化:从“帮我写一个函数”,变成“把这个功能做完,跑通测试,再把修改交回来”。

浏览器方向也在同期推进。开源项目 browser-use[11] 将模型与浏览器自动化连接起来,为开发者提供网页读取、点击、输入和多步操作能力;Operator[12] 展示了直接接受用户委托、操作网页的产品体验,Manus[13] 则把浏览器操作、代码执行和文件处理组织成面向用户的完整任务。搜索资料、整理结果、制作内容,开始被放进同一次执行过程。

到了下半年,Comet[14]、ChatGPT Atlas[15] 又把助手直接放进浏览器。用户正在浏览的页面,可以同时成为 AI 理解任务的上下文和执行操作的现场。浏览器逐渐从“人查资料的入口”,变成“人与 Agent 共同工作的环境”。

2025 下半年:长任务开始需要一套运行机制

任务交出去之后,新的问题很快显现:模型读过哪些资料,试过哪些方法,当前做到哪里,下一步还缺什么?随着工具输出和历史记录不断积累,单纯增加提示词或延长对话,已经很难解决这些问题。上下文工程(Context Engineering)因此成为更突出的工程议题,关注如何检索相关信息、压缩历史、保留工作状态,以及让模型在每一步看到真正需要的内容。

协作经验也开始从聊天记录里沉淀出来。AGENTS.md[16] 为项目背景、开发约束和测试命令提供固定入口;2025 年 10 月推出的 Agent Skills[17],则把操作步骤、脚本和参考资料组织成可以按需加载的能力包。一次成功任务中有用的方法,可以留下来,供后续任务继续使用,也可以交给其他人和兼容的 Agent。

但信息组织只是长任务的一部分。环境怎样初始化,执行中断后如何接续,完成一个步骤后怎样检查,都需要由系统处理。2025 年 11 月,Anthropic 公开讨论长期任务的 harness[18],通过初始化、分步执行、进度记录和验证机制维持工作连续性。工程关注点开始从“模型应该看到什么”,进一步扩展到“整项工作怎样运行下去”。

同月,Pi[19] 展示了一种精简、可扩展的实现思路:把多模型接入、Agent 执行循环和会话管理拆成可复用组件,保留清晰的核心,再由扩展补充具体能力。它既是一个编程 Agent,也给开发者提供了搭建其他 Agent 应用的基础。模型之外的这层运行机制,开始成为可以独立研究、改造和复用的软件。

2026 年初:工具、技能和助手开始组成工作系统

2026 年 1 月 20 日,Vercel 发布 skills CLI[20] 与 skills.sh[21],为技能提供目录、排行、发现和安装入口。分享经验逐渐有了类似软件分发的流程:开发者发布技能,使用者选择并安装到自己的 Agent,再按项目需要调整。Skills 开始围绕实际任务形成生态,不再只散落在个人配置和聊天记录里。

随后,OpenClaw[22] 引发的“龙虾热”,把自部署个人助手带进更广泛的视野。人们通过熟悉的聊天软件给助手派活,为它连接资料、工具和日常事务。Pi 也随着 OpenClaw 的走红被更多人认识:它此前已经存在,OpenClaw 采用了它的底层组件,再围绕这些组件组织个人助手体验。一个面向开发者的运行核心,就这样通过上层产品进入了更多人的工作场景。

2 月 2 日,Codex[23] 桌面应用把多个 Agent 的并行任务、独立工作区和结果审查放进同一个界面。开发者可以同时推进不同工作,再分别检查修改、处理冲突和接收结果。使用 AI 的方式开始包含一项新的工作:安排分工,并管理多个执行过程。

同月,OpenAI 通过一个由 Codex 生成全部代码的内部产品实验,进一步呈现了 Harness 工程的实践[24]。工程师把更多精力投入环境设计、架构约束、测试和反馈,让 Agent 的工作能够被引导、检查和修正。代码生成的比例可以很高,但支撑交付的工程工作仍然存在,只是人的投入位置发生了变化。此前分别处理的上下文、工具、验证和纠错问题,开始被放在同一套运行体系里考虑。

2026 年春夏:AI 开始操作电脑,也开始检查自己的工作

3 月 5 日,GPT-5.4[25] 在模型层面提供原生电脑操作能力;4 月 16 日,Codex 桌面应用加入 Computer Use,最初面向 macOS。它可以观察屏幕、点击和输入,使用浏览器之外的桌面软件,也能处理那些没有合适 API 的应用。编程 Agent 的执行范围,由代码文件和终端进一步延伸到了真实的软件界面。

这一步直接影响了开发过程。修改代码之后,Agent 可以启动应用、操作界面、观察效果,再根据发现的问题继续调整;一些只有实际点击、输入和切换页面才能暴露的问题,也有机会进入它的检查范围。写代码、运行程序、操作界面、验证结果,开始连成一个更完整的工作过程。AI 交回来的成果,也因此多了一层来自实际使用的反馈。

与此同时,围绕 Agent 的命令行工具也在扩展。比如 Vercel agent-browser[26] 将浏览器操作做成 CLI,通过带有元素引用的页面快照,让 Agent 找到目标、点击、填表、截图和检查。MCP、CLI 与电脑操作提供了不同的行动入口:有的任务适合调用服务,有的适合执行命令,有的需要直接面对界面。Agent 能否完成工作,越来越取决于它能否找到合适的工具,并正确理解工具返回的结果。

工具之外,专业方法也被整理成可安装的技能。以开发技能为例:mattpocock/skills[27] 将需求澄清、测试驱动开发、故障诊断和架构改进带进 Agent 工作流;Impeccable[28] 则提供设计评审、可访问性检查、视觉打磨和交互优化方面的指导。配合浏览器和电脑操作,一次开发任务可以先明确需求,再实现功能、运行测试、检查界面,最后依据反馈修正。技能提供做事的方法,工具把这些方法落实到操作。

随着这些能力被反复使用,项目里也逐渐形成面向 Agent 的工作约定。AGENTS.md 保存项目说明,SKILL.md 组织专门流程,.agents/skills/ 等目录让兼容工具发现和加载技能。这些文件可以与代码一起提交、审查和更新,让团队积累的方法留在项目里。不同工具仍有各自的配置方式,但跨工具复用已经有了实际基础。

2026 下半年:多个 Agent 分工,整套能力按需组合

到 2026 年中后期,长期运行与多 Agent 协作已经有了更具体的工具形态。Hermes Agent[29] 将持久记忆、技能积累、定时任务和子 Agent 委派组合起来;herdr[30] 则管理多个编程 Agent 的终端会话,显示哪些正在工作、哪些等待输入,并通过 CLI 和接口让 Agent 启动其他会话、读取输出、协调任务。一个人可以同时组织多项工作,Agent 之间也开始参与任务交接。

8 月推出的 Grok Bot[31],强调拥有独立计算环境、能够持续工作的 AI 同事;9 月推出的 Muse[32],则围绕个人偏好、日常事务和长期目标展开。这类助手尝试把工作延伸到多次对话之间:用户关闭应用后,任务仍可继续推进,需要授权时再回来询问。资料、偏好和进度可以保留下来,成为下一次工作的起点。

模型本身也开始承担更细的分工。9 月 15 日,TypeSafe 发布的 Jev[33] 专注分类、路由、评分等快速判断,直接返回程序可用的结构化结果;独立开源项目 Laya[34] 则采用数亿参数的编码器模型,通过一次前向计算输出选择、评分和概率,并支持多语言与本地部署。复杂任务可以交给通用模型,请求分流、工具选择等高频判断则有了轻量化的选择。本地 AI 的用途,也由聊天和编程扩展到软件内部的决策环节。

这种组合方式,在 Agent 运行框架中也有了具体体现。截至 9 月底,仍处于开发者预览阶段的 DeepSeek Harness[35],以 Cordis[36] 组织插件,将模型、工具、技能、沙箱和调度纳入同一套系统。它的多模型适配复用了 Pi 的 pi-ai,也提供了把任务委派给真实 Codex 会话执行的接口。新系统与既有项目之间的联系,已经落实为可检查的依赖和代码复用:成熟组件可以被重新组织,开发者不必每次都从头搭建整个 Agent。

底层技术变更

聊完 AI 发展史,意犹未尽。我们再从技术角度,看看有哪些新趋势。

工具链也在进化:AI 开始改造自己的工作环境

与 Agent 能力扩展并行的,还有一场发生在底层的变化:包管理器、编译器、构建工具和运行时,正在通过 Rust、Go、Zig 等原生实现提高性能、降低资源开销。这些项目大多从开发者长期面对的性能问题出发,随着 Agent 开始反复修改、构建和测试代码,它们又成为自动化开发的重要基础。微软在公布 TypeScript 原生迁移计划[37]时,就明确提到:更快的代码分析能力,也将为下一代 AI 开发工具提供支撑。

2024—2025:先让开发工具跑得更快

2024 年 2 月,Astral 发布 uv[38],从一开始就用 Rust 实现 Python 包安装与依赖解析,随后逐步扩展到项目、环境和工具管理。安装依赖、创建隔离环境、运行一次性工具,这些原本分散在多个命令里的操作,有了更统一的入口。对于需要频繁准备执行环境的 Agent 来说,这类工具可以减少环境搭建的步骤,也更适合把一次任务所需的依赖与操作封装起来。

2025 年 3 月,微软公布 TypeScript 原生迁移计划,将编译器和语言服务移植到 Go;同年 5 月,开发者可以通过 tsgo 试用原生预览版。这里的变化发生在类型检查、编译和代码分析环节:大型项目加载更快,错误反馈更及时,Agent 修改代码后,也能更快知道改动是否破坏了类型约束。编译器的性能,开始直接影响“修改—检查—修正”这条工作循环的速度。

2026 上半年:工具开始主动向 Agent 提供反馈

2026 年 3 月,Vite 8[39] 正式发布,将打包与转换核心整合到 Rust 实现的 Rolldown[40]、Oxc[41] 工具链上。除了构建提速,它还加入了一个与 Agent 直接相关的功能:将浏览器控制台日志和错误转发到开发服务器终端,并在检测到编程 Agent 时自动启用。过去留在浏览器里的运行时错误,开始进入 Agent 能够读取的命令输出。工具既负责执行,也开始把下一步修复所需的证据送回来。

这与前面的 browser-use、agent-browser、Codex Computer Use 恰好衔接起来。Agent 可以通过浏览器或电脑操作发现界面问题,通过终端读取运行错误,再用类型检查和测试验证修改。构建、诊断和测试越快,Agent 就越有条件在交付前多做几轮检查。这种收益取决于任务和验证流程,不能直接换算成模型能力提升,但它确实改变了完成一次可靠修改所需要的等待与操作成本。TypeScript 7 于 2026 年 7 月正式发布时,官方也把缩短这类反馈循环作为重要价值,并展示了多个大型项目的构建提速结果。

2026 年夏季:Agent 开始参与重造底层工具

Bun 的 Rust 迁移[42],让这条发展路线出现了一个很有代表性的回环。Bun 支撑着 Claude Code 的运行,而 Bun 团队又利用 Claude Code 来改造 Bun。2026 年 7 月 8 日,Bun 作者公开了此前的迁移过程:将原有 Zig 实现迁移到 Rust,使用预发布的 Claude Fable 5,峰值同时运行约 64 个 Claude,在约 11 天内推进到各平台测试套件全部通过。这个结果来自作者披露的工程记录。

这次实践的关键,在于怎样组织迁移。团队先制定 PORTING.md 和生命周期映射规则,小范围试跑后再扩大规模;实现、审查和修复由不同上下文中的 Agent 分别承担,通过多个独立工作区并行推进,再用编译错误和既有测试持续反馈。人负责检查过程、识别反复出现的问题,并调整生成代码的工作流。从规则、分工到验证,Bun 把 Harness 工程落实成了一套可以持续运行的迁移流程。

测试通过之后,工作仍在继续。8 月 20 日发布的 Bun 1.4[43],才是正式采用 Rust 实现的首个版本;发布说明同时记录了持续的模糊测试、内存检查,以及与旧版 Bun、Node.js 对照运行的验证工作。这个案例值得关注的地方,也包括生成代码之后的审查与收尾:大规模并行可以加快迁移,兼容性和稳定性仍要靠实际验证逐步建立。

2026 下半年:从单个工具提速,到统一整个仓库的工作方式

8 月 26 日,pnpm 12[44] 宣布稳定,以 Rust 重写实现,同时尽量延续已有命令、配置和锁文件格式。它也开始处理 Agent 执行环境中的具体问题:当沙箱只允许向项目目录写入时,pnpm 可以把默认存储放进项目内部,减少因权限和文件系统边界造成的重复复制。面向 Agent 的适配,已经进入包管理器的实际行为。

9 月,pnpm 12.4[45] 又尝试在同一个工作区管理 npm、Python 和 Cargo 依赖,并通过 pnpm pipeline 组织安装、构建与测试。任务可以声明输入和产物,复用缓存,集中报告失败;配套的 pnpr 则继续扩展共享仓库与构建服务。这些跨语言能力当时仍处于早期,但方向已经清楚:一个包含前端、Python 服务和 Rust 模块的仓库,可以逐渐拥有更统一的准备、执行与验证入口。人、Agent 和 CI 因而有机会沿用同一套工作规则。

把 uv、tsgo、Vite、Bun 和 pnpm 放在一起看,可以看到几个相互连接的变化:核心计算转向更高效的实现,环境和依赖管理更加统一,错误反馈更容易被程序读取,构建与测试也更适合反复执行。其中,Vite 的终端错误转发、pnpm 的沙箱适配,已经是明确面向 Agent 使用场景的改进;Bun 则进一步展示了 Agent 参与底层工具改造的可能。

“给 Agent 铺路”由此有了更具体的含义:让它更容易准备环境、调用能力、获得反馈,并以更低的开销重复验证。模型决定能提出什么方案,工具链决定方案能多快落地,Harness 决定整个过程如何持续、受控地推进。

这也让前面的时间线形成了一个完整的循环:最初,我们用 AI 生成代码;随后,让它调用工具、完成任务;再往后,AI 开始参与改造支撑自己工作的工具。开发基础设施与 Agent 能力,正在相互推动。

结语

回头看,这几年的变化几乎没有留下多少适应的间隙。刚学会写提示词,就开始整理上下文;刚习惯让 AI 修改项目,又要为它选择模型、安装工具、配置技能、保存记忆,再安排多个 Agent 分工。提示词工程、上下文工程、Harness 工程所关注的范围不断扩大,我们交给 AI 的工作也越来越完整。

这些变化同时把人的责任推得更清楚:要做成什么,允许操作哪些系统,遇到什么情况必须停下来,以及怎样证明工作确实完成。能生成代码,仍然需要测试;能操作电脑,更需要权限边界;能连续运行,也需要留下可检查的过程。

不到四年,我们已经从学习怎样向 AI 提问,走到了学习怎样组织 AI 工作。

📌 Agent 运行体系

随着 AI 从回答问题走向执行任务,工程设计的范围也从单次提示,扩展到信息组织和整个执行过程。

  • 提示词工程:把任务说清楚。明确目标、约束、示例和输出要求,帮助模型理解要做什么、遵守哪些规则。
  • 上下文工程:组织每一步需要的信息。按需检索资料、压缩历史、保留关键状态,并根据任务划分信息边界,让模型在执行过程中获得相关、有效的上下文。
  • Harness 工程:为持续、受控、可验证的执行建立机制。统筹工具调用、运行环境、状态管理、权限控制、测试验证和失败恢复,并在关键节点引入人工确认,支持任务接续推进、问题及时发现与纠正。

三者相互配合,关注范围也有交叉。任务越长、涉及的系统越多,就越需要将信息组织、执行控制和结果验证一起纳入设计。

MCP、Skills、A2A[46] 分别补充了工具连接、经验复用和跨 Agent 协作能力:MCP 规范工具与数据的接入,减少重复适配;Skills 将操作方法、脚本和参考资料组织为可复用、按需加载的技能;A2A 支持不同 Agent 之间的通信、任务委派与状态交换。

在执行与评测层,Cua[47] 等项目进一步提供桌面操作工具、本地或云端沙箱,以及操作轨迹记录和任务评测能力。Agent 由此获得实际工作的环境,执行过程可以追溯,任务结果也可以依据预先定义的成功条件进行检查。

模型提供理解与判断,工具完成实际操作,运行体系管理状态、约束执行并支持纠错,人负责目标、授权和验收标准。Agent 能否可靠地完成任务,既取决于模型能力,也取决于整套系统如何组织执行、验证结果。

补充:开源社区也在持续深挖本地部署的性能空间。antirez 的 ds4[48] 围绕 DeepSeek、GLM 等模型优化原生推理,结合量化、专家权重缓存和 SSD 按需加载,扩大个人电脑和工作站能够运行的模型范围;h3.c[49] 则为 MiniMax H3 构建面向 Apple Silicon 的原生 Metal 推理实现,通过模型块流式加载、计算复用等方式,在内存占用、生成速度与质量之间提供更灵活的取舍,将本地部署扩展到音视频创作。模型持续进步,社区则继续打磨推理引擎、内存管理和硬件适配,让更多能力在个人设备上真正用起来。

References

[1]

ChatGPT:https://openai.com/index/chatgpt

[2]

LangChain:https://github.com/langchain-ai/langchain

[3]

AutoGPT:https://github.com/significant-gravitas/autogpt

[4]

BabyAGI:https://github.com/yoheinakajima/babyagi

[5]

n8n:https://github.com/n8n-io/n8n

[6]

Dify:https://github.com/langgenius/dify

[7]

LangGraph:https://github.com/langchain-ai/langgraph

[8]

Anthropic 开放电脑操作能力:https://www.anthropic.com/news/3-5-models-and-computer-use

[9]

MCP:https://modelcontextprotocol.io

[10]

Codex CLI:https://github.com/openai/codex

[11]

browser-use:https://github.com/browser-use/browser-use

[12]

Operator:https://openai.com/index/introducing-operator

[13]

Manus:https://manus.im

[14]

Comet:https://www.perplexity.ai/comet

[15]

ChatGPT Atlas:https://openai.com/index/introducing-chatgpt-atlas

[16]

AGENTS.md:https://agents.md

[17]

Agent Skills:https://agentskills.io

[18]

长期任务的 harness:https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents

[19]

Pi:https://mariozechner.at/posts/2025-11-30-pi-coding-agent

[20]

skills CLI:https://github.com/vercel-labs/skills

[21]

skills.sh:https://www.skills.sh

[22]

OpenClaw:https://github.com/openclaw/openclaw

[23]

Codex:https://openai.com/index/introducing-the-codex-app

[24]

Harness 工程的实践:https://openai.com/index/harness-engineering

[25]

GPT-5.4:https://openai.com/index/introducing-gpt-5-4

[26]

agent-browser:https://github.com/vercel-labs/agent-browser

[27]

mattpocock/skills:https://github.com/mattpocock/skills

[28]

Impeccable:https://github.com/pbakaus/impeccable

[29]

Hermes Agent:https://github.com/nousresearch/hermes-agent

[30]

herdr:https://github.com/herdrdev/herdr

[31]

Grok Bot:https://x.ai/bot

[32]

Muse:https://muse.ai

[33]

Jev:https://typesafe.ai/blog/introducing-system-one-models-and-jev

[34]

Laya:https://github.com/NandhaKishorM/laya

[35]

DeepSeek Harness:https://github.com/deepseek-ai/deepseek-harness

[36]

Cordis:https://github.com/cordiverse/cordis

[37]

TypeScript 原生迁移计划:https://devblogs.microsoft.com/typescript/typescript-native-port

[38]

uv:https://docs.astral.sh/uv

[39]

Vite 8:https://vite.dev/blog/announcing-vite8

[40]

Rolldown:https://github.com/rolldown/rolldown

[41]

Oxc:https://github.com/oxc-project/oxc

[42]

Bun 的 Rust 迁移:https://bun.com/blog/bun-in-rust

[43]

Bun 1.4:https://bun.com/blog/bun-v1.4

[44]

pnpm 12:https://pnpm.io/blog/releases/12.0

[45]

pnpm 12.4:https://pnpm.io/blog/releases/12.4

[46]

A2A:https://github.com/a2aproject/a2a

[47]

Cua:https://github.com/trycua/cua

[48]

ds4:https://github.com/antirez/ds4

[49]

h3.c:https://github.com/antirez/h3.c

文章标签智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多