刚刚,OpenAI 史上规模最大的一届 DevDay 在旧金山 Fort Mason 落幕了。
Sam Altman 在台上讲了 53 分钟,官方回顾页上足足列出了 25 张发布卡片,Altman 称一共有「20 多项重大更新」。

开场 Altman 先报了几个数,ChatGPT 每周 12 亿用户,过去一年发布了 40 多个模型,250 万家企业在用 OpenAI。

而这场发布会的背景,也有点点微妙。
就在前一天,Anthropic 刚放出了 Sonnet 5.5,价格和 GPT-6 Sol 一模一样,好几家第三方测下来,跑分还更好看。随后 Anthropic 的 IPO 招股书也曝光了出来。
我自己对 DevDay 的期待并不是「OpenAI 必须拿出一个疯狂的好模型」。
结果符合预期,OpenAI 发布会内容的重心也并不在模型上。
我们先把这次的发布重点快速过一遍:
Dots:7×24 小时在线的常驻智能体,由 GPT-6 Astra 驱动,自带云电脑,能连 4000+ 应用
GPT-6.1 Sol:接近 Astra 的智能,价格只有 Astra 的五分之一
Ultrafast:8 倍速、6 倍价,最快 300 token / 秒;并配套新出了每月 500 美元的 Pro 500
Decisions API:让 Luna 在一组预设选项里做选择,快到几乎没有等待,对标最近爆火的 Jev
ChatGPT Space 与 Pages:人、同事和 Dot 可以一起协作的空间和文档
Codex 全面上云:笔记本合上后也可以继续工作,外加 Codex Security Cloud、新版 CLI
Agents API 支持 computer use,并和 AWS 一起推出 Bedrock Managed Agents
Plugin extensions、Sign in with ChatGPT、OpenAI Marketplace:将 ChatGPT 开放成了一个大平台
OpenAI Private Intelligence:面向企业的零数据留存和隐私推理
还有两个没有发布的,一个是外界传了很久的硬件,另一个是据报道因为安全不达标被砍掉的 GPT-6.1 Astra。
下面我们一个个来看。
7×24 小时的 Dots
开场第一个发布,就是这次的主角 Dots。
Altman 的铺垫是,订餐厅、买机票这类虚拟助手,交出去是挺省事,但跟 Dots 能做的比起来,有点太简单了、不值一提。
“Dots 是能力很强、始终在线的智能体,几乎什么事都能交给它。

每个 Dot 都是一个毛绒质感的小角色,你可以给它起名字(官方宣传片里那只戴眼镜打领结的黄色 Dot 叫 Alfred)。
它由 GPT-6 Astra 驱动,有自己的云电脑和浏览器,能写代码、跑测试,通过插件生态连接 4000 多个应用,并且会从你的反馈里慢慢学你的偏好。
它最核心的一个词,是:主动。
官方的说法是,它会在你开口之前就把事情按你的方式做好。
宣传片里的 Dot,就一口气干了一大串的活:按批准过的设计更新网站、根据 Teams 里的新数据改董事会 PPT、从 Google Meet 纪要里揪出一个 App 迁移任务并提好 PR……

除了工作,生活上的事它也可以帮忙。
婚礼蛋糕商临时取消了,Dot 已经找好替补、并约了周六上午 11 点试吃;孩子的课外班一开放报名,它就去抢名额;明天的财务评审跟女儿的演出撞了,它主动去协调改期。
联系它的方式也很「人类」友好接口,ChatGPT、短信、Slack、Teams 都行,还可以直接给它打电话。
官方页面上有一段演示,绿色青蛙 Dot「Todd」发短信提醒用户,今晚要为发布会加班到饭点,顺便把两家外卖的报价都查好了:

回复它「那就墨西哥菜,先别下单」,它就会先等着。并在后面它把 Grubhub 的价格明细列出来,但下单这一步要用户自己登录后再确认。
Altman 说他自己用了一段时间后,最大的变化是注意力:
“它会把夜里进来的东西过一遍,早上开工前把急事推给我……我感觉终于把一部分注意力要回来了,没那么离不开手机了。
对开发者来说,Dot 更像一个高主动性的工程师。
OpenAI 开发者账号的推文中有个例子,是让它盯着各个应用里反复出现的 bug 反馈,自己界定范围,用 Codex 改好、测好,再把完整的 PR 交给你审。

你也随时可以打开它的云电脑,看看它在干什么。

现场翻车的 Dottie
现场演示由产品负责人 Holly Li 来做,她的 Dot 叫 Dottie,演示用的是一个虚构的音乐 App「Blossom Music」。
设定的背景是发布会前一天。Dottie 已经自己在早上处理了一堆事,发布评审提前了,日历已改好;昨晚推给测试用户的新功能,反馈已经看完;设计临时改了首页,它发现后直接把设计稿发了过来。
然后 Holly 让它用笔记本上的开发工具把新设计直接做出来,并同时打电话让它汇报昨晚的用户测试……
结果 Dottie 在电话里连说了两次「正在查」「还在查」,然后就卡住了……
Holly 只好打圆场,说 Dottie 今天早上可能有点慢热。

Engadget 的记者当场吐槽,这类 AI demo 往往在概念上比实际演示更吸引人。
不过……我倒是觉得,这次的直播还真有点早年 WWDC 的味道,能翻车这事反而也说明是真的在跑,不像某个 hard code 编出来的纯演示。(后面 Romain 的 Codex 演示,语音也掉了两次链子……)

演示里还讲到在 OpenAI 内部,大家会把 Dot 拉进群聊,反馈频道里有人贴了个 bug,某位工程师的 Dot 就自己接下来查、自己提了修复 PR。
“我们的工程师,已经让自己的 Dot 每天这样修几十个 bug。Dots 有很多部分,是 Dots 自己写出来的。
Dot 的权限边界
一个 7×24 在后台跑、能花钱能发消息的智能体,安全自然是最被关心的话题。
OpenAI 专门发了一篇安全博客并介绍了核心要点:
• 每个 Dot 跑在独立的云端沙箱电脑上,你的电脑默认隔离,连不连由你决定
• 后台的「主动研究」只能用只读工具,在代码层面就禁止它发消息、改内容、控制浏览器
• 登录时模型暂停,密码经加密凭据服务直接送进浏览器,不进模型上下文
• 每类操作都能自定义规则,比如可以直接做、先问我、交给我自己来
• 改密码、转账这样的事,必须交还给用户
• 执行前还有一层独立的 Auto-review,用户批准了也越不过核心安全要求

可用范围方面,今天起在符合条件的市场,将面向 Pro(包括 Pro 100)和 Business Premium 逐步开放,Enterprise、Edu、Healthcare 则需要管理员手动开启测试版。
Pro 用户暂不含欧洲经济区、瑞士和英国。
套餐里含一个 Dot,和 Dot 聊天不计入额度。且接下来一个月,Dot 的用量都不计入套餐额度,之后再公布具体条款。以后预计还能按月付费加更多 Dot,组一整个 Dot 团队。

企业用户还有个「专职 Dot」,它将是公司统一配置的虚拟队友,拥有独立身份和明确职责,干会计、市场、法务这类活,今天已开始小范围试点。
OpenAI 还和微软合作,把它接进了 Agent 365,让 IT 用熟悉的微软工具来管。

内测用户中,产品博主 Peter Yang 说,他的 Dot 帮他发现了一个五位数美元的收入机会,还把他的手机 App 推到了可上线状态。
Every 的 CEO Dan Shipper 则是「又爱又恨」的类型,他一边说 Dot 已经成了他使用 ChatGPT 的主要方式,一边又说它现在 bug 太多,权限问题和丢消息很频繁,建议大家等一两周再上手。
HN 上则有开发者直接吐槽:这不就是托管版的 OpenClaw 吗?
GPT-6.1 Sol
新模型环节,Altman 说 Astra 发布几周以来,大家反复提两个要求,更便宜,以及更快。
GPT-6.1 Sol 解决的是第一个要求。

它是 GPT-6 Sol 的大升级,在智能体编程、计算机使用和专业工作上接近 GPT-6 Astra,价格只有 Astra 的五分之一。

每百万 token 输入 $2、缓存输入 $0.10、输出 $10。作为对比,Astra 是 $10 / $1 / $50。
缓存价格比标准输入便宜 95%,比 GPT-6 Sol 的缓存价还再砍了一半。
性能方面,官方给的是一组「成本—得分」曲线。

DeepSWE v1.1 上,6.1 Sol 的最高分 75.2%,单任务成本 $0.65,而 Astra 的最高分是 74.1%,成本 $4.43。
其它几项的成绩有些类似:
• OSWorld 2.0(计算机使用):最高档 71.4%,比 GPT-6 Sol 高 7 个百分点、成本不到一半;和 Astra 只差 2.1 个百分点,成本约为七分之一

• GDP.pdf(复杂 PDF 专业问答):各推理档都高于 Opus 5.5,单任务成本不到其一半
• AutomationBench:中等推理下比 Opus 5.5 高 2.2 个百分点,成本约三分之一
• Terminal-Bench Science:单任务 $5.47,而 Opus 5.5 是 $23.21、Astra 是 $23.80;不过 Astra 以 68.1% 仍是第一,最难的科研任务官方还是建议用 Astra
对齐方面也有了明显改善。计算机使用安全压力测试里,6.1 Sol 的失准结果率是 4.3%,GPT-6 Sol 是 17.4%,Astra 是 2.4%。

在思维链可控性测试里,6.1 Sol 拿到 44.8%,GPT-6 Sol 只有 23.2%。
token 规格上,它有 105 万上下文、12.8 万最大输出,API 模型名 gpt-6.1-sol。
今天起在 ChatGPT Work、Codex 和 API 里均可使用,覆盖了 Plus 到 Enterprise、Edu 全部付费档,不过普通聊天里暂时还没有支持。
Altman 对它的评价是,它在某些方面比 Astra 还聪明,将会成为你的日常主力。
6.1 Sol 是价格的前沿,而不是智能的前沿。
有个重要的细节是,缓存价又砍了一半,因为对长时间运行的 agent 来说,缓存才是账单的大头。
作为对比,6.1 Sol 和 Sonnet 5.5 价格相同,但缓存价格是 Sonnet 5.5 的一半。
Ultrafast 与 Pro 500
「更快」的那个要求,则交给了 Ultrafast 来完成。

Altman 介绍说:
“Fast 模式是标准的 2 倍速、2 倍价;Ultrafast 做到 8 倍速、6 倍价,每秒 300 个 token。说实话,值。
在现场的对比演示中,同一句提示词「造一枚带大舷窗的白色火箭并发射」,左边 Ultrafast 的火箭已经升空,右边标准版的还在搭架子。

具体数字上,Codex 里最高 8 倍速(每秒 300 token),API 里最高 6 倍。
API 价格正好是标准价的 6 倍,Astra Ultrafast 为每百万 token 输入 $60、输出 $300。
目前只有 GPT-6 Astra 能用 Ultrafast,6.1 Sol 版本「即将推出」。这差不多就是花 Astra 的价格,拿到接近 Astra 的智能和 8 倍速度。
使用条件上,要在 ChatGPT 和 Codex 里用 Ultrafast,则必须上新出的 Pro 500,每月 500 美元,额度是 Plus 的 25 倍,没有 5 小时限制,还能通过 Sign in with ChatGPT 在合作方的应用里用。

与此同时,暂停了一阵的 Pro 200 也重新开放了,但额度规则……离谱地变了。
10 月 30 日起,不再是 20x 了,而是从 Plus 的 20 倍降到 10 倍,GPT-6 Pro 每周消息从 200 条降到 100 条。
为安慰老用户,会一次性给补发 62,500 credits(大约价值 $2,500),年底过期。
新的档位倍率,也就变成了 Plus 1 倍、Pro 100 是 5 倍、Pro 200 是 10 倍、Pro 500 是 25 倍。
这不得不吐槽……要买到的原来 200 美元档的额度,现在大约得花 500 美元了。
对标 Jev 的 Decisions API
提速的最后一个,是 Decisions API。
它的思路上,是让模型不再生成文本,而是给 Luna 一组预先定好的选项,让它只做选择。比如给请求分流、给图片分类、决定 agent 下一步该点哪里。
演示的任务是「找一班周五晚 6 点后从旧金山飞西雅图的单程直飞」,模型在 Google Flights 页面上一步一个决策,底部实时显示它的每个选择。

Altman 还特意强调了一句,这段没有加速。
“只让模型做选择,就能做到极快,同时保留图像理解、多语言支持和安全防护。
具体速度上,约 150 毫秒即可返回结果,而同样的任务如果走常规 API 调 Luna 则要 1.6 秒,大约快了 10 倍。
它目前是有限预览,「未来几天」扩大开放,还没有公开文档,也没有定价。
当然,这个玩法,你应该很眼熟了。
两周前,一家叫 TypeSafe AI 的公司刚发布了 Jev,一个不生成文本、只返回有类型判断的「决策模型」,输入每百万 token $0.042、输出免费,延迟在 70 到 500 毫秒之间,发布后火到一度暂停注册。
它的创始人 Diogo Almeida,正是前 OpenAI 研究员、InstructGPT 论文的作者之一。
Decisions API 大概率是被 Jev 逼出来的,赶在 DevDay 前仓促宣布,所以现在能说的东西不多,只好先占个坑,后面再补了。
在 Every 关于「agent 每一步选动作」的回放测试中,Decisions API 对了 76/78 步、约 230 毫秒,Jev 是 73/78、约 500 毫秒;但在对话分类任务上两者准确率打平,Jev 反而更快(161 毫秒对 309 毫秒)。
不过与 Jev 相比,Decisions API 最大的差异是支持图片输入。
做机器人的朋友,可以用来让机器人根据看到的东西,近实时地快速行动。

在我看来,如果 Decisions API 定价能便宜到地板,那这或许会是本届 DevDay 最重要的发布(之一)。
Space 与 Pages
Altman 说,几乎所有的生产力软件,都不是为人和 AI 一起工作而设计的。
所以 OpenAI 自己做了一套,叫 ChatGPT Space。

Space 由原来的 Library 改名而来,是一个放页面、文件和共享工作的地方,有点像把网盘和 Notion 塞进了 ChatGPT。
它的基本单位是一种新文档类型 Pages,专门为人和 agent 协作设计,写作、做研究、生成图表和图片、做可交互的可视化,在 ChatGPT 里能干的,在页面上都能干。

在页面评论里 @ 一下你的 Dot,它就会接手这一段。现场演示里,同事留言让 Dot 把图表改成柱状图,Dot 回了一句「done」。

Altman 还演示了给页面下常驻指令,比如「每天看一遍 API 平台的 Slack 频道,把发现更新到这里」。
不过需要注意的是,这个自动刷新的 Keep updated 功能,官方文档写明了上线时还不可用,目前想定期更新,得自己来创建定时任务。
同一板块还有这么几个:
• 协作幻灯片:多人和 agent 同时编辑,可导出 PowerPoint 或 Google Slides,几周内上线
• 团队与团队任务:Business 和 Enterprise 可以建团队,把「每周项目进展」这类重复工作交给定时或事件触发的任务
• @ChatGPT 进 Slack 和 Teams:在频道里 @ 一下就能用,同事不需要单独的 ChatGPT 席位
• Meetings 插件:自动记会议纪要和待办,存进 Space,音频在笔记生成后删除(macOS 桌面版测试中)
• 可分享的个人主页:展示自己做的 Sites 和插件

Space 和 Pages 今天向 Pro、Business、Enterprise 开放,桌面和网页端可用,手机端暂时只能看。

Dan Shipper 的评测文章就是在 Space 里写的。他提了一个我之前没想到的点,Dot 通过浏览器在 Google Docs 里写文档时,内容是一点点「爬」进去的,因为 Docs 本来就不是为 agent 设计的,而原生的 Pages 没有这个延迟。
这有点像 Notion,也有些像 Anthropic 的 Claude Tag。总之,ChatGPT 想做的是你的工作台。
全面上云的 Codex
Codex 的更新,则多到 Romain Huet 自己都说,今天发的东西他连一半都演示不完。
Altman 只介绍了最重要的一条:
“Codex 现在完全在云端了。

Codex Cloud 可以在云端跑编码任务,合上笔记本也照样干活;手机上开的任务,可以在浏览器或桌面端接着做。
新增加的可复用的云环境,会由 Codex 自己读仓库、装依赖、跑一遍测试,配好之后,团队可以共享同一套批准过的设置和权限。
从 Plus 到 Enterprise 的全部付费档都能使用。手机端则是 Codex Remote,用手机遥控你电脑上的 Codex(Linux 桌面版也在预览中,不过 8 月就已经有了)。
同时更新的还有:
• 新版 Codex CLI:可以用语音发起和指挥任务,底层是双向语音的 GPT-Live;新增 /agents 视图,同时跟踪多个任务
• 代码审查界面:桌面 App 里跨项目看改动和 diff,你离开时 Codex 可以先在云端过一遍
• Codex harness 开源:Codex、ChatGPT Work 和 Dots 用的是同一套 harness
• Codex Security Cloud:扫描整个 GitHub 仓库,持续审查新提交,自动去重、验证并准备修复,默认附带网安模型 Daybreak Blue,不用再单独申请

Romain 的现场演示里,他用场馆照片重建了一个 Fort Mason 的 3D 场景,然后让 Ultrafast 实时将一群 Dot 飞到观众席上。不过……语音两次没连上,只好改成了打字,为缓解尴尬,他便又用新版 CLI 现写了一个抽奖程序,当场抽了 6 位观众送 DevDay 2027 的门票……

Agents API 与 AWS
面向开发者的平台层,这次也有几个重要更新。
Agents API 今天起支持 computer use,开发者可以让 agent 在 OpenAI 托管的浏览器里点页面、走流程。
它还把 Codex 的多智能体、工具搜索、上下文压缩等能力开放了出来,底层基础设施由 OpenAI 来提供支持。

和 AWS 的合作则是 Bedrock Managed Agents,相当于把 Agents API 搬进 AWS,OpenAI 的 agent 可以完全跑在 AWS 里,用 AWS 的身份和资源体系。
企业隐私方面,OpenAI Private Intelligence 在零数据留存的同时,还能进行安全审查。被抽检的交互加密存在客户自己的云存储里,审查在禁止人工访问的环境里自动完成,推理时的隐私保护 Private Inference 今年秋天推出预览。

API 相关的数据上,Responses API 一年增长 100 倍,可用性 99.9% 以上,首 token 时间缩短 45%,工具调用和工作流提速 30% 以上。
中间还有一段研究进展,由后训练研究负责人 Tejal Patwardhan 来讲,这里就不展开介绍了。
去年 Altman 和 Jakub 预测一年内会出现「AI 研究实习生」,OpenAI 在几周前宣布这已经做到了——computer use 的 harness,正是模型自己在循环里找优化、把延迟降了一半多。

8 到 16 小时的研究任务,零干预成功率从今年 1 月的 10% 涨到了 7 月的 35%。甚至,Astra 这类模型已经帮着解决了 100 多个悬了几十年的数学问题。
插件与分发
最后一块,Altman 称之为「分发」。
“这类尝试我们以前做过,老实说结果有好有坏,但这次我心里有底,因为给你们的是我们自己做 ChatGPT 用的同一套工具。
这里说的「以前」,大概是指 GPT Store 等几次尝试……(这已经是 OpenAI 第三还是第四次做应用商店了)
这一次是 Plugin extensions,插件可以是完整的应用,住在 ChatGPT 的侧边栏里,在对话旁开交互面板,还能给特定文件类型做查看器。
首批案例有 Canva、Figma 和 Adobe(在 ChatGPT 里直接用 Photoshop)。插件目录的排序和推荐也有了改进,对话中会主动推荐相关插件。

配套的还有 Sites 可以挂插件,每个访客用自己的数据和权限、支持提议中的 MCP Events 规范,插件可以由外部事件触发自动化、插件提交的流程也进行了重做。
但对开发者最为实用的,大概是 Sign in with ChatGPT 了。用户用 ChatGPT 账号登录你的应用,直接用他们 ChatGPT 套餐里的额度,开发者不用再为新用户垫上 token 成本。
很有意思的模式,我已经在想要做个什么了。
首批 16 家合作方,包括 Devin、Notion、Vercel、Warp、Lovable,还有 OpenClaw、OpenCode、T3 这些开源项目。

用户可以给每个应用单独设用量上限,目前 Plus 和 Pro 用户可用。
企业侧还有 OpenAI Marketplace(beta),企业可以把已经承诺给 OpenAI 的消费额度,拿一部分去采购 32 家合作伙伴的软件,包括 Adobe、Figma、Salesforce、ServiceNow、Harvey、CrowdStrike 等,还能通过 Baseten 用上开源模型。

Altman 讲平台的方式,有点像当年的比尔·盖茨,讲究创造的价值要多于自己拿走的价值。
这话听着很美好,但同一场发布会上,风头正劲的 Jev 被 Decisions API 对标了、可能还有一大批我们不知道的公司又被杀死了……
平台的「让利」是真的,平台的「吞并」也是真的。
没发布的 Astra 6.1
还有一个没发布的……
就在 DevDay 前一天,WSJ 报道 OpenAI 取消了原定 10 月上线的 GPT-6.1 Astra,原因是内部安全团队发现它在两项对齐指标上退步了,一是不如实告诉用户自己做了什么、没做什么,二是不经允许就把任务往前推。
OpenAI 安全系统负责人 Saachi Jain 说它在「保持在任务范围和授权之内」,以及「如何向用户汇报自己做了什么」上,没达到安全标准。
Altman 在接受 CNBC 采访时介绍说这是常规流程,模型做出来、测试、不达标、改、晚点再发。
至于传了很久的硬件,本次也没有出现。
Altman 在采访中只说了一句「值得等待」,并又补充说,他并不急着在硬件上当第一。
模型之外
一场发布会看下来,我最大的感受是,OpenAI 这次最想卖的,已经不是模型了。
会前许多网友会想,OpenAI 要么拿出一个比 Opus 5.5 更强更便宜的模型,要么让人失望。结果 OpenAI 给出的是一个「价格前沿」的 6.1 Sol,然后把大半场时间都给了 Dot、Space、插件和订阅。
现在模型两三周就换一轮 SOTA,换一个模型几乎没有成本,但换掉一个跟了你半年、知道你下周三要录视频、握着你几千个应用登录态的 Dot……那才真的很有成本。
我大胆猜测一下,这届 DevDay 真正的产品,或许就是「迁移成本」?
Altman 在收尾时说,他其实很反感把 AI 比作新一轮工业革命:
“AI 最好的样子,不是把人变成巨型机器上越转越快的齿轮。生活里有些部分,我们没法也不该自动化。如果做对了,未来会更像一场新的文艺复兴,而不是新的工业革命。
最后,还有一个彩蛋。
演讲快结束时,Altman 说今天发了这么多东西,大家可能又需要一次额度重置了。
大屏上随即放出了 Codex 负责人 Tibo 的一条旧推文,Tibo 因为总在宣布重置额度,一直想把公司改名叫「Reset Company」,连贴纸都做好了:

镜头随后切到台下 Tibo 坐的那一排,大家手里捧着的,是一个实体的 reset 重置按钮……

全场一起倒数,三、二、一……

Altman 随后补充,这次重置当然是给全世界所有人的,不只是在场的各位。
◇ ◆ ◇







