
OpenAI发布了新一代语音模型GPT-Live,直接让用户与人工智能的交流更接近人与人之间的日常谈话。

最大的特点在于采用了全双工架构,也就是能够同时进行听和说。在交流过程中,它会通过发出嗯、好的等语气词来表达自己在认真倾听。它支持快速的来回对话,也可以在用户思考时保持安静。
GPT-Live在智慧程度上也有了明显提升。遇到需要联网搜索、深度推理或处理复杂任务的情况时,它会在后台把任务交给更强大的GPT-5.5模型处理。在后台进行计算的同时,GPT-Live可以继续与用户聊天,保证对话流程不中断。未来随着新旗舰模型的推出,后台调用的模型也会持续更新。
语音功能现在还配有视觉辅助。在聊到天气、股票、体育等话题时,屏幕上会同步显示直观的信息卡片。同时,原有的搜索、记忆、图片和文件上传功能依然得到支持。
语音交互的演进
早期的语音AI系统存在明显的局限性。第一代ChatGPT语音功能采用串联式设计,需要先后运行三个模型:先将语音转成文字,再由大语言模型生成文本回复,最后把文本转回语音。这种方式虽然让人们第一次能和AI说话,但中间环节过多导致信息容易丢失,回答也显得迟钝和生硬。
随后出现的高级语音模式虽然减少了延迟,让交流更流畅,但依然属于单向轮流发言。模型必须等到用户完全停止说话后才能做出回应。由于这种机制依赖静音来判断是否说完, 背景噪音或用户短暂的停顿都很容易被误判为发言结束,从而导致不自然的打断。
GPT-Live通过技术调整解决了这些问题。
首先是实现了持续交互。全双工架构让GPT-Live能够连续处理输入并生成输出,每秒可以做出多次决策,决定是继续说话、倾听、暂停、打断还是调用工具。这让AI能够实时翻译,展现更自然的互动。
其次是引入了任务委托机制。当用户提出需要搜索或推理的深度问题时,前台负责保持对话的GPT-Live会将任务派发给后台的GPT-5.5。这保证了前台沟通的即时性,同时又兼顾了后台处理复杂工作的高效。
实际使用体验的变化
用户可以在聊天时随时打断、暂停思考,或者要求AI放慢语速。系统对背景噪音的过滤能力得到了提升,能够更专心地倾听用户的声音,不会轻易被路过的车辆或旁人的闲聊干扰。
除了更聪明的回答,用户现在还可以自主选择推理深度。系统提供了三种选项:适合快速回答的即时模式,以及适合复杂问题、需要预留更多思考时间的常规和高强度推理模式。
版本与上线安排
GPT-Live目前已经开始在客户端和网页端向全球用户推送。
在版本分配上,购买了Go、Plus和Pro计划的付费用户将默认使用GPT-Live-1,免费用户则可以使用GPT-Live-1 mini。
需要注意的是,新模型在部分非英语语种下可能会出现口音或表达不够流利的情况。此外,首发版本暂不支持视频和屏幕共享,但用户依然可以继续选择使用原有的标准和高级语音模式。
one more thing
OpenAI审计了 SWE-Bench Pro,这是最广泛使用的 AI 编程基准之一,发现它不再可靠地衡量前沿编码能力。这个基准之前可以说是各家实验室测试模型代码能力黄金标准。

OpenAI发现该评估在约 70% 的噪声上限处已饱和,因此撤回将其用作领先的编码评估,废除。
为了审计 SWE-Bench Pro,OpenAI使用了基于模型的调查员代理,同时结合了五位独立经验丰富的软件工程师的独立审查。
随着编码模型的改进,评估需要变得更难、更公平、更值得信赖
参考:
https://openai.com/index/introducing-gpt-live/
https://openai.com/index/separating-signal-from-noise-coding-evaluations/
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)







