
在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境
机器之心编辑部 大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。 模型越来越强,Agent 也开始从 “会聊天” 走向 “能干活”。 但模型部署之后呢? 一个 Agent 真正进入从没见过的软件、工具或者企业系统时,问题往往才刚刚开始。新的软件有新的交互逻辑,新的工具...
学术研究 方向最近有哪些内容值得看
学术研究 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
学术研究资讯
1,486
正文图片
7,370

机器之心编辑部 大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。 模型越来越强,Agent 也开始从 “会聊天” 走向 “能干活”。 但模型部署之后呢? 一个 Agent 真正进入从没见过的软件、工具或者企业系统时,问题往往才刚刚开始。新的软件有新的交互逻辑,新的工具...

美国AI(人工智能)实验室开始讨论“踩刹车”。 近日,在多起AI Agent(智能体)越界行为引发关注后,Anthropic前员工公开发出关于“AI末日风险”的警告。随后,Anthropic CEO达里奥·阿莫迪(Dario Amodei)发表一篇千字长文,呼吁行业放缓提升前沿模...

知识分子 The Intellectual 视频:PhAI Labs发布的ScienceBuddy,可以做什么? 撰文|张天祁 ● ● ● AI已经能够写代码、证明数学定理,为什么它还没有真正成为一名科学家? 这是AI for Science 面临的一个困难的问题。 在棋类中,A...

编者按:本文来自微信公众号 硅谷101,创业邦经授权发布。 你相信,我们其实生活在一个虚拟世界中吗? 马斯克曾在Lex Fridman的采访中被问到:如果有一天人类实现AGI,并且只能向它提出一个问题,他会问什么? 思考了十秒之后,他给出的答案是: “What's outside...

Benchmark 不再只是给模型「出题打分」,而是逐渐成为连接模型能力、真实任务与科学进步的测量工具。从真实工作流、长期任务到多模态交互,从任务完成度到过程与结果验证,新一代基准正在从单一分数走向更加细粒度、可诊断的能力评估。它不仅告诉我们模型有多强,也开始回答模型为什么失败、...

在“AI泡沫论”再起之际,长期资本反而在对模型公司持续下注。 Anthropic今年5月的融资中,出现了GIC、资本集团等全球机构;富达、淡马锡则同时出现在Anthropic和OpenAI今年的融资名单里。 中国的智谱,最近也吸引了“长钱”加注。9月13日,智谱公布约50亿美元的...

你重生了。 上一世,你左手ChatGPT,右手Claude,领导给的什么方案,你都能完成得又快又好。 这一世,你睁开眼,一切都很正常。 你打开浏览器,刚刚还在运行的网页版 GPT 已无法响应。你刷新了一下,返回404 not found。你又切到 Claude,发现号被封了,你气...

上证报中国证券网讯(记者 徐子逸)近期,关于AI减速的议题在硅谷掀起了热潮,Meta CEO马克·扎克伯格也加入了这场讨论。9月16日,扎克伯格在个人社交媒体平台发文称,AI实验室有责任和动力按照安全训练模型所需的节奏推进,并且有能力自行采取措施保障安全。扎克伯格提及Meta延迟...

文章转载于洞察Beating 文|Sleepy 当前围绕人工智能所涌现的恐慌与狂热,本质上共享着一套高度功利的叙事生产机制。 资本在幕后采购叙事、操纵情绪并驱动分发,再顺理成章地将公众的普遍焦虑,兑现为制度化的监管权力、政治资本,以及资本市场上不断推高的估值溢价。 2026 年 ...

一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见“人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作”与“重建真实交互”仍是两回事。一个视觉上准确坐在椅子上的...

智猩猩AI整理 编辑:知知 用大模型扮演真实人类用户,正在成为学术界与工业界共同关注的前沿方向。无论是推荐系统的离线策略验证、电商广告的转化率预估,还是社会仿真与人机交互评估,用户模拟任务都扮演着重要角色。 然而,所有下游应用都依赖同一个前提:大模型模拟的用户必须足够逼真。 现实...
感谢IT之家网友 xxy171070 的线索投递! IT之家 9 月 14 日消息,据泰尔终端实验室,近日,中国信息通信研究院(以下简称“中国信通院”)依据《端云协同机密计算技术规范》开展专项能力测评工作。本次测评围绕端云机密计算环境构建、透明日志审计机制、业务应用信息隔离防护、...

C114讯 9月16日消息(岳明)近期,关于诺基亚将对贝尔实验室(Bell Labs)进行大规模裁员的消息传得沸沸扬扬。曾执掌贝尔实验室的Marcus Weldon公开发文,对此表达了强烈担忧。来自LightReading的最新报道梳理了这一事件的来龙去脉,并通过对Marcus ...

论文标题:Rethinking the Evaluation of Harness Evolution for Agents 论文链接:https://arxiv.org/abs/2607.12227 代码:https://github.com/rethinking-harnes...

2026首届中关村科学城光子产业生态大会暨“实创杯”产业加速大赛启动发布会举行。 当前,信息处理技术正经历从“电”到“光”的深刻变革。随着人工智能爆发、算力需求成倍增长,电子芯片正在逼近物理极限,光子芯片凭借低功耗、高速率、大带宽的优势,成为破解算力瓶颈的关键路径,光子产业成为下...

AI 正在进入数学世界的深水区。 就在刚刚,OpenAI 宣布,其内部 AI 系统完成了对纳维尔斯托克斯(Navier-Stokes equations)存在性与光滑性问题的一个解答,并同时公开了相关论文以及 Lean 形式化证明。 纳维尔斯托克斯方程不仅是千禧年大奖难题之一,也...
(本文作者为 韩工观察,钛媒体经授权发布) 文 | 韩工观察 要毁灭人类的,不是AI,是人。 这个判断基于两个可验证的论据。其一,截至2026年9月,没有任何AI系统具备"自定目标"的能力,而这是"递归自我改进"(RSI)得以启动的前提;前提不存在,后面的指数爆炸、超级智能、文明...

编辑|Panda 上周六,陶哲轩、邓煜、彼得·舒尔茨等 25 位菲尔兹奖得主联合发表了一份声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩还表示「事态紧迫」,他们根本没有时间等待更广泛的协商就决定先行发布。 这封信并不反对 AI 进入数学,而反对的是 AI 公司把「攻克著...
AI的意义就是解放人,这当然也包括解放数学家。 ▲近日,邓煜、陶哲轩等25位菲尔兹奖得主联名发了一份声明,措辞严厉地警告AI行业。图/封面新闻 文 | 刘远举 AI对数学界的冲击正在加速蔓延。 据新京报报道,近日,邓煜、陶哲轩等25位菲尔兹奖得主联合发布了一份名为《人工智能在数学...