
打破SWE-bench唯分数论,首个独立测量harness的基准开源了
编辑|杨文 编程 Agent 的评测,一直是本糊涂账。 SWE-bench 如今已成事实标准,几乎每家发布新模型或新 Agent 框架,都会拿出一个 SWE-bench 分数来证明自己有多强。 但这些数字真的能直接横向比较吗? LLM Agent 的能力,本质上是模型和 harn...
学术研究 方向最近有哪些内容值得看
学术研究 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
学术研究资讯
1,671
正文图片
8,339

编辑|杨文 编程 Agent 的评测,一直是本糊涂账。 SWE-bench 如今已成事实标准,几乎每家发布新模型或新 Agent 框架,都会拿出一个 SWE-bench 分数来证明自己有多强。 但这些数字真的能直接横向比较吗? LLM Agent 的能力,本质上是模型和 harn...
这项由香港科技大学(广州)、IDEA研究院与DataArcTech联合开展的研究,以预印本形式发布于2026年6月6日,论文编号为arXiv:2606.08348,感兴趣的读者可通过该编号检索完整论文。 一名经验丰富的老医生,跟刚入职的实习医生最大的区别是什么?不是脑子更聪明,也...
这项由香港大学、京东Joy Future Academy、香港中文大学、北京大学、复旦大学、清华大学、香港科技大学及密歇根大学联合开展的研究,以arXiv预印本形式于2026年6月8日公开发布,论文编号为arXiv:2606.09803。 你有没有想过,如果一个AI摄影师正在拍一...

中科大研究团队投稿 智猩猩AI整理 工具集成推理(Tool-Integrated Reasoning, TIR)已成为大模型Agent解决复杂任务的主流范式。然而,当前TIR的评估长期以准确率为主导,效率评估则停留在工具调用次数或生成token数等粗粒度指标层面。 这类指标难以反...

腾讯前沿科技论文解读专栏,在代码与商业的交汇处,寻找AI的确定性。 文|博阳 编辑|徐青阳 自从Jared Kaplan 等人在 2020 年画出那条幂律曲线,Scaling Law 就成了大模型时代最重要的经验法则。参数越大,模型越强,成了定理。 但在 2024 年,百川智能发...

现在,用 AI 生成一张机器人图片并不难。 输入一句描述,几秒钟后,屏幕上就能出现机械蝎子、狮鹫,甚至一台从游戏里走出来的半人马机器人。 但从画出来到做出来,可以说差了十万八千里吧! 这中间棘手的事很多。电机装在哪里?关节转动时会不会碰撞?零部件能不能承受扭矩?结构是否适合 3D...
这项由英国剑桥大学与法国AI公司Mistral AI联合开展的研究,以预印本形式于2026年6月发布在arXiv平台,编号为arXiv:2606.09380。感兴趣的读者可以通过该编号检索完整论文。 一、先从一个让人头疼的训练困境说起 教一个AI学数学,最直觉的方法就是让它反复做...

IT时代网6月15日消息, MiniMax宣布开源其原生多模态旗舰模型MiniMax M3权重,同步发布MSA(MiniMax Sparse Attention)技术论文。M3总参数428B、激活参数23B,是首个从Step 0开始做多模态混合训练的开源模型,在Artificia...
这项由密苏里科技大学与德雷塞尔大学联合开展的研究,于2026年6月以预印本形式发布在arXiv平台,编号为arXiv:2606.06843。研究团队系统性地分析了GitHub上超过三万五千条与AI工具相关的代码注释,时间跨度从2022年12月(ChatGPT首次发布)延续至202...

谈及具身智能,业界习惯于聚焦大模型的规划能力和机械臂的执行精度,却往往低估了人类手部感知这一更基础、也更复杂的问题。 无论是拿起一枚硬币、拧动一颗螺丝,还是快速敲击键盘,你的手正以人类进化数百万年打磨出的方式在运作——二十七块骨骼、数十条肌腱、数百个神经末梢密切协同,在毫秒级的时...

腾讯混元投稿 智猩猩AI整理 生成式奖励模型(GRM)依托思维链(CoT)提升大模型评估能力,但现有方案存在两大痛点: (1)效率低下:对所有输入强制执行完整CoT推理,简单问题也消耗大量算力; (2)评估不准:依靠多数投票筛选推理结果,无法区分 “逻辑严谨的正确答案” 与 “瞎...
这项由香港理工大学研究团队完成的研究,以预印本形式发布于2026年6月8日,论文编号为arXiv:2606.09585,感兴趣的读者可通过该编号查阅原始论文。 人类用语言思考已经司空见惯,但如果有一天,AI不再用文字"想问题",而是直接用图片来推理呢?这个听起来有些奇特的想法,正...

作者:田小幺 编辑:李宝珠 转载请联系本公众号获得授权,并标明来源 AGI 未必是终点,更可能只是 AI 跨过人类平均水平之后,一个新阶段的开始。 过去十年,人工智能的发展速度不断刷新人们的预期。曾经还停留在科幻设想中的 AGI,正在成为许多大型 AI 机构面向未来十年的明确目标...

以 LoRA 为代表的参数高效微调(Parameter-Efficient Fine-Tuning,PEFT)已成为大模型适配与后训练的主流选择。相比全量微调,PEFT 仅更新少量参数,训练开销更低,也更容易在不同任务间快速部署。 然而,在 PEFT 方法的评测中,目标任务性能仍...
这项由不列颠哥伦比亚大学(University of British Columbia)与独立研究者合作完成的研究,以预印本形式发布于2026年6月,论文编号为arXiv:2606.06622,有兴趣深入了解的读者可通过该编号查询完整论文。 **当AI被要求"随机"时,它到底做了...

近期来自南方医科大学南方医院、香港理工大学和中山大学的研究团队在《自然-健康》发表了论文 “疾病筛查中人工智能与人类协作模式的成本效益分析” (Cost-effectiveness analysis of human–AI collaboration in disease scr...

IT之家 6 月 15 日消息,美国加州大学圣地亚哥分校(UCSD)的研究人员与谷歌合作,将老旧的 Pixel 智能手机回收再利用,改造成低成本的数据中心。谷歌研究院表示,退役手机属于“隐含碳排放”(embodied carbon)范畴,即设备制造过程及其碳足迹所对应的碳排放。事...

编辑|杨文 编程 Agent 的评测,一直是本糊涂账。 SWE-bench 如今已成事实标准,几乎每家发布新模型或新 Agent 框架,都会拿出一个 SWE-bench 分数来证明自己有多强。 但这些数字真的能直接横向比较吗? LLM Agent 的能力,本质上是模型和 harn...

一个当前还能稳定完成任务的 Agent,在经历几轮系统版本更新之后,还能否继续保持可靠? 真正的难点,在于它需要适应不断变化的环境。过去的大多 Agent 基准默认面对的都是静态环境 , 但接口、规则、代码库和用户偏好都可能持续变化,因此很难评估 Agent 在持续演化环境中的可...
该图片使用了AI生成技术 整理 | 华卫 作为 Anthropic 有史以来向公众发布的最强 AI 模型,Fable 5 仅“上线”了短短三天。它在聊天机器人竞技场排行榜上登顶,在编程基准测试中以两位数的优势碾压 OpenAI 的 GPT 5.5,并首次让付费订阅者接触到 Myt...