
Meta新研究:字节模型蒸馏后,天花板破了
henry 发自 凹非寺 量子位 | 公众号 QbitAI Token词元替代了Byte字节,但不意味着大模型都得是Token。 字节模型,特别是蒸馏后,有点儿新说法。 最近,来自Meta FAIR和华盛顿大学的论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出了一个...
大模型 方向最近有哪些内容值得看
大模型 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
大模型资讯
3,233
正文图片
13,097

henry 发自 凹非寺 量子位 | 公众号 QbitAI Token词元替代了Byte字节,但不意味着大模型都得是Token。 字节模型,特别是蒸馏后,有点儿新说法。 最近,来自Meta FAIR和华盛顿大学的论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出了一个...
IT之家 9 月 8 日消息,微信 AI 官方在 9 月 4 日宣布,将通用多模态嵌入模型 WeMM-Embedding 开源,包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。 据微信员工 @客村小蒋 分享,微信视觉团队最近开源的多模态模...

27 岁的陈勇超,同时开始了两种新身份。 一边,他于今年 8 月入职清华大学人工智能学院助理教授;另一边,他创办了超衍智能( Apex Intelligence),试图训练一种能够自主研究、持续学习,并在真实任务中自我进化的下一代基座模型。 这家公司成立于 2026 年 6 月,...

林方舟 发自 凹非寺 量子位 | 公众号 QbitAI 机器人学习拧灯泡,如果拧歪了,谁来告诉它问题出在哪,下次又该怎么改? 这正是机器人 “自进化” 让人期待的原因:人类不可能替它示范所有情况,想让机器人越干越好,就需要它有办法评价动作的结果,并从反馈中继续学习。 生数科技最新...

来源:时代周报-时代在线 9月12日,在廊坊举办的2026中国算力大会上正式发布了河北省“人工智能+制造”100个典型案例。其中,以岭药业“基于络书大模型的医药行业智能体规模化应用”成功入选,成为中医药制造业与人工智能深度融合的代表性实践。 2026中国算力大会现场 本次发布的1...
本文来源:时代财经 近日,华为心声社区对外披露了监事会主席郭平与新员工座谈纪要。在该纪要中,郭平回应了人工智能、大模型战略等大众关心的热点话题。他表示,面向未来,华为的核心战略是“聚焦”,即深耕擅长的“连接”和“计算”领域,没有业务扩展计划。华为聚焦于连接与计算领域,但不同业务板...

随着AI浪潮从数据中心向边缘侧和机器人领域蔓延,美光高管警告称,存储已成为决定AI性能上限的最核心瓶颈,而由于新建产能周期漫长且工艺极度复杂,行业供需失衡的局面至少要到2028年后才能迎来实质性的新增产能释放。 9月15日,在Six Five Summit 2026的半导体聚焦论...
根据 OpenRouter 最新数据测算,上周(8 月 31 日至 9 月 6 日)全球 AI 大模型总调用量为 115 万亿 Token,环比增长 1.77%。其中,上榜的中国 AI 大模型周调用量达 56.72 万亿 Token,环比增长 2.83%;同期美国 AI 大模型周...

本文来自微信公众号: InfoQ ,编译:宇琪,作者:Tina 前沿AI模型在回答前会先“思考”,再把加密后的思考过程像密封信封一样交还给用户。前Google DeepMind研究员Ilia Shumailov和ELLIS Institute Tübingen、MPI-IS博士生...

过去一年,具身智能最热闹的争论,不是某个模型的效果有多好,而是一个悬而未决的路线问题:机器人到底该走 VLA,还是走 WAM?两种路线看似针锋相对,内核却指向同一个出处,都建立在数字世界的大模型之上。VLA 是视觉语言模型向动作的延伸,WAM 则把视频生成模型搬到机器人身上。 行...
根据天眼查发布的最新数据显示,我国现存工业大模型相关企业目前已正式突破6.2万家。特别值得注意的是,仅在2026年以来短短的时间内,全国就新注册了相关企业约2.23万家,展现出了极其强劲的发展势头与产业活力。 从地域分布来看,广东、江苏、浙江、上海和北京等地的企业数量位居全国前列...
IT 行业正迎来端侧 AI 算力的爆发期。HP(惠普)于当地时间昨日正式发布了全新移动工作站新品——ZBook Ultra G3a16。这款面向专业极客与高端开发者的重磅产品,凭借顶级的硬件架构与强悍的本地大模型运行能力,引发了业界的广泛关注。 在核心配置上,该机型基于 AMD ...

编辑|山辉 最近,越来越多应用层 AI 企业走上了一条相似的路线: 用自己积累的专业知识和业务经验,训练自己的模型。 就在 8 月,法律 AI 公司 Harvey 发布了其首个经过后训练的开放权重模型 Tenet。它以 Kimi K3 为底座,在法律智能体基准 LAB 上的全通过...

允中 发自 凹非寺 量子位 | 公众号QbitAI 北京中关村学院7名博士生,用一个暑假,从零训练出了一个7B大模型——ZGCM-1。 随后,他们把各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志也开放出来,让每一位感兴趣的研究者都可以追溯、复现整个流程。...

在外滩大会《基座之上:具身智能的场景突围与协同进化》见解论坛上,首届蚂蚁灵波具身大模型挑战赛正式启动。 蚂蚁灵波科技首席科学家沈宇军、蚂蚁灵波科技首席数据科学家黄用韬、魔搭社区运营负责人石洪竺、AMD AI 软件产品及开发者生态总监王宏强、阿里云天池平台负责人崔远征共同为大赛启幕...

卖 GPU 让英伟达成为 AI 时代的大赢家,但英伟达显然不满足于只做算力的供应商。 就在刚刚,英伟达 CEO 黄仁勋正式宣布,公司已经达成协议,将以 129.303 亿美元(折合人民币 868 亿元)收购 AI 开源社区平台 Hugging Face。 官方博客🔗 https...

文 | 象先志 沙特把本国阿拉伯语大模型的开发任务,交给了 MiniMax 。 9月3日,沙特公共投资基金 PIF 旗下的 HUMAIN 发布阿拉伯语模型 HUMAIN-M3。它有4280亿总参数,每个 token 激活230亿参数,使用超过1万亿阿拉伯语 tokens 继续训练...

【数智周报将整合本周最重要的企业级服务、云计算、大数据领域的前沿趋势、重磅政策及行研报告。】 观点 高盛集团CEO:AI应用将显著提高生产力,未来5-10年美经济增速将更高 高盛集团首席执行官大卫·所罗门(David Solomon)最新表示,随着人工智能(AI)在...

每经记者|赵雯琪 每经编辑|余婷婷 近日,OpenAI发布新模型GPT-6 Astra后,用户可以通过该模型控制机械臂的测试视频在社交平台流传,“通用大模型将降维打击具身智能”的声音再起。 9月10日,自变量创始人兼CEO(首席执行官)王潜在2026 Inclusion·外滩大会...
文 | AIX财经(AIXcaijing),作者 | 王璐 雷晶 陈丹 金玙璠 李梦冉,编辑 | 王璐 一名00后研究生还没走出校园,就以实习生身份领着5000元的日薪,这个数字,比不少普通白领的月薪还高。如果毕业转正,年薪甚至可以给到300万。这是AI抢人大战下的真实现状。 据...