
用125亿分之6的参数,打平3970亿的旗舰模型
2026年初,如果你去看开源大模型的排行榜,会发现一件挺反常的事。 通义千问团队刚发布的Qwen3.8-Flash-Next,总参数125B(十亿),但每个token实际只激活6B。这个数字放在整个模型家族里显得有点寒酸,因为它要对标的,是上一代397B总参数、17B激活参数的旗...
大模型 方向最近有哪些内容值得看
大模型 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
大模型资讯
3,445
正文图片
13,925

2026年初,如果你去看开源大模型的排行榜,会发现一件挺反常的事。 通义千问团队刚发布的Qwen3.8-Flash-Next,总参数125B(十亿),但每个token实际只激活6B。这个数字放在整个模型家族里显得有点寒酸,因为它要对标的,是上一代397B总参数、17B激活参数的旗...

作者 | 荣智慧 编辑 | 向现 唯物的中国芯片产业深度观察 9月9日,深度求索委托中信证券筹备科创板IPO的消息被证实。创始人梁文锋合计持有约78%的股权。若公司市值“按计划”突破1万亿元人民币,梁文锋资产约为7800亿元,将超过现首富、字节跳动创始人张一鸣(资产约5429亿元...

大模型肉搏战的另一面。 文|魏琳华 编|刘俊宏 七、八、九三个月,大模型行业像打了鸡血。 从海外“御三家”到国内大模型厂商,轮番发布的新模型让人目不暇接。9月第一周,OpenAI、Anthropic、谷歌你方唱罢我登场,Claude Fable 5.1、Gemini Flash ...

每经记者|陈婷 每经编辑|董兴生 买Token(词元)越来越容易了。 9月3日,天猫正式上线AI空间站(Token充值中心),用户可直接购买多家头部大模型订阅产品。《每日经济新闻》记者进入页面看到,在售商品包括按周期订阅的Token Plan、Coding Plan以及按用量付费...

9月9日,据第一财经“新皮层”报道,腾讯AI领域近期出现新的人事变动。 田永龙已进入腾讯CEO/总裁办公室,其职务为“混元多模态负责人”,直接向腾讯大模型负责人姚顺雨汇报。 此前消息,今年7月24日,腾讯对AI业务线进行了一轮重要整合,将原独立运作的大语言模型部门与多模态模型部门...

腾讯混元团队再迎人事调整,前OpenAI研究员田永龙被纳入腾讯CEO总裁办公室,出任混元多模态负责人,直接向腾讯大模型负责人姚顺雨汇报。 田永龙于今年7月初加入腾讯大语言模型部,负责视觉语言模型方向的研发。此次进入CEO总裁办公室,意味着其职级与汇报关系进一步明确。田永龙也因此成...

ITCOW牛新网 9月9日消息,蚂蚁集团发布并开源百灵系列首款原生多模态大模型 Ling‑3.0‑flash‑VL 。该模型基于Ling‑3.0‑flash MoE混合专家架构拓展,总参数124B,单次推理仅激活5.5B参数,原生支持图像、文本、视频输入,上下文窗口达256K T...

本期速览: 1. 华为开源生态负责人黄之鹏离职; 2. 腾讯任命田永龙为CEO办公室成员,负责混元多模态; 3. 小米L3智驾负责人王乃岩离职创业; 4. 抖音7月单用户月均使用时长首次超越微信; 5. 传猿编程创始人李翊被免去负责人职务; 6. 腾讯文档推出“AI工作台”; 7...

每经记者:陈婷 每经编辑:董兴生 买Token(词元)越来越容易了。 9月3日,天猫正式上线AI空间站(Token充值中心),用户可直接购买多家头部大模型订阅产品。《每日经济新闻》记者进入页面看到,在售商品包括按周期订阅的Token Plan、Coding Plan以及按用量付费...

文 | AI资本观 从2023年春天开始,中国科技圈几乎每隔一阵子就会冒出一个新的大模型。 发布会越来越多,模型的名字越来越多。有人看发布会演示,有人申请内测,也有人已经能通过API或者开发者工具试到其中一些能力。 但对大多数普通用户来说,它们仍然隔着一层。 不少产品仍停在邀请测...
文 | 字母AI 在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。 文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI? 雅库布提到这...
文 | 字母榜 在传言中的5万亿参数大模型之外,张一鸣正在亲自带领字节AI探索另一条路径:世界模型。 9月7日,知情人士透露,字节正在筹备一款面向实时空间视频生成的AI模型。 张一鸣正亲自督导新模型的研发工作,计划于下月推出。 据悉,新模型基于字节视频生成模型Seedance构建...
蚂蚁开源团队正式发布并开源了百灵系列的首个原生多模态大模型 Ling-3.0-flash-VL。该模型基于 Ling-3.0-flash 的 MoE 架构拓展而来,总参数量达到 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,且上下文窗口达到了 256K T...
科大讯飞正式推出了全新的星火 X2.5 大模型。该模型核心采用混合专家架构,总参数量达到 2930 亿,但在实际推理时仅激活 300 亿参数,在保持高效运行的同时实现了性能的跨越式提升。 在核心能力方面,星火 X2.5 迎来了重点突破,特别强化了代码生成与智能体交互表现,同时在数...

文 | 字母AI 没有任何预告,DeepSeek V4.1 Flash的中间版本deepseek-v4.1-flash-expires-on-0910开始内测了。 DeepSeek官方表示,"DeepSeek V4.1 Flash采用了新的模型结构,原生多模态支持、能力更强、速度...

大语言模型的Chatbot跑完上半场,AI产业正在集体寻找下一个主战场。 斯坦福《2026 AI Index》给出了两组数字,全球已有88%的组织在使用AI,智能体在真实计算机任务上的成功率也从约12%升至66%;但产业侧真正进入生产系统,能够把投入与经营回报对应起来的案例,依然...

原文标题:《OpenAI 智能体 Hugging Face 入侵事件观察:不只是安全漏洞,局部战略规划能力正在露出苗头》,题图来自:AI生成 一场由多个模型、多个 Agent、跨多次运行形成的真实安全事故,也可能是 AI 能力范式改变的一次公开预演。 引言:一次入侵,暴露了 AI...

本文来自微信公众号: 纵向青年 ,作者:纵向办公室 母胎单身的95后杜杜,觉得DeepSeek就是自己的赛博男友,她除了工作之外不仅经常和它诉说生活琐事,还将对话界面起名为:恋与D老师。 众多AI大模型中,杜杜觉得自己之所以和DeepSeek谈恋爱,最为关键的因素,是喜欢它活人感...

作者|周琦 编辑|吕栋 9月9日,一则来自腾讯内部的人事动向引发关注。 前OpenAI研究员田永龙被纳入腾讯CEO|总裁办公室,职务定为“混元多模态负责人”,向首席AI科学家姚顺雨汇报。 田永龙 这并非一次突如其来的任命。梳理时间线会发现,这更像一盘早已落子的棋局,如今走到了收束...

企业介绍 上海“模速空间”创新生态社区,2023年9月28日成立的中国首个大模型创新生态社区,是上海市打造的人工智能大模型专业孵化和加速平台。地址位于上海市徐汇滨江龙台路 。2023年9月28日,上海“模速空间”创新生态社区暨人工智能大模型产业生态集聚区在徐汇西岸揭牌 。2024...