大模型也需要睡觉!让AI打个盹,醒来更聪明
文章转载于量子位 作者:闻乐 7×24,AI也吃不消。 卡内基梅隆大学和马里兰大学发了篇论文,《Language Models Need Sleep》—— 大模型处理长上下文的时候,硬撑着不休息,真的会累傻。 这项研究的灵感源自人脑运作机制。 人睡觉的时候海马体会把白天的短期记忆...
大模型 方向最近有哪些内容值得看
大模型 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
大模型资讯
3,413
正文图片
13,813
文章转载于量子位 作者:闻乐 7×24,AI也吃不消。 卡内基梅隆大学和马里兰大学发了篇论文,《Language Models Need Sleep》—— 大模型处理长上下文的时候,硬撑着不休息,真的会累傻。 这项研究的灵感源自人脑运作机制。 人睡觉的时候海马体会把白天的短期记忆...
感谢IT之家网友 DayDayUp、Domado 的线索投递! IT之家 5 月 28 日消息,小米 MiMo 官方昨日宣布,小米 MiMo-V2.5 系列 API 永久降价,相比原始 API 定价,新定价最高降幅可达 99%,且不再区分上下文窗口长度。 小米 MiMo 负责人罗...

本文来自微信公众号: 数字生命卡兹克 ,作者:数字生命卡兹克 可能有些朋友看到这,还不太清楚Markdown是什么,有点一头雾水,说不就是支持了一个新格式了吗,这玩意有啥用。 但是,其实你只要用AI,大概率已经每天都在看它了,只是不知道它叫这个名字。 比如说,Claude里面渲染...
本文来自微信公众号: 小饭桌 ,作者:关注AI的,编辑:苏迪 Demo还没跑通,估值先炒到上亿。这是过去一年里AI赛道最真实的写照。 大模型泛滥、智能体扎堆,资本涌入,将AI行业推向了热度顶点。热潮褪去后,投资回归理性,创业重心转向落地,曾经追捧通用大模型的团队,现在扎进了垂直赛...

品玩5月28日讯,据 AIBASE 报道,快手近日正式开源其自研的30B级多模态大模型Keye-VL-2.0-30B-A3B。该模型首次将DSA(DeepSeek Sparse Attention)稀疏注意力机制引入多模态场景,成功支持256K超长上下文,实现了对小时级视频的毫秒...

华为正在重新定义“芯片新范式”,在超节点上收获未来,迎来新一轮算力架构重构的机会窗口。 华为Fellow,半导体首席科学家廖恒,在鲲鹏昇腾开发者大会2026(KADC2026)上给出了一个公式:系统业务性能=超节点规格x单颗芯片规格。在这种范式里,单芯片不再是决定算力的唯一因素。...

如果有人告诉你,AGI(通用人工智能)已经实现了,你怎么判断他是在说真话,还是在吹牛? 在OpenAI与微软曝光的秘密协议里,这把尺子是财务报表——开发出能产生至少1000亿美元利润的AI系统就算AGI。而在黄仁勋嘴里,这把尺子是时间——五年内必现;马斯克更是屡次放出“明年达成”...

如果有人告诉你,AGI(通用人工智能)已经实现了,你怎么判断他是在说真话,还是在吹牛? 在OpenAI与微软曝光的秘密协议里,这把尺子是财务报表——开发出能产生至少1000亿美元利润的AI系统就算AGI。而在黄仁勋嘴里,这把尺子是时间—&mda...
AI行业正在逐步告别免费时代,但免费模式并非终结。近日,坐拥3.45亿月活用户的AI应用豆包即将收费,引发市场广泛讨论。在此之前,也有一些大模型开启了分级收费。业内人士认为,豆包收费的背后是算力成本与商业模式不可调和的矛盾,行业需从烧钱获客转向可持续发展。不过,AI能否让用户心甘...

制图:黄亚岚(即梦AI生成) “满血API直连、中转站批发、高速稳定”“最优惠大模型中转API、运行拉满”“API中转站、比官方便宜100倍”……近期,南都记者注意到,标价低至1元且带有此类宣传话术的中转站产品在社交平台、二手交易平台高频出现。AI中转站相关话题热度持续攀升,大量...

本文来自微信公众号: markzou的笔记 ,作者:markzou1988 1、机会发现 为啥会想走一个利用大模型来进行旅游规划的应用呢? 在之前进行旅行规划,总是需要在小红书、马蜂窝等平台找信息,然后再进行规划,要几个小时的时间。 去年下半年去环游中国,因为我从2024年下半年...

国内AI独角兽MiniMax近日确认,新一代大模型M3已进入发布准备阶段。MiniMax AI工程负责人Skyler Miao在社交平台释放预告,引发行业关注。 M3最核心的变化是架构层级的重构。它采用自研的稀疏注意力机制,通过索引分支(Index Branch)快速扫描上下文并...

据悉,云知声计划于6月推出新一代通用大语言模型U2。深耕AI领域十余年的云知声,先后跨越语音交互、芯片研发、大模型研发等多个技术阶段,并于去年完成港股上市。此次模型迭代将是云知声港股上市后最重要的一次基座模型升级,也被视为其朝着原生智能体大模型公司全面转型的关键信号。 产品性能:...
教培AI真正实现减负,靠的是算法层面的“精细化装修” 教培专用AI系统 的核心价值,不在于它能像通用工具那样聊天,而在于它能像一个拥有10年经验的教培老兵那样,直接给出一份能发朋友圈的招生活案。很多机构老板发现,直接把业务问题丢给市面上的通用模型,得到的往往是辞藻华丽但根本无法落...

那是一个普通的周二下午,我在咖啡馆的角落试图完成一篇关于人工智能的文章。笔记本电脑上跳跃的字符突然让我陷入沉思——我正在使用的文字处理软件,其背后已经有AI辅助拼写和语法检查;推荐系统为我推荐了这家咖啡馆;而窗外正在行驶的无人驾驶测试车,正通过神经网络识别每一个行人、自行车和交通...

这四位开发者的讲述, 是观察中国算力生态成熟度的一组真实样本。 DeepSeek之后,中国AI产业最深刻的一个变化,可能是大家终于不再相信“暴力堆算力”了。 当DeepSeek用一系列极致的低精度优化、长上下文压缩、算子工程把模型成本压到行业平均的十分之一以下,它实际上证明了一件...

在具身智能领域,一个问题正变得越来越尖锐:当一个机器人站在厨房里,它究竟应该先“看懂”这个世界,还是先“想清”下一步动作? 过去,大量研究将这两件事割裂开来,要么专注让模型描述场景,要么埋头优化动作序列。但在真实世界中,感知与决策本就是一体的。当机器人抓起一只杯子,它必须同时理解...

给手机充电时,首次尝试时常难以精准对准,指尖触碰到接口边缘的细微阻力会引导手腕自然微调后推入;打完羽毛球将球收回球筒时,手部伸入筒口的瞬间视野被完全遮挡,后续推进动作需要依赖手指对筒壁与球体相对位置的感知。 这些看似简单的日常操作,是人类视觉与触觉无缝协同的精细操作。视觉负责全局...

5月27日,小米宣布MiMo-V2.5系列大模型API价格体系进行永久性调价,最高降幅度达99%,且不再区分上下文长度。 具体来看MiMo-V2.5-Pro: 百万tokens输入(缓存命中)只需要0.025元。 百万tokens输入(缓存未命中)3元。 百万tokens输出6元...
这项由清华大学、香港大学、爱丁堡大学、中国科学院大学、香港理工大学以及美团LongCat团队共同完成的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.19660,有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。 当你在和手机里的AI助手聊天...