
内存可以说是现代人工智能大型语言模型(LLM)面临的最严峻挑战。一篇颇具影响力的论文指出,LLM 词元生成本质上是一个内存密集型任务,这意味着模型输出文本的速度受限于从内存读取数据的速度。随着模型规模的增大,这种瓶颈的严重程度也会加剧。这会形成一道“内存墙”,阻碍 LLM 的推理性能。
人工智能硬件初创公司Majestic Labs正采取一种直接而全面的方式来解决这个问题。该公司正在开发一款名为 Prometheus 的新型人工智能服务器,其内存容量高达 128 TB。这比英伟达的DGX B300 服务器(一款尖端的人工智能处理机架)的内存容量高出 60 多倍。
Majestic Labs联合创始人兼总裁Sha Rabii认为,内存的大幅增长将为公司带来竞争优势。他承认“英伟达在打造可扩展系统方面做得非常出色”,但他认为,随着模型规模的扩大,这种扩展方式的经济性会降低,“最终导致计算资源过度配置而内存不足”。
面向LLM内存的DRAM中心架构
Majestic Labs 计划采用与竞争对手截然不同的架构来克服“记忆墙”。
Nvidia 目前的服务器配备了高速高带宽内存(HBM),通常用于读取 LLM 的模型权重。此外,还有一个容量更大但速度较慢的动态随机存取存储器( DRAM ) 池,用于处理 LLM 和服务器的开销。而 Majestic 则在统一架构中完全采用 DRAM(具体来说是 LPDDR6)。
Rabii表示,大多数内存接口的设计工作距离都很短——有时只有几毫米。这限制了内存的容量。“在计算芯片附近,你只能放置HBM内存,这就形成了一个边界。如果你想放置更多内存,那就做不到了。” Rabii解释道。
为了解决这个问题,Majestic 使用了一种专有的内存接口,该接口由微型铜缆构成,有效传输距离可达一米。此外,还搭配了定制的内存聚合芯片,这些芯片物理上紧邻内存模块,负责协调整个服务器的内存使用。
Rabii解释说:“它是高速接口的终端,并连接到大量的通用DRAM芯片。” Majestic表示,除了能够处理大容量内存池外,该设计还提供高达每秒25.6TB的内存带宽。
用于LLM加速的Ignite AI处理器
更大的内存固然好,但它需要与AI加速技术相结合,类似于英伟达的GPU。Majestic的解决方案是Ignite,这是一个定制的AI处理单元,用作服务器的计算引擎。Prometheus服务器包含12个Ignite芯片。
Ignite 将数据中心级 ARM 应用核心与RISC-V向量和张量核心集成在单个芯片上,所有核心共享同一内存空间。ARM 核心作为片上主机处理器,负责协调 AI 模型。RISC-V 核心则执行实际的 LLM 处理。最终,单个芯片即可处理 LLM 推理的多个方面,无需在处理器之间切换。Majestic Labs 尚未公布 Prometheus 计算性能的具体指标。
Rabii 也承认软件同样重要,因为许多人工智能框架已经根深蒂固。“我们正努力在客户采用的各个方面尽可能减少阻力,无论是硬件还是软件,”他说道。Prometheus 将支持 PyTorch、vLLM 和 OpenAI 的 Triton 推理框架,无需修改代码。这意味着与这些框架兼容的现有模型可以直接运行。
Prometheus 服务器设计与定价
所有这些功能都集成在服务器本身,该服务器符合开放计算项目(OCP)标准。一个服务器机架最多可容纳四台服务器;预计每个机架的总功耗最高可达 120 千瓦;散热采用冷板液冷技术。服务器的内存采用模块化设计,这意味着即使购买时内存容量低于 128 TB 的服务器,日后也可以进行升级。
尽管Prometheus项目规模庞大,但Majestic仍希望在价格方面也占据一席之地——考虑到每台服务器的内存容量,这或许会让人感到意外。Majestic认为,这得益于Prometheus采用的是DRAM而非HBM。由于Prometheus预计将于2027年上市,因此目前尚未公布定价。
Rabii 声称:“根据工作量的不同,我们客户的资本支出将减少 10 到 50 倍,电力消耗也将减少类似的幅度。”
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。






