品玩7月3日讯,NVIDIA Research近日正式开源Nemotron-Labs-TwoTower模型,旨在打破传统自回归语言模型逐词生成的串行瓶颈。该模型将300亿参数的基座模型拆分为上下文塔与去噪塔,通过任务解耦实现Token并行生成。
在架构设计上,上下文塔保持冻结状态以维护自回归上下文,去噪塔则专注于噪声块的重建,两者通过逐层交叉注意力协同工作。模型总参数达600亿,采用混合架构设计。基准测试显示,该模型在保留98.7%原始质量的前提下,生成吞吐量提升至传统自回归模型的2.42倍。
目前,该模型已在Hugging Face平台以NVIDIA Nemotron开放许可协议发布,完全支持商业用途。尽管在代码生成与数学推理任务上存在轻微性能回落,但其在吞吐量上的显著跃升,为大规模文本生成与合成数据生产提供了极具潜力的技术方向。








