Token导航 LogoToken导航TokenDH.com

AI 算力的双轨分化与企业技术路线选择

更新时间 2026-09-16来源 智说新语正文 7702字阅读约 25分钟9 张图片

文|崔伟

      清华大学博士

      浙江大学金融学系校外导师

      IEEE PES 中国区常务理事

2026年9月3日,OpenAI发布了新一代旗舰模型GPT-6 Astra。根据 OpenAI 的公告,价格比上一代的GPT-5.6 Sol上涨了整整2.5倍。

几乎同时,苹果发布了新一代Mac Studio。M5 Ultra版本最高支持512GB统一内存,官方明确将“在设备本地运行大型语言模型”作为重要应用场景。

9月初,科大讯飞又发布了星火X2.5系列开放模型。其中4B和1.7B版本原生支持最长100万Token上下文,定位就是笔记本、智能终端和机器人等端侧场景。

三件事指向同一个趋势:

云端模型正在向更强、更复杂的方向发展,本地模型则在向更小、更便宜、更容易部署的方向下沉。

这场分野的深层含义,远不止“选哪家更便宜”那么简单,还关系到数据主权、成本结构、技术演进路径,乃至一个企业在AI时代还能不能“自己说了算”。

图片

先看清“云端贵”到底贵在哪里

Token是AI的“语言食材”,也是AI的“工作量单位”。大模型的所有能力本质上都是在“读入Token、吐出Token”的过程中产生的。今天绝大多数AI服务的计费方式也极其统一:按Token计价,输入和输出分开收费。

我们来算一笔最基础的账。假设你的公司有100个知识工作者,每人每天使用AI助手50次,包括问一个问题、写一段邮件、生成一份报告,每次交互平均消耗2000个Token(输入输出合计)。那么:


每天消耗:100人 × 50次 × 2000 Token = 1000万Token

按GPT-6 Astra的标准价格,粗略按输入输出各半估算:

输入500万Token × 10美元/100万Token = 50美元

输出500万Token × 50美元/100万Token = 250美元

每天 ≈ 300美元

一个月就是9000美元,一年108000美元,折合人民币约73万元。

但请注意,这只是“理想状态”下的估算。还有“隐形Token”的问题:你以为自己只输入了10个字,但系统在背后塞进去的系统提示词、历史对话、工具描述、检索结果,可能让实际消耗膨胀5到10倍。

所以,真正让企业成本失控的,不一定是模型单价,而是:企业不知道一个业务结果,究竟消耗了多少次调用和多少Token。

Uber 的故事是一个典型的例子。据Forbes 2026年5月的报道,Uber约5000名工程师中,84%在使用AI编程工具。普通工程师每月花费150到250美元,重度用户高达2000美元,有一个两小时的演示就烧掉了1200美元。公司为全年预留的AI编程预算,到4月份就花光了。

2026年2月,市场研究机构Sapio Research对美英两国500位大型企业财务高管做了一项独立调研,结果更加触目惊心:

    79%的企业在过去一年中AI支出超预算,平均超支幅度达30.9%;

    84%的企业报告AI成本已开始侵蚀利润;

    只有15%的企业能在10%的误差范围内预测AI预算。

    全球范围来看,Gartner预测2026年全球AI支出将达到2.59万亿美元,同比增长47%。高盛的研究更进一步:全球月Token消耗量将从当前水平增长24倍,到2030年达到每月120千万亿个Token。

    单价在涨,用量在爆。两条线同时上扬,夹在中间的企业,正在经历一场“温水煮青蛙”式的成本危机。

    破解成本问题的路径

    开源模型和闭源模型之争

    有没有可能既能使用大模型,又不需要承担过高的成本?

    答案藏在两个词里:闭源和开源

    闭源模型的典型代表是OpenAI的GPT系列、Anthropic的Claude系列、Google的Gemini系列,你永远看不到它的“配方”(权重),只能通过API远程调用,按Token计费。这就好比你只能在饭店吃饭,菜单上明码标价,每吃一口都在跳表。

    开源模型(更准确地说是“开放权重”模型)则把配方公开了。Meta的Llama 4、深度求索的DeepSeek V4、阿里的Qwen3.8、月之暗面的Kimi K3、智谱的 GLM 5.3,都属于此类。你可以把模型下载到自己的服务器上,想用多少次就用多少次,不再按Token付费。这就好比拿到了菜谱,在自己家厨房做饭——锅碗瓢盆要自己买,但做多少盘菜都不用再给饭店结账。

    图片

    ▲ 闭源模型和开源模型的区别,作者 AI 制图

    全世界最大的模型调用平台HuggingFace 在 9 月刚刚发布的夏季报告中指出,HuggingFace上的公开模型仓库在 2026 年从243万个增长到296万个。

    而且,开源的重心正在东移。2026年几乎每个月,中国实验室发布的开源模型的参数规模都超过了同期美国实验室。连小米、蚂蚁集团、美团等原本并非AI研发主力的公司,今年均发布了万亿参数级别的开源模型。

    闭源和开源的竞争还进入了公共舆论领域。2026年7月24日,英伟达CEO黄仁勋牵头,超过270家公司和机构联名签署了公开信《开放权重与美国AI领导力》。签名方包括Meta、谷歌、微软、OpenAI、英伟达、AMD、联想等。核心论点只有一句话:开放权重模型是AI领导力的基础,不是威胁。

    图片

    ▲ 英伟达的声明原文,来源:https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf

    这封信道出了开源存在的底层经济逻辑:前沿模型的训练耗资数十亿美元,但推理的边际成本极低。闭源厂商通过API按Token收费,本质上是用“垄断配方”回收成本;而Meta、DeepSeek等开源厂商选择公开权重,则是为了放弃Token收入,换取生态控制权。

    如果这些技术细节让你觉得太抽象,不妨想想电力行业的类比。

    一百多年前,爱迪生建了第一座中央发电站,所有家庭都必须从电网买电。发电、输电、配电,全部垄断在电力公司手里。你能做的只有交电费。

    后来出现了屋顶光伏、家用储能、分布式发电。你依然可以从电网买电,但也可以自己发电、存电、用电,甚至在某些时段把多余的电卖回给电网。两种模式并存,各有所长。

    今天的AI算力正在经历完全相同的转变。云端API是“中央发电站”,本地部署是“屋顶光伏”。

    中央发电站的优势在于规模效应和峰值输出能力,当你需要最极致的智能时,它是唯一的选择。但屋顶光伏的优势在于自主可控、成本可预测、不怕停电。当你的大部分用电需求都是日常照明和家电时,它已经完全够用。

    图片

    ▲ 云端和本地 AI 模式与电网供电的类比图,作者 AI 制图

    再看“本地廉”到底廉到什么程度

    理解了开源与闭源的区别,“本地廉”的逻辑就水到渠成了。

    2026年下半年,两款硬件产品同时登场,让“本地跑大模型”从极客实验变成了企业级选项。

    • 苹果Mac Studio M5 Ultra——配备最高512GB统一内存、1.2TB/s内存带宽、80核GPU,起售价 5499 美元。统一内存架构意味着CPU和GPU共享同一片内存,无需像传统显卡那样受限于“显存容量”。一台机器即可在桌面上运行700亿参数级别的模型。

    • 英伟达RTX Spark桌面主机——英伟达首次将数据中心级的AI推理能力塞进一台桌面小主机。联想、华硕、戴尔等厂商都陆续基于这颗芯片推出成品,最高配备128GB统一内存。和苹果Mac Studio一样,CPU和GPU共享同一片内存,不再受传统显卡显存的限制。功耗仅140瓦,可以24小时安静运行在办公桌上。

    图片
    图片

    ▲ 左侧为苹果Mac Studio M5 Ultra (apple.com),右侧为联想SFF RTX Spark迷你PC(https://www.notebookcheck-cn.com/Mac-Nvidia-RTX-Spark-128GB.1317453.0.html)

    光有硬件还不够。要在一台桌面电脑上跑万亿参数的模型,就像要把一整间图书馆的书塞进一个行李箱,你需要一套高效的“压缩术”

    2026年,这套压缩术进步飞快。HuggingFace的数据显示,本地推理相关的工具库在今年前7个月增长了464%,而传统的云端建模工具只增长了16%。

    一年前,“本地跑AI”还意味着在笔记本上跑一个勉强能对话的小模型;今天,几台Mac Studio组成的桌面集群已经能跑万亿参数的大模型,效果接近云端,账单接近于零。

    现在我们来算另一笔账:如果同样那家100人的公司,选择本地部署,成本是多少?

    方案一:10台Mac Studio M5 Max(128GB版本)。

    • 硬件成本:10 × 4799美元 = 47990美元(约32万元人民币)

    • 年运行成本(电费+维护):约2 万-3.5 万元人民币

    • 能跑的模型:700亿参数级别的主流开源模型(如Qwen的70B版本)

    方案二:2台Mac Studio M5 Ultra(256GB版本)+ 8台M5 Max(64GB版本)。

    • 硬件成本:2 × 9499美元 + 8 × 3199美元 = 44590美元(约30万元人民币)

    • Ultra处理高复杂度任务(200B-300B级别模型),Max处理日常交互

    • 年运行成本:约3 万到 4 万元人民币

    两种方案的第一年总成本大约在36万—40万人民币之间。从第二年开始,年运行成本降至不到5万元人民币——大约只有前面计算的云端方案(73万/年)的1/15。

    当然,这个对比有一个重要前提:本地部署跑的模型,在综合智能上还无法与GPT-6 Astra这样的前沿闭源模型比肩。

    Astra在ARC-AGI-3上的得分是99.9%,在FrontierMath Tier 4上是97.6%,在ExploitBench上是100%。这些数字代表的是当前人工智能的绝对天花板。本地能跑的开源模型,大约相当于上一代云端模型的水平。

    但问题是,你的业务真的需要天花板级别的智能吗?

    对于大多数企业的日常场景,例如邮件摘要、文档翻译、数据清洗、报表生成、会议纪要、代码补全、客服问答,对于这些任务,一个700亿参数的高质量开源模型已经绰绰有余。

    就像你日常通勤用的是家用轿车,不是F1赛车。F1赛车确实更快,但你既不需要那个速度,也负担不起那个油耗。

    不过,这里必须要泼一盆冷水:不是所有开源模型都适合搬回家。

    2026年7月底,月之暗面开源了Kimi K3,总参数量2.8万亿,是目前人类公开发布的最大开源模型。

    如果私有化部署,按照官方建议的64张加速卡方案,功耗约45千瓦,硬件成本超过2000万元。加上机房和运维,综合投入很容易突破3000万元。

    不只是省钱:四个维度的“主权”

    开源模型本地化部署的价值,远不止“便宜”两个字能概括。它至少涉及四个维度的“技术主权”。

    数据主权: 你的商业数据、客户信息、内部文档,全部在自己的设备上处理,不经过任何第三方服务器。对于金融、医疗、法律、政府等对数据合规有严格要求的行业,这不是“加分项”,而是“入场券”。

    成本主权:你的算力支出是一次性投入的硬件设施加上可预测的运维费用,不会因为某家公司突然涨价或改变商业条款而被动波动。

    可用性主权:断网也能用。不依赖API的稳定性,不担心服务商的限流和降级。2026年初以来,各大云端AI服务因需求激增而频繁出现的延迟、限流甚至“降智”,对很多依赖API的企业造成了真实的业务影响。

    演进主权:开源模型的迭代节奏极快。你可以根据自己的业务需求,选择微调、蒸馏、替换模型,而不是被锁定在某一个供应商的产品路线图上。如果DeepSeek的下一代模型比千问好,你切换模型的成本几乎为零,因为你的数据、你的流程、你的用户习惯,都留在自己的系统里。

    图片

    双轨分化的深层逻辑

    很多人会问:AI技术不是在进步吗?按照摩尔定律的直觉,应该越来越便宜才对啊?

    事实恰恰相反。前沿大模型的研发成本正在指数级上升。GPT-6 Astra的训练耗资以十亿美元计,它可以发现数学领域几十年未被解决的开放问题,可以在网络安全基准测试中打满分,可以自主操作电脑完成复杂的多步骤专业工作。

    这些能力的获得,代价是天文数字的计算资源。这些成本最终都会通过API定价转嫁给每一个用户。

    更深层的原因在于商业模式。云端大模型的定价遵循的是“算力地主”逻辑:平台方巨资建设基础设施(GPU集群、数据中心、电网接入),然后按使用量向你收取“租金”。模型越强大,“地段”越好,“租金”越贵。

    而且,和传统房东不同的是,这个“地主”还在不断升级你住的房子——每次升级,租金跟着涨。你有选择不搬进新房子的自由,但行业竞争压力会推着你升级。

    虽然OpenAI声称Astra在完成同等任务时效率更高、消耗的Token更少,但更强的能力会诱导更复杂的使用场景、更长的上下文、更频繁的调用,结果是“单价效率提高了,总量反而增长得更快”。

    这就像汽油降价了,但你从骑自行车换成了开卡车,油价确实便宜了,油费却贵了十倍,这可以参考我在之前文章中提到的“杰文斯悖论”。

    端侧算力的降价逻辑则完全不同。它遵循的是经典的半导体经济学和开源生态的“飞轮效应”。

    从硬件看,苹果、英伟达、AMD、高通都在拼命把AI推理能力塞进消费级芯片。苹果的M5 Ultra以“80核GPU+统一内存架构”,实现了1.2TB/s的带宽,让本地推理不再是“能跑”的问题,而是“跑得够快”的问题。

    英伟达的RTX Spark 则代表了PC行业的一次范式转移:它把ARM架构的Grace CPU与Blackwell GPU集成在一起,用统一内存消除了传统VRAM的瓶颈。这是英伟达在消费端的一次“自我革命”,因为它的传统利润恰恰来自把GPU显存卖到最高价。

    从模型看,开源社区和国产大模型的进展都在不断压低“达到可用水平”所需的参数量。量化技术(用更少的比特表示每个参数)进一步把存储和计算需求砍掉一半到四分之三。

    两股力量叠加的结果是:硬件越来越强,模型越来越小,门槛越来越低。

    三年前需要一间机房才能做的事,今天一台桌面电脑就能干。再过三年,也许一台笔记本就够了。

    企业应该怎么选?

    混合架构的“二八法则”

    对于大多数企业而言,最务实的策略既不是All-in云端,也不是完全断网自建,而是建立一套“混合架构”,即用本地部署覆盖日常高频任务,用云端前沿模型处理少量高难度决策。

    这个比例可以参照“二八法则”:企业80%的AI交互,例如日常问答、文档摘要、数据清洗、报表生成、代码补全,其实用不到GPT-6级别的智能,一台或几台Mac Studio、一组本地服务器,部署一个700亿参数的开源模型,完全可以胜任。

    剩下20%真正需要顶级推理能力的任务,如复杂推理、前沿科研辅助、高风险决策支持,再按需调用云端模型。

    让我们做一个更严格的三年总账单对比(100人企业,日均1000万Token)

    图片

    三年节省约129万元,混合方案总成本仅为纯云端的41%。而且这还没有计入云端继续涨价的可能:从GPT-5到GPT-6已经涨了2.5倍,谁能保证下一代不再涨?

    当然,这个模型做了大量简化。实际成本取决于模型选择、调用模式、工程实施能力等诸多因素。但数量级上的差距是清晰的:本地推理的边际成本趋近于零,而云端推理的边际成本永远不会为零。

    当然,有不少场景云端仍不可替代:

    第一是需要前沿推理能力的场景,GPT-6 Astra代表当前AI的认知极限,若业务涉及前沿科研、高难度推理、未知领域探索任务,本地模型暂时达不到该水平;

    第二是需要最新知识的场景,云端模型更新更快、联网能力更强,如果业务高度依赖实时信息,比如新闻分析、市场监测、合规监控,云端模型的时效性优势十分明显;

    第三是需要计算机操作能力的场景,Astra在OSWorld 2.0上的表现证明它可自主操作电脑完成各类复杂多步骤任务,这类“数字工人”能力目前只有云端模型具备;

    第四是需要超大规模并发的场景,如果业务需要同时为数万用户提供实时AI交互,本地集群的扩展性通常不如云端弹性。

    核心判断标准很简单:这件事如果做错了,后果有多大?

    后果大、频率低的任务,花钱用云端前沿模型,值得;后果小、频率高的任务,用本地模型处理,明智。

    图片

    对行业和个人的启示

    过去三年,行业的主旋律是“追赶前沿”——谁的模型参数多、谁的跑分高,谁就代表未来。

    但从2026年下半年开始,一个新叙事正在浮现:AI不再只是一种能力,它正在变成一种基础设施。

    基础设施的核心逻辑是“拥有”,而不是“租用”。就像企业不会永远租写字楼一样,当AI成为日常运营不可缺少的一部分时,“拥有自己的算力”就不再是技术极客的偏好,而是企业的战略必需。

    苹果、英伟达、科大讯飞——这些巨头不约而同地在端侧算力上下重注,释放的信号是一致的:未来的AI,不一定非得在云上。

    我给企业的具体建议是四句话:

    第一,建立本地推理基础设施。不需要一步到位,从几台Mac Studio或搭载GPU 的迷你工作站开始,先让团队跑起来。

    第二,将80%日常交互迁移至本地。邮件、文档、代码、数据分析——这些高频低风险任务,没有理由每天花几千块钱去调云端API。

    第三,监控并归口管理AI成本。指定一个跨部门的“AI成本负责人”,建立Token级别的用量监控和干预机制。不要再让技术和财务各管半边天。

    第四,跟踪开源模型的迭代节奏。今天的700亿参数开源模型,能力大约相当于一年前的云端旗舰。这个差距在以“月”为单位缩小。持续评估何时可以用本地模型替代更多的云端调用。

    在这种前景下,对于个人而言,“能否在本地高效使用AI”,也将成为一种新的个人竞争力。

    一个拥有一台Mac Studio和基本的本地部署能力的知识工作者,每月的AI使用边际成本趋近于零。他可以毫无顾虑地让AI帮他读完一千页的法律文件、重构一万行代码、批改一百份作业。

    而一个完全依赖云端API的人,每做一件这样的事,都在心里默默计算:“这次要花多少Token?”

    差距不在于你会不会编程,而在于你会不会“拥有”自己的AI。

    最后,从更宏观的视角看,本地算力对中国企业还有一层特殊意义。

    中国企业使用海外闭源模型本身就受到严格的合规限制,这一点无需多论。但很多人忽略的是,即使使用国内厂商提供的云端模型,数据依然需要经过第三方服务器。

    对于金融、政务、能源、医疗等涉及核心数据的部门和行业,这种依赖本身就构成风险。服务商的安全事故、政策调整、甚至商业变动,都可能影响你的业务连续性和数据安全。

    本地部署的价值,在这个语境下就不仅仅是省钱,而是兜底。模型跑在自己的机房里,数据不出自己的物理边界,不依赖任何第三方的稳定性承诺。

    结 语

    当思考的成本出现了“双轨”

    让我回到开头提出的“双轨分化”趋势,可以看到,前沿在变强也在变贵,基础在变强也在变便宜。

    两条轨道同时存在,且彼此不会合并。

    对企业来说,未来拼的不仅是“有没有AI”,而是有没有能力在这两条轨道之间找到自己的最优配速。用最低的成本覆盖80%的日常智力需求,再用最精准的投入撬动20%的关键决策——这就是混合架构的本质。

    对个人来说,拉开差距的也不再是“谁用了最贵的模型”,而是谁能把AI真正变成自己的生产力基础设施,随时在线、成本可控、数据私有、永不停机。

    Token的双轨时代已经到来。你站在哪条轨道上?

     END 

    * 所刊专家文章并不代表本中心观点。

    * 部分图片来源于网络,如有侵权,请联系我们删除


    【欢迎转载】

    请注明“来源:数字社会发展与研究”。

    文章标签算力大模型
    资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

    继续浏览更多资讯

    返回资讯目录

    相关资讯

    更多