导言
自2022年底大语言模型进入公众视野以来,人们最先关注的,往往是模型本身:它有多智能、能够完成哪些复杂任务,以及大模型的能力边界到底在哪。
但随着大模型逐渐进入真实应用场景,竞争也开始超出单纯的技术能力比拼。一个比“技术竞赛”更为复杂的大模型市场,正在快速形成并不断扩张。
在罗汉堂前期举办的一场“罗汉论道”活动中,麻省理工学院斯隆管理学院应用经济学副教授Mert Demirer,基于AI模型聚合服务平台OpenRouter和微软旗下Azure AI Foundry的大规模使用数据,对企业级大模型推理市场进行了系统刻画,并试图回答一个根本性问题:大模型市场目前究竟处在什么状态,又正在如何演变?
Demirer教授在分享中指出,开源模型的快速发展,正在改变大模型市场的竞争方式。对于闭源模型而言,模型自身能力就是竞争优势;但对于开源模型而言,同一个模型可以由多家服务商部署。于是,即使底层模型完全相同,竞争也并不会消失,而是进一步延伸到服务层面——价格、响应速度和处理能力,都开始成为新的竞争维度。
此外,Demirer教授强调,模型能力的持续提升,并没有让市场变成一场只属于少数前沿模型的竞赛。相反,领先模型不断更替,今天仍然会有一些新模型,其能力只相当于两年前最好的模型。
这也意味着,大模型市场并不是一个"最强模型通吃"的市场,而是一个前沿不断被刷新、不同能力层级同时在竞争的分层市场。

以下是Mert Demirer演讲中译全文的上篇:

Mert Demirer
非常感谢罗汉堂的邀请,很高兴有机会向大家介绍我的这项研究。这是一篇以描述性分析为主的研究。接下来,我会给大家展示一系列图表,主要想回答两个问题:大语言模型(LLM)行业目前处在什么状态,以及这个行业正在如何演变。
促使我们开展这项研究的一个重要原因是LLM市场发展得实在太快了。就在几年前,我们甚至还没有今天意义上的LLM;但在很短的时间里,这项新技术迅速发展起来,一个新的市场也随之形成。现在,已经有越来越多的企业、模型开发者和服务提供商进入这个领域,提供各种相关服务。
尽管这个市场变得越来越重要,但其实还有很多基础性问题,我们并不知道答案。比如,不同模型之间到底存在多大程度的纵向差异和横向差异(Vertical VS. Horizontal differentiation)?也就是说,有些差异可能是来自模型整体性能的高低,有些则来自不同模型在不同任务上的各有所长。
此外,我们其实也不知道,通过API调用模型的推理价格究竟是怎么随时间变化的。现在虽然有一些零散的数据和案例,但还缺少系统性的证据。
关于“多模型并用”(multihoming),也就是企业同时使用多个模型的情况,我们知道的信息也非常有限。比如,企业究竟会不会在不同模型之间切换,以及是否会同时使用多个模型?
所以在这项研究里,我们的目标就是利用两个大型API市场的数据,尝试对这些问题给出比较系统的答案。
具体而言,我们会使用OpenRouter和Microsoft Azure的使用数据(usage data),并总结出关于大模型市场结构及其动态变化的六个事实,分别是:供给、定价、市场动态、差异化、替代,以及“多模型并用”。
在供给侧,我们会看有多少模型和模型开发者进入这个行业。
在定价方面,我们会看价格是怎么随时间变化的。
在市场动态方面,我们主要看不同模型及模型开发者进入和退出市场的情况。
在差异化方面,我们会问:是不是存在某一个模型,能够在不同应用类别里都占据主导地位。
在替代方面,我们关注的是,当一个新模型进入市场以后,会发生什么?用户会不会从原来的模型切换到新模型?还是说,新模型的出现会带来整个市场需求的扩张?
最后,我们会看企业“多模型并用”的情况,也就是企业在同一个时间是不是会使用多个模型。
接下来,针对这些问题,我会给大家展示几张图,用数据来说明我们的发现。
01
大模型市场是如何分层的?
我们这项研究关注的是LLM市场。更具体地说,我们研究的是企业通过API购买和使用LLM推理服务的市场。简单来说,就是企业发出一个请求,模型返回一个结果,这个过程就叫推理(inference)。这也就意味着,我们研究的并不是像ChatGPT这样的面向消费者的产品,也不是 Cursor、Copilot 这样的编程应用。
围绕LLM推理服务,已经形成了一个规模非常大的市场,这也是企业使用 LLM 的主要方式之一。这个市场有一个很重要的特点,就是这类服务通常按照词元(token)来计价。简单来说,就是用多少、付多少,价格基本随着使用量线性增加。这和聊天机器人市场常见的订阅制收费方式很不一样。
所以,我们这里研究的是一个按实际使用量计费的LLM推理服务市场:企业通过API调用模型,并为实际使用的推理服务付费。
从市场的结构来看,大致可以分为四层:
第一层是模型开发者,也就是负责训练和开发大模型的实验室或公司。
第二层是推理服务提供商。他们拿到训练好的模型参数,也就是所谓的模型权重(model weights),然后负责实际运行这些模型、对外提供推理服务。也就是说,企业发出请求之后,是推理服务商负责把模型运行起来,并将模型生成的结果返回给企业。
第三层是聚合平台(aggregator)。OpenRouter就属于这一层,而且它对我们的研究非常重要。聚合平台本身并不负责运行模型,而是提供一个统一的 API 入口,把用户的请求路由到具体的推理服务提供商。
真正负责运行模型的是这些推理服务提供商。它们负责部署模型、提供 GPU 算力,并实际处理用户发出的请求。OpenRouter更像是连接用户和不同推理服务商的中间平台:它自己没有GPU,也不运行模型,主要负责根据用户的选择或设定,把请求发送给相应的推理服务提供商。
最后是应用层,也就是各种实际调用和使用大模型能力的软件和工具。它们可以是 Cursor、Copilot 这样的编程应用,也可以是其他类型的软件,还可以是企业内部自己开发和使用的应用。

大家可能会注意到,上图展示的有些箭头画得更粗一些。这是因为,有些公司并不只处在市场中的一个环节,而是同时覆盖了多个环节,这就是所谓的“垂直整合”(vertical integration)。
这是什么意思呢?比如,以OpenAI为例,它既自己开发模型,也自己提供推理服务,同时还有Codex这样的应用产品。也就是说,从模型开发、推理服务到最终应用,OpenAI同时参与了其中多个环节。
Anthropic同样也是自己开发模型,并在自己的平台上提供推理服务。不过,它同时也和Google Cloud有合作,所以Google Cloud也可以提供 Anthropic的模型。
除此之外,市场上还有开源模型。DeepSeek就是一个典型例子。因为它是开源的,任何推理服务提供商都可以下载它的模型权重,把模型部署起来,并对外提供推理服务。
02
平台数据:观察大模型市场的窗口
接下来,我们主要会分析推理这一层:目前市场上有哪些模型可以使用,这些模型的价格是多少,不同推理服务提供商各自占有多大的市场份额等等。而这些分析,主要依托OpenRouter的数据来完成。
OpenRouter一个很大的优势是,它汇集了多达600个模型,以及接近100个不同的推理服务提供商。也就是说,通过这一个平台,我们就可以同时观察大量“模型—服务商”组合的价格,以及客户实际使用了哪些模型、使用了多少。
这也是这套数据最有价值的地方。否则,我们就需要逐个服务商、逐个模型地去收集数据,而这在现实中几乎不可能做到,因为其中很多信息本身就是企业不会公开的商业信息。
OpenRouter作为一个中间的聚合和路由平台,把不同模型、不同服务商和用户的调用连接在了一起,也因此为我们提供了一个观察这个市场的窗口。
具体来说,我们可以按照模型、日期和应用类别来观察数据。比如,在某一天、某一个应用类别里——比如编程或者营销——我们可以看到某个模型一共处理了多少词元(token)。通过这些数据,我们就可以观察不同模型在不同日期、不同应用类别里的市场份额。
此外,我们还可以观察每一个“模型—服务商”组合的价格。同时,我们也能看到服务商自身的一些特征,比如延迟(latency),也就是响应有多快;吞吐量(throughput),也就是单位时间内能够处理多少内容;以及上下文窗口(context window),可以理解为模型一次能够纳入处理的内容有多长。
这些指标之所以重要,是因为即使不同服务商提供的是同一个模型,实际使用体验也可能并不一样。对于企业来说,如果它们在意响应速度、处理能力或者一次能够处理多长的内容,那么这些特征就会成为选择不同服务商时的重要考虑因素。
那么,企业一般是怎么使用 OpenRouter 的呢?
通常,一家企业会直接指定:“我想使用这家服务商提供的这个模型。”OpenRouter 就会把请求转发给相应的服务商。
但有时候,企业也不会指定具体的服务商,而是会说:“我只想用价格最低的那一家。谁最便宜,就把我的请求发给谁,我并不在乎具体是哪家服务商。”
我们的第二套数据来自Azure AI Foundry。Azure和OpenRouter有一些相似之处,但它本身就是一个推理服务提供商。Azure上提供了大约100个不同的模型供企业调用,其中大部分是OpenAI的模型,同时也包括一些开源模型。
但和OpenRouter不一样的是,在Azure的数据里,我们可以观察到企业层面的模型使用情况。也就是说,对于每一家企业、每一天,我们都可以看到它选择了哪个模型,以及使用的是哪个版本。
Azure和OpenRouter还有一个很重要的区别:Azure自己拥有GPU,真正负责运行模型、提供推理服务;而OpenRouter自己没有GPU,它主要负责把用户的请求转发到不同的推理服务提供商。
03
大模型供给爆发,开源模型重塑市场边界
在供给侧,我们首先看到的是一个非常明显的变化:模型和模型开发者的数量,都在很短的时间里快速增加。

先来看模型数量。上图左侧展示了开源模型和闭源模型数量随时间的变化。2024年初,市场上大约只有50个模型;而现在,这个数字已经接近600个。也就是说,仅仅两年左右,市场上的模型供给就扩大了一个数量级。但比模型数量本身增长更值得注意的,是开源模型的快速涌现。
在早期,市场上几乎都是闭源模型,开源模型还非常少。此后,开源模型的数量迅速增加,并逐渐追上、甚至一度超过闭源模型。这意味着,大模型市场的供给已经不再主要来自少数闭源模型开发者,开源模型正在成为整个生态中越来越重要的一部分。
再来看模型开发者。上图右侧展示的是我们在数据中能够观察到的不同模型开发者数量。
目前,闭源模型开发者大约有10家,而且过去一年这个数字已经基本稳定。相比之下,开源模型开发者的数量仍然在持续增加。
为什么会出现这种差异?一个重要原因在于,开源模型本身可以成为新的模型开发的基础。开发者可以在已有开源模型之上继续进行蒸馏和改造,比如以 DeepSeek 这样的模型为基础开发新的开源模型;也可以针对某一类特定任务,进一步开发更加专门化的垂直模型。
因此,开源带来的并不只是更多模型,它也让更多开发者能够进入模型开发这个过程,并在已有模型的基础上继续创造新的模型。
所以这一部分最重要的事实是:过去短短几年,大模型市场的供给出现了爆发式增长,而开源生态正在成为推动这种扩张的重要力量。
04
开源生态如何催生更多推理服务商?
接下来,我们再来看推理服务提供商的变化。这里所说的推理服务商,就是拿到已经训练好的模型,然后负责实际运行模型、对外提供推理服务的公司。它们和模型开发者并不是同一类角色:一家公司可以既开发模型,也提供推理服务;也可以只做其中一个环节。

从上图可以看到,推理服务提供商的数量也在快速增加,而这种增长很大程度上来自开源模型。
原因其实很直接。开源模型的权重可以被其他服务商获得,只要具备一定的 GPU 算力,就可以把这些模型部署起来,并对外提供推理服务。也就是说,模型一旦开放出来,就不再只能由模型开发者自己提供服务,更多公司也可以进入推理服务这一环节。这也是为什么在过去一年里,我们看到推理服务商的数量增长得非常快。
需要说明的是,这部分数据我们只有过去一年的。进入这个市场的主要是一些模型实验室和云计算公司。除此之外,我们还看到了一类所谓的Neocloud,也就是专门提供AI和GPU算力的新型云服务商,它们也开始进入市场,为开源模型提供推理服务。
05
开源与闭源:两种不同的竞争逻辑
我现在展示的这张图,可以让大家直观看到不同推理服务提供商之间的竞争究竟有多激烈。

这里我们看的是,同一个模型到底有多少家服务商在提供,也就是每一个模型对应的服务商数量分布。
比如,大约有200—250个模型由一家服务商提供,大约有70个模型由两家服务商提供,以此类推。
如果把闭源模型和开源模型分开来看,差异就更加明显。
大部分闭源模型通常只有一到两家服务商提供,最多大约五家。原因是,闭源模型要么由模型开发者自己提供,要么由模型开发者和其他服务商签订合作协议,再由这些合作方提供相应的推理服务。比如Anthropic就与亚马逊、谷歌和Microsoft Azure等平台有合作,因此这些平台也可以提供Anthropic的模型。这自然限制了能够提供同一个闭源模型的服务商数量。
但开源模型的情况很不一样。我们看到,大约有15—20个模型同时被超过10家不同的服务商提供,而且这些全部都是开源模型。
这是因为任何服务商都可以下载这些开源模型,然后自己部署并提供推理服务。
所以这里一个很重要的现象是:在开源模型的推理服务市场里,竞争非常激烈,因为很多服务商提供的其实是完全相同的模型。
既然提供的是同一个模型,竞争就更多转向模型之外的服务能力,比如价格、响应速度(延迟)、吞吐量,以及其他推理服务特征。
但闭源模型的情况不太一样。闭源市场里一个很重要的竞争维度,就是模型本身。也就是说,不同模型的能力差异,本身就是竞争优势的重要来源。
所以从这个角度看,开源和闭源实际上形成了两种不同的竞争结构:开源模型更多是在“同一个模型之上”竞争服务,闭源模型则更多是在“不同模型之间”竞争能力。
06
同一开源模型之上,服务商究竟在竞争什么?
另外一个很有意思的地方,是推理服务提供商之间的差异化。刚才我说过,这些提供开源模型的推理服务商,实际上往往都在提供同样的模型。比如它们都可以提供DeepSeek,也都可以提供通义千问等等。既然模型本身是一样的,它们就必须从其他方面形成差异。

上图展示的,就是同一个模型下,不同服务商在响应速度上的差异。具体来说,我们把每一家服务商的延迟,与提供同一模型、响应最快的那家服务商进行比较。比如,几家服务商都提供同一个DeepSeek模型,如果最快的一家需要1秒,另一家需要2秒,那么后一家的延迟就是最快那家的2倍。用同样的方法,我们也可以比较不同服务商在吞吐量,以及上下文窗口等方面的差异。
从图里可以看到,即使提供的是完全相同的模型,不同服务商之间的表现仍然可能相差很大。比如在响应速度上,大约有15%的“服务商—模型”组合,其延迟会达到同一模型最快服务商的5倍。也就是说,同样运行一个模型,有的服务商响应很快,有的却可能慢很多。
除了响应速度之外,不同服务商在单位时间内能处理多少内容、一次能够处理多长的上下文等方面,也存在明显差别。
所以,即使大家提供的是同一个模型,彼此之间并不是完全一样的。它们仍然可以通过更快的响应速度、更高的处理能力,或者一次处理更长内容的能力来吸引用户。
07
为什么新发布的模型并不都在最前沿?
接下来,我们来看模型本身。整体而言,大模型的智能水平在不断提高。
这里所说的“智能”,采用的是独立AI评测机构Artificial Analysis发布的智能指数(Artificial Analysis Intelligence Index)。简单来说,这个指数综合了多项基准测试的结果,用来衡量模型在推理、编程、知识等任务上的整体能力。指数越高,意味着模型的综合表现越强。

上图展示的是每一个时间点上最强模型的智能水平。大家可以看到,模型的整体能力一直在提高。同时,每一次能力跃升的幅度似乎也在逐渐变小,而且出现在最前沿的模型开发者也越来越多。
最开始,最前沿的模型基本上主要来自OpenAI。现在有时候是DeepSeek,有时候是 OpenAI,有时候是Gemini。总体来看,模型能力在持续提高。
刚才我们看的是每一个时间点最强的模型。但如果把视角从“最强模型”转向新发布模型的整体能力分布,也会看到一个很有意思的变化。

具体来说,在每一个时间点,我们都把此前六个月内发布的模型放在一起,观察它们的智能指数分布。随着时间向前推,这个“过去六个月”的窗口也会不断向前移动。通过这种方式,我们就可以看到,新发布模型的整体能力水平是如何变化的。
这里有几个很有意思的地方。首先,新发布模型的整体能力在不断提高,但模型之间的能力差距也在扩大。如果把新发布的模型从能力较低到较高排列起来,处在中间位置的模型越来越强;但这并不意味着新模型都在向最前沿靠拢。新发布的模型中,既有处在最前沿的模型,也仍然有一些能力相对较低的模型。
这说明,虽然模型整体能力一直在提高,但今天仍然会有一些新模型发布出来,它们的能力可能也只相当于两年前最好的模型。
所以,并不是只有最强的模型之间才有竞争。能力不同的模型,也都在各自的市场里相互竞争。
在下篇中,Mert Demirer将进一步讨论大模型推理价格为何快速下降,以及差异化、模型替代与多模型并用如何共同塑造大模型市场格局,敬请期待。
完整视频回放请访问我们的 YouTube 官方频道👉🏻
https://www.youtube.com/watch?v=Rv0cOVDydVo&t=111s







