Token导航 LogoToken导航TokenDH.com

加州大学戴维斯分校打造的AI“模型红娘”:从数十万个AI模型中为你找到最合适的那一个

更新时间 2026-05-16来源 科技行者正文 9079字阅读约 29分钟

这项由加州大学戴维斯分校联合亚利桑那州立大学、摩根士丹利共同完成的研究,以预印本形式于2026年5月8日发布,论文编号为arXiv:2605.07075,有兴趣深入了解的读者可以通过该编号查询完整论文。

每天都有新的AI模型诞生。HuggingFace这个全球最大的AI模型托管平台上,如今已有数十万个大大小小的预训练模型,覆盖文字、图像、语音、代码等几乎所有任务类型。面对如此庞大的"模型超市",当一个开发者或研究者需要为某个具体任务挑选合适的AI模型时,往往会陷入一种茫然:这么多模型,到底哪个最适合我的需求?

这个问题听上去好像不难解决,实际上却出奇地棘手。传统的做法是把所有候选模型都跑一遍,用自己的数据测试一轮,然后比较结果。但当候选模型多达数万个时,这种方法根本不可行——时间和计算资源都承担不起。更麻烦的是,很多新模型刚刚发布,根本没有在任何公开基准上留下评测记录;很多新任务也是首次出现,没有任何历史参考。旧有的模型选择方法,要么只能在一个小池子里挑,要么必须先把每个候选模型在你的数据上跑一遍,这两条路在现实中都走不通。

正是为了解决这个困境,研究团队提出了一个叫做MODELLENS的框架,中文可以理解为"模型透镜"或"模型红娘"。它的核心思路是:与其每次都从头测试,不如从海量的公开评测记录中学习规律,再把这种规律迁移到新的模型和新的任务上。这项研究构建了一个包含162万条评测记录的大规模数据集,涵盖4.7万个模型和9600多个数据集,是目前该领域规模最大、覆盖最广的基准之一。

一、为什么挑模型这么难?旧方法有哪些死穴

以烹饪来打比方:现在市面上有几十万种调味料,你想做一道新菜,需要找出最适合的那一种。旧有的方法分三类。第一类是"家庭食谱法",也就是AutoML(自动化机器学习):这类方法会帮你在一个提前准备好的小调味料箱子里挑,但箱子里只有几十种,远不是市场上的全部。第二类是"亲自试吃法",也就是迁移性估计(Transferability Estimation):这类方法需要你把每种候选调味料都尝一口,也就是在你的数据上跑一遍,才能评分,几十万种调味料一个个尝根本不现实。第三类是"点菜路由法",也就是Model Routing(模型路由):这类方法假设你已经确定了一个小菜单,只负责在菜单里调度,根本不帮你决定菜单应该包含哪些菜。

这三类方法各有各的短板,可以归纳为三个维度的不足。规模上,前两类都无法处理数十万量级的候选模型;泛化上,迁移性估计和路由方法都依赖于在目标数据上运行候选模型,碰到全新发布的模型或从未评测过的数据集就无能为力;异质性上,真实世界的评测标准五花八门,同一个任务可能用准确率、F1分数、BLEU、METEOR等不同指标衡量,同一个模型在不同指标下的排名可能完全不同,而现有方法大多只考虑单一指标。

研究团队把这三个维度的挑战总结为"野外模型推荐"(model recommendation in the wild)问题,意思是在真实、混乱、大规模的开放生态中找到最合适的模型,而不是在受控的实验室环境里做选择。

二、关键洞察:公开排行榜上藏着一张隐秘的能力地图

MODELLENS的核心灵感来自一个朴素的观察:互联网上那些散落在各处的模型评测记录,虽然看起来杂乱无章,但如果把它们汇聚在一起,就会浮现出一张关于模型能力的隐秘地图。

研究团队把这个思路具象化成了一张真实的可视化图(也就是论文中展示的那张"模型-数据集图谱")。他们把4.7万个模型和9600多个数据集都画在同一张图上,每个点代表一个模型,每个星号代表一个数据集,位置由从评测记录中学习到的相似性决定。结果发现,当用评测交互数据来确定位置时,图上的点自然而然地按功能类型聚成了几大簇:文本大模型扎堆在一起,视觉模型聚在另一角,语音模型自成一派,多模态模型居于中间地带。这种聚类完全来自数据本身,没有人告诉模型"BERT应该靠近GPT",是评测记录自己"说出来"的。

相比之下,如果只用模型的文字描述(比如名称和说明文档)来确定位置,图上就是一锅粥,各种类型的模型混杂在一起,看不出任何有意义的结构。这说明文字描述只捕捉了表面语义,而评测交互记录才真正反映了模型的功能本质。

以MMMU(一个大型多学科多模态理解基准)为例,当把这个数据集放进基于评测记录学习的图谱,它的邻居恰好是Gemini-2.5-Pro、Step3-VL-10B、Seed-1.5-VL等真正在多模态任务上表现出色的顶级模型。而如果只用文字描述来找邻居,跑出来的却是DeBERTa-MNLI(一个自然语言推理模型)和DiT-Classifier(一个图像分类模型),它们名字里确实有"multimodal"或"understanding"之类的词,但在MMMU上的实际表现根本不值一提。

这个对比清楚地说明了:只看描述文字找模型,就像只看书名买书,容易买到挂羊头卖狗肉的;而从评测记录中学习,才是真正看了书的内容再决定要不要买。

三、MODELLENS怎么运作:一套精心设计的"配对引擎"

MODELLENS的工作方式可以用相亲平台来理解。它的目标是,给定一个"目标数据集"(相当于一个对象),从数万个候选模型(相当于相亲对象)中找出最匹配的那几个,而且不需要把每个候选者都"约出来见面"(也就是不需要在目标数据集上跑)。

为了实现这个目标,MODELLENS从三个角度来描述每一个模型和每一个数据集。对于模型,它同时使用了三种互补的"身份证明":一个是学习到的ID嵌入(相当于这个模型在训练期间积累的"个人履历",记录了它在哪些数据集上表现如何);一个是把模型名称拆成字词再编码的"名字嵌入"(比如"llama-3.1-70b"这个名字包含了家族、版本、规模等信息);还有一个是用预训练文本编码器处理模型文字说明得到的"描述嵌入"(捕捉模型的大致功能定位)。对于数据集,则使用ID嵌入和描述嵌入两种表示。

除此之外,MODELLENS还专门对每个模型的两个结构属性进行编码:一个是模型规模(参数量,被划分成21个档位),另一个是架构家族(比如LLaMA家族、ViT家族、Whisper家族等,共348种)。这两个属性的引入不是随意的,背后有深刻的现实依据:大量的研究已经证明,更大的模型在很多任务上确实表现更好(这就是所谓的"神经网络规模定律"),而来自同一个架构家族的模型往往有相似的擅长领域和弱点。

在评分机制上,MODELLENS采用了一种"底层规律加精细调整"的两层设计。第一层叫做"结构先验",它只看模型的规模和架构家族,用一个小型神经网络输出一个基础分,反映的是"这种类型的模型总体上在这类任务上表现如何"。第二层叫做"残差交互",它把模型的全部描述、数据集的全部描述、任务类型、评测指标都一起输入,用一个更大的神经网络输出一个精细调整分,反映的是"这个具体的模型对这个具体的数据集在这个具体的指标下的特殊契合度"。最终分数是两层相加,再除以一个可学习的温度参数来控制分布的陡峭程度。

这种设计带来了一个实用的好处:分数是可解释的。一个模型得分高,可以追溯到它是因为"本身能力强"(结构先验高)还是因为"对这个任务特别适配"(残差交互高),这对用户做决策很有帮助。

四、冷启动问题:如何处理"没有履历"的新模型

相亲平台里最难搞定的情况,是对方完全没有任何资料可查——刚注册的新用户,零互动记录。MODELLENS同样面临这个问题:每天都有新模型在HuggingFace上发布,它们没有任何历史评测记录,怎么给它们打分?

研究团队设计了一个叫做"ID丢弃"(ID Dropout)的训练技巧来解决这个问题。具体做法是:在训练过程中,以一定概率(10%)随机把某个模型或数据集的ID嵌入替换成一个通用的"未知占位符"。这样一来,系统就被迫在两种情况下都学会打分:有历史记录时,用历史记录精确打分;没有历史记录时,依靠名字、描述、规模和架构家族这些"第二手信息"来估算。

换句话说,这个训练过程同时培养了系统的两种能力:记忆能力(见过的就精准记住)和推断能力(没见过的靠线索推断)。在推断时,一个全新发布的模型会被自动映射到"未知占位符",系统就会依靠它的文字描述、名字结构、参数规模和所属架构家族来评估它的潜力,而这些信息在模型发布时通常都是公开可得的。

五、训练目标:三种信号同时学习

MODELLENS的训练同时使用了三种互补的学习信号,可以用"三重考核"来理解:第一种叫做"两两比较"(成对排名损失),系统每次看两个模型,判断哪个在给定数据集上更好,这帮助系统学习局部的相对优劣;第二种叫做"全员排队"(列表排名损失),系统一次看所有候选模型的完整排序,使用Plackett-Luce概率模型来衡量预测的全局排序有多准确,这帮助系统学习整体的排名结构;第三种叫做"绝对估分"(逐点回归损失),系统还要预测每个模型经过标准化处理后的实际分数,这帮助系统不只知道谁好谁差,还对好多少有一定的感知。

三种信号的最终贡献由权重控制:列表排名权重0.5,成对排名权重1.0,绝对估分权重0.1。消融实验(也就是逐一去掉某个组件看性能下降多少的实验)表明,列表排名损失贡献最大,去掉它性能下降最多;成对排名次之;绝对估分贡献最小,但不可或缺,主要起到"校准"作用。

六、数据从哪里来:162万条评测记录的诞生

整个框架的基础是一个自行构建的大规模评测数据集。研究团队从三个来源汇聚数据。HuggingFace模型库是最大的数据源,贡献了164万条原始记录;提取方式采用了三级流水线,优先读取结构化的YAML格式评测结果,次之读取模型卡片中的标准化元数据,最后用大语言模型解析README文档中的Markdown表格,三级可靠性依次递减。Open LLM Leaderboard(开放大模型排行榜)贡献了14.7万条记录,覆盖3495个大语言模型和43个基准数据集,评测密度高但品种相对单一。PapersWithCode(带代码的论文平台)贡献了1.08万条记录,覆盖面广但稀疏。

经过去重和清洗,最终得到162万条有效记录,覆盖4.7万个模型、9600多个数据集、2551种任务类型、8420种评测指标、348种架构家族。为了测试泛化能力,数据集被分成两种测试场景:一种是"性能补全",从已知数据集的记录中随机遮盖一部分,测试能否恢复;另一种是"冷启动泛化",把609个数据集和375个模型(按发布时间切分)完全从训练集中剔除,只在测试时出现。

七、实验结果:在三个战场上全面胜出

研究团队在三个不同的评测维度上验证了MODELLENS的效果,每个维度对应一类现实需求。

第一个战场是大规模模型推荐,也就是核心任务。在性能补全场景下,MODELLENS在加权Kendall's τ(一个衡量排名质量、对前排错误惩罚更重的指标)上得到0.868分,而最强基线ZAP只有0.763,Task2Vec更只有0.417,基于下载量的启发式方法甚至是负分。在新数据集冷启动场景下,MODELLENS得到0.745,ZAP只有0.253;在新模型冷启动场景下,MODELLENS得0.402,ZAP得0.307。这些数字说明,当面临真正的"野外"挑战——从没见过的数据集、从没见过的模型——时,MODELLENS的优势最为显著,而基线方法普遍大幅下滑。

第二个战场是视觉迁移学习场景,这是现有方法的主场。研究团队在Aircraft、Cars、DTD、Pets、Flowers102、Food101、Country211、EuroSAT八个视觉分类基准上与需要在目标数据集上跑一遍才能打分的迁移性估计方法正面交锋。在不做任何目标数据集推断的情况下(Feature Free模式),MODELLENS平均得到0.369,高于最强的特征无关基线ZAP的0.229和Task2Vec的0.011,甚至超过了多个需要跑前向传播的方法(比如H-Score的0.157、LEEP的0.152)。如果允许把候选模型在目标数据集上提取的特征作为可选补充(Feature Aug.模式),平均得分进一步升至0.609,在八个数据集上每一个都拿到了最高分。

第三个战场是与下游路由方法的协作。研究团队把MODELLENS推荐的模型池替换到现有的五种路由方法(KNNRouter、MLPRouter、RouterDC、GraphRouter、Router-R1)中,在NQ、PopQA、HotpotQA、Musique、Bamboogle五个问答基准上测试效果。结果非常一致:替换成MODELLENS推荐的模型池之后,所有五种路由方法在所有五个数据集上的表现都明显提升,平均提升幅度在21%到81%之间。其中KNNRouter的平均提升幅度最大,达到81.1%;Router-R1的提升幅度最小,但也有35.8%。这说明MODELLENS的价值不仅在于自身的推荐准确性,更在于它能作为任何下游路由系统的"上游基础设施",提供更优质的候选池。

替换逻辑也有一定的讲究:MODELLENS并不是无约束地推荐任何模型,而是在相近的参数规模(稠密模型看参数量,混合专家模型看活跃参数量)范围内找最优替代,确保推理成本与原来相当。比如,在NQ数据集上,原始池中的Mixtral-8x22B(约440亿活跃参数)被替换成了GPT-OSS-20B,Mistral-7B被替换成了Gemma-3n-E4B,规模相近但能力更强。

八、规模和家族的学习效果:系统发现了"更大通常更好"

研究团队还专门分析了MODELLENS是否真正从数据中学到了有意义的结构规律,而不是靠死记硬背。

在规模效应方面,把模型的预测分数(经过标准化处理)按参数量从小到大排列,会得到一条从左向右总体向上的趋势线:更大的模型总体上预测分数更高,与大量实证研究发现的神经网络规模定律完全吻合。不过在10亿参数以下的小模型区间,趋势波动较大,这是因为小模型里有很多专门为特定任务微调的模型(比如只做图像分类的视觉模型),它们在自己的擅长领域超越了体量更大的通用模型,导致规模优势在这个区间不那么稳定。

在架构家族方面,系统学到的家族优势因任务类型不同而差异显著。在信息检索任务上,BGE和MPNet家族遥遥领先;在问答任务上,Qwen和OLMo家族最为突出;在图像分类任务上,ConvNeXt和Swin家族处于优势地位;在语音识别任务上,各家族差异相对较小,Whisper和Wav2Vec2家族略有优势,但整体格局比其他任务域更均匀。消融实验进一步确认,把规模先验或家族先验任意去掉,性能都会下降,两者缺一不可,并且作用互补:规模提供全局趋势,家族捕捉任务特定结构。

九、两个真实案例:在从未见过的数据集上表现如何

研究团队还用两个在训练时完全未见过的新发布基准做了案例研究,测试MODELLENS在真实的"野外"场景中的可靠性。

第一个案例是NGQA,一个关于营养知识的图问答基准,包含三个子任务:二分类(某道菜适不适合某种饮食要求)、多标签分类(符合哪些饮食要求)和自由文本生成(生成饮食建议)。研究团队用MODELLENS在参数量不超过200亿的范围内为每个子任务各推荐了一个最优模型,结果MODELLENS推荐的Top-1模型在三个子任务上全部超越了原论文中作为默认基线的GPT-4o-mini。特别值得注意的是,三个子任务的最优模型并不一样——二分类最佳是Qwen3-8B-Instruct(得分0.815,GPT-4o-mini是0.593),多标签分类最佳是GPT-OSS-20B(得分0.325,GPT-4o-mini是0.304),文本生成最佳是Qwen3-8B-Instruct(得分0.556,GPT-4o-mini是0.372)——这说明MODELLENS不是用一个固定答案应对所有问题,而是真正在感知不同任务的不同需求。

第二个案例是RSVLM-QA,一个遥感图像视觉语言问答基准,研究团队从中取了图像描述子集,选了8个参数量在7B到8B之间的视觉语言模型,其中5个在原论文中有报告,另外3个是MODELLENS额外发现的。把MODELLENS给出的预测分数对比METEOR实际得分,两者的Kendall相关系数和Spearman相关系数都精确到了1.00,意味着预测排名和实际排名完全一致,一个都没错。最关键的是,MODELLENS额外发现的那3个模型(没有被原论文评测过),在图上的位置恰好落在由已评测模型拟合的趋势线上,表明MODELLENS的预测能力不只局限于给已知候选者排名,还能把真正优秀但尚未被发现的模型给挖掘出来。

十、消融实验与特征重要性:哪些信息最有价值

为了搞清楚每一部分设计的贡献,研究团队进行了系统的消融分析。

在损失函数层面,完整的三重损失(列表+成对+回归)得到最高的0.745分。去掉列表排名损失,降到0.632,是跌幅最大的;去掉成对排名损失,降到0.703;去掉回归损失,降到0.728,跌幅最小。单独只用成对损失得0.591,单独只用列表损失得0.649,说明任何单一损失都不如三者组合。

在特征重要性层面,研究团队用了两种互补的分析方法。一种是"逐一剔除"(LOO),也就是去掉某个特征看性能下降多少。结果显示,剔除模型ID下降最多(0.0487),其次是模型描述(0.0341),然后是模型名称(0.0287),数据集描述(0.0267),数据集ID最少(0.0205)。另一种是"Shapley值分析",衡量每个特征在所有可能的特征组合中平均贡献多少。Shapley分析揭示了一个LOO看不出来的现象:模型名称和模型描述存在明显的信息重叠——单独看它们各自都很重要,但组合在一起时边际贡献变小,因为它们捕捉的是相似的模型身份信息。这个发现对于进一步精简系统有参考价值。

十一、当遇到全新家族时:系统能否处理"历史上从未出现过"的模型

研究团队还专门设计了一个更严苛的测试:把2023年到2025年间崛起的13个主流大语言模型家族(包括Qwen、LLaMA、Mistral、Gemma、Phi、DeepSeek、Yi、Falcon、Granite、Aya、OLMo、Zephyr、Solar)的所有评测记录全部从训练数据中剔除,只在测试时出现,检验系统能否在对这些家族一无所知的情况下还能做出合理推荐。

结果表明,在最重要的Top-K质量指标上,这种"家族完全陌生"的情况对系统的影响相对有限。NDCG@10从有历史记录时的0.7605降到了0.7231,下降约4.9%。Hit@10甚至比完整模型高出0.008,说明系统在不知道这些家族具体历史表现的情况下,仍然能找对候选模型集合。相比之下,细粒度的全序排名能力(用加权Kendall τ衡量)下降更明显,这说明当面对同一家族内几个能力接近的检查点时,系统无法精确区分它们的顺序,但对于"找出好模型的集合"这个更实用的目标来说,影响并不严重。

不同家族受到的影响差异很大。Yi和Granite家族几乎没有损失(NDCG@10差距不超过0.013),说明它们的性能特征与训练集中已知家族高度相似,系统可以无缝迁移。而DeepSeek、OLMo、Gemma、Qwen等家族损失较大(NDCG@10差距在0.13到0.17之间),说明这些家族在训练和数据层面引入了一些已知家族覆盖不到的新特征,无法完全靠现有信息推断。

归根结底,MODELLENS做了一件很有价值的事:它把"从海量模型中选模型"这个本来靠运气和试错的过程,变成了一个可以从历史数据中学习、可以推广到新情况、可以在不运行任何模型的情况下给出有质量保证的推荐的系统。它不保证每次都找到绝对最优,但能大幅缩小搜索范围,把数万个候选模型压缩成一个质量更高的小池子,让后续的任何使用方式(直接部署、微调、组合路由)都从一个更好的起点出发。

对于普通的开发者和研究者来说,这意味着以后面对"哪个模型最适合我的任务"这个问题,不必再靠直觉猜测或费力穷举,有了一个更聪明的指引工具。当然,这个系统仍有局限:它依赖于公开排行榜数据,而排行榜本身对主流模型家族和热门基准有天然的偏向,冷门领域的覆盖仍然稀疏;对于闭源的商业模型,由于缺乏系统性的评测记录,推荐质量也会受到限制。这些都是后续研究可以继续深耕的方向。

有兴趣深入了解技术细节的读者,可以通过arXiv:2605.07075查阅完整论文,也可以访问论文GitHub页面(github.com/luisrui/ModelLens)或HuggingFace演示(huggingface.co/spaces/luisrui/ModelLens)直接体验系统。

Q&A

Q1:MODELLENS需要在目标数据集上运行候选模型吗?

A:不需要。MODELLENS的核心优势就在于完全不需要在目标数据集上运行任何候选模型。它只依靠模型的名称、文字描述、参数规模、架构家族,以及从历史评测记录中学到的规律,就可以直接预测哪些模型在新数据集上表现最好。这也是它能处理数万个候选模型的原因——传统方法要逐一运行根本不现实。

Q2:MODELLENS推荐的模型池替换路由方法的原始候选池后,为什么效果提升幅度差异这么大?

A:提升幅度差异主要来自两个因素。一是路由方法本身的基线性能:原始候选池质量越差,替换后提升空间越大,KNNRouter和MLPRouter原本候选池质量相对弱,所以提升幅度超过80%;Router-R1本身设计更先进,原始候选池已经不差,所以提升幅度约35%。二是数据集的特殊性:PopQA对参数化知识要求高,模型选择影响极大,HotpotQA需要多跳推理,不同模型能力差异显著。

Q3:MODELLENS在从未出现过的全新模型家族上表现会崩溃吗?

A:不会完全崩溃,但确实会有所下降。研究团队专门做了实验,把13个主流现代大模型家族(LLaMA、Qwen、Gemma等)全部从训练数据中移除。结果是,在找到好候选集合这个目标上(NDCG@10)只下降约5%,Hit@10甚至略有上升。真正损失较大的是细粒度排名能力,因为系统无法区分同家族内能力接近的模型。不同家族损失差异也很大,Yi和Granite几乎没有损失,而DeepSeek和Gemma损失较明显。

文章标签大模型学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多