嵌入向量模型决定了你的检索系统到底能捞回什么——它把每段输入压成一个向量,让相关的东西彼此靠近,应用于是能按语义而非字面去检索。正因如此,选哪个模型永远是RAG、多语言档案库、代码仓库和图文集合各自不同的考题。OpenRouter在9月11日核实了自家嵌入模型目录,共37个条目,并通过embeddings API向19个模型发了批量请求、跑了28项检查,用一份实测指南把选型逻辑摊开。
最实用的结论是分场景给候选人。英文RAG默认从openai/text-embedding-3-small起步,它价格低、上下文8192token、维度还可调;当输入超过8192token,或想在Voyage4各档间切换而不重建索引时,就测voyage-4-large,它给到32000token上下文和四档可选维度,且与其他Voyage4层级向量兼容;想要开放权重替代,qwen3-embedding-8b有更长上下文窗和更低提示词价。多语言检索交给qwen3-embedding-8b(公开权重、支持100多种语言),代码搜索用voyage-code-4,文本加图像检索则选google/gemini-embedding-2或voyage-multimodal-3.5。付费文本里最便宜的是perplexity/pplx-embed-v1-0.6b,每百万输入token仅0.004美元;免费文本路由nvidia/nemotron-3-embed-1b:free则带32768token上下文。

把入围选手摆在一张表里,差异一目了然。text-embedding-3-small是文本、8192上下文、1536维、每百万token0.02美元、闭源;3-large同为8192上下文但3072维、0.13美元。Voyage4家族整齐划一:lite、标准版、large、code-4、multimodal-3.5都是32000上下文、1024维,价格从0.02到0.12美元不等,全部闭源。Qwen3Embedding8B是文本、32768上下文、4096维、每百万token仅0.01美元且开放权重;4B版2560维、0.02美元。Perplexity的0.6B与4B分别是1024维0.004美元、2560维0.03美元,均开放。Gemini Embedding2覆盖文本与图像、8192上下文、3072维,文本每百万token0.20美元、图像token0.45美元,闭源;NVIDIA那条免费路由则是32768上下文、2048维、覆盖34种语言。目录里还有bge-m3、mistral-embed、codestral-embed等备选,不过指南重点测的是前面这批。
实测方法值得一说。OpenRouter向19个模型发了双字符串批量请求,覆盖批量输入、可配置维度、图像输入、文本加图像和错误处理共28项检查,16个付费模型每个输入都稳稳返回一个向量。dimensions参数在OpenAI3Small、Gemini2和Voyage4Large上均生效,比如把值设成256或512就真返回对应长度的向量;向不存在的模型发请求会收到400错误并提示模型不存在。不过要划清边界:这些检查确认的是请求与响应行为,不是检索质量,响应时间也被排除,因为每个模型的服务条件不同。三条免费路由在测试账户里返回了404,原因是该账户隐私设置关掉了允许用免费模型提示词训练的提供商——这恰恰提醒开发者,免费开关、工作区护栏或provider.data_collection设为deny,都会让这类请求直接404。
落到具体场景,英文RAG默认1536维的Small是Large的一半,首次评估保留默认,只有存储或搜索成本成为瓶颈才考虑缩减;用dimensions=256能进一步压小向量,但可能伤检索质量,改现有索引前务必先试。Voyage4系列支持256、512、1024、2048四档维度,且官方声明4系列向量彼此兼容,换档位不必重建索引。多语言这边Qwen3Embedding8B默认返回4096维、MTEB多语言得分厂商报出70.58,4B版只要2560维、更省资源;bge-m3作为第二开放多语言选项,8192上下文、1024维。代码搜索首选voyage-code-4,codestral-embed-2505可作对比,CoIR基准能帮着横向比。图文检索里Gemini Embedding2把两种输入放进同一向量空间,一张64乘64的PNG算258个token、费用0.000128美元;voyage-multimodal-3.5同样验证过,64乘64PNG仅89个token、费用0.00003美元,但两者向量空间不同,建索引前得先定一个。
评测上OpenRouter的建议很克制:同一套语料库、查询、相关性标签、分块和指标,只换模型,其余全部固定,结果才可比。英文RAG从512到1024token的块加重叠起步,用nDCG衡量多块相关时的排序;多语言要逐语言上报别让平均数掩盖短板;代码搜索把issue描述映射到解决它的文件和分块。存储成本也要算进账:100万个4096维float32向量约占16.4GB,100万个1024维约4.1GB,公式是向量数乘维度乘每值字节数,选满足目标的最小维度最划算。
最后是一道铁律:不同模型族的向量不共享坐标空间,用3-small建的索引就必须用它生成查询向量,混用只会得到不可靠结果;Gemini2和001也不同空间,切换要重建。唯一有文档记录的例外是Voyage4族内兼容,换档位前先在样本上验证检索质量。部署时记得把模型slug、输出维度、提示词格式和创建日期随索引元数据一起存好,方便后续核对配置。至于那些常见疑问——换模型通常要重嵌整个语料、最快模型没跑延迟基准、ada-002已不再作为新索引默认、免费路由404先查隐私设置——指南都给了直白答复。对正要搭检索系统的开发者来说,这份把19个模型按用例、价格、维度排好队的清单,省下的试错成本相当可观。





