Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

多模态模型Meta Llama预览版

Muse Glimmer 30B

Muse Glimmer 30B 是 Meta 的多模态推理模型,支持文本和图像输入、原生工具调用与独立推理输出。

输入价格

公开资料未说明

输出价格

公开资料未说明

多模态推理Agent工具调用
多模态模型MiniMax稳定版

MiniMax-M3

MiniMax 当前旗舰多模态编程模型,面向代码和复杂工程任务,支持 1M 上下文。

输入价格

公开资料未说明

输出价格

公开资料未说明

代码开发Agent复杂工程任务
多模态模型美团 LongCat即将下线

LongCat Flash Omni 2603

LongCat 官方更新日志显示该旧模型已于 2026 年 5 月 29 日停止调用,正式接入应迁移到 LongCat 2.0。

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉理解语音交互多模态助手
多模态模型Cohere稳定版

Command A+

Command A+ 是 Cohere 于 2026 年 5 月发布的开源企业模型,面向复杂推理、多模态和多语言 Agent 任务。

输入价格

公开资料未说明

输出价格

公开资料未说明

企业部署Agent多语言
多模态模型阶跃稳定版

Step 3.7 Flash

Step 3.7 Flash 是阶跃星辰当前公开的旗舰多模态推理模型,支持图片、视频输入、推理强度调节、工具调用和 Agent 工作流。

输入价格

公开资料未说明

输出价格

公开资料未说明

推理多模态Agent
多模态模型腾讯稳定版

UI-Mate 9B

UI-Mate 9B 是腾讯于 2026 年 8 月发布的 GUI Agent 视觉语言模型,面向桌面操作和计算机使用任务。

输入价格

公开资料未说明

输出价格

公开资料未说明

GUI AgentComputer Use桌面自动化
多模态模型腾讯稳定版

UI-Mate 27B

UI-Mate 27B 是腾讯于 2026 年 8 月发布的 GUI Agent 视觉语言模型,面向复杂桌面操作和计算机使用任务。

输入价格

公开资料未说明

输出价格

公开资料未说明

GUI AgentComputer Use复杂桌面自动化
多模态模型Amazon Nova稳定版

Nova Pro

Amazon Nova V1 主力多模态模型,强调准确率、速度与成本平衡,适合通用生产接入。

输入价格

$0.80 / 1M Tokens

输出价格

$3.20 / 1M Tokens

通用生产文档分析视觉理解
多模态模型Amazon Nova稳定版

Nova Premier

Amazon Nova V1 当前最强的理解类多模态模型,适合复杂企业任务、长上下文分析和蒸馏教师模型场景。

输入价格

$2.50 / 1M Tokens

输出价格

$12.50 / 1M Tokens

复杂分析长上下文企业 Agent
多模态模型Amazon Nova稳定版

Nova Lite

Amazon Nova V1 低成本多模态模型,主打高吞吐和快响应,适合大规模输入理解场景。

输入价格

$0.06 / 1M Tokens

输出价格

$0.24 / 1M Tokens

高并发成本敏感多模态理解
多模态模型Amazon Nova稳定版

Nova 2 Lite

Amazon Nova 2 当前公开主力多模态理解模型,支持 1M 上下文、推理和内置工具,适合新一代 Agent 工作流。

输入价格

$0.33 / 1M Tokens

输出价格

$2.75 / 1M Tokens

长上下文推理任务Agent
多模态模型NVIDIA预览版

Nemotron 3 Nano Omni Reasoning

Nemotron 3 Nano Omni Reasoning 是 NVIDIA 面向全模态推理的模型,支持图像、视频、语音和文本理解,适合多模态 Agent 与复杂场景分析。

输入价格

公开资料未说明

输出价格

公开资料未说明

多模态推理视频理解语音理解
多模态模型商汤预览版

SenseNova U1

SenseNova 当前旗舰多模态模型,公开口径支持图像加文本输入,并可同时输出文本与图片。

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉理解图文生成深度调研
多模态模型小米稳定版

MiMo-V2.5

MiMo 当前主力全模态理解模型,支持图像、视频、音频与文本输入,并具备原生 Agent 执行能力和 1M 上下文。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

多模态问答Agent内容理解
多模态模型小米即将下线

MiMo-V2-Omni

小米 MiMo 官方模型页提示 MiMo-V2 系列已于 2026 年 6 月 30 日正式下线,原模型名称已失效,应迁移到 V2.5 系列。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

视觉理解语音理解多模态助手
多模态模型Microsoft稳定版

Phi-Ground-Any-4B

Phi-Ground-Any-4B 是 Microsoft 的 GUI grounding 模型,可将自然语言指令定位到图像界面中的目标区域,服务于电脑操作 Agent。

输入价格

公开资料未说明

输出价格

公开资料未说明

GUI 定位电脑操作Agent
多模态模型Microsoft稳定版

Fara1.5-4B

Fara1.5-4B 是 Microsoft Research AI Frontiers 发布的浏览器 Computer Use Agent,通过截图理解网页并输出结构化点击、输入、滚动等动作。

输入价格

公开资料未说明

输出价格

公开资料未说明

电脑操作浏览器 Agent开放权重
多模态模型Microsoft稳定版

Fara1.5-9B

Fara1.5-9B 是 Microsoft Research AI Frontiers 发布的浏览器 Computer Use Agent,通过截图理解网页并输出结构化点击、输入、滚动等动作。

输入价格

公开资料未说明

输出价格

公开资料未说明

电脑操作浏览器 Agent开放权重
多模态模型Microsoft稳定版

Fara1.5-27B

Fara1.5-27B 是 Microsoft Research AI Frontiers 发布的浏览器 Computer Use Agent,通过截图理解网页并输出结构化点击、输入、滚动等动作。

输入价格

公开资料未说明

输出价格

公开资料未说明

电脑操作浏览器 Agent开放权重