Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

语音模型NVIDIA预览版

Nemotron-Voicechat

语音对话模型,支持用户语音输入、代理文本与语音输出,以及用户语音转写。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音助手双向语音交互英文语音对话
语音模型Stability AI稳定版

Stable Audio 3.0 Medium

Stable Audio 3.0 Medium 是 Stability AI 面向更高音乐性和更长音频生成的开放权重模型。

计费价格

公开资料未说明

输入形式

文本

音乐生成长音频开放权重
语音模型Stability AI稳定版

Stable Audio 3.0 Large

Stable Audio 3.0 Large 是 Stability AI 面向音乐平台和创意应用的高阶音频生成模型。

计费价格

公开资料未说明

输入形式

文本 / 音频

音乐生成高吞吐创意应用
语音模型Stability AI稳定版

Stable Audio 2.5

Stable Audio 2.5 是 Stability 当前公开计费的音频生成服务,支持从文本或音频样本生成音频。

计费价格

公开资料未说明

输入形式

文本 / 音频

音乐与音频生成文本转音频音频样本续写
语音模型Pika稳定版

Pika Music

Pika Music 是 Pika 于 2026 年 8 月发布的音乐生成模型,支持文字、歌词、参考音乐和创意方向生成完整歌曲。

计费价格

公开资料未说明

输入形式

文本 / 音频

音乐生成歌曲创作音频创作
语音模型Pika稳定版

Pika SFX

Pika SFX 是 Pika 于 2026 年 8 月发布的音效生成模型,可根据文字描述生成 44.1kHz 立体声音效和环境声。

计费价格

公开资料未说明

输入形式

文本

音效生成环境声视频后期
语音模型Pika稳定版

Pika Soundtrack

Pika Soundtrack 是 Pika 于 2026 年 8 月发布的视频配乐生成模型,可根据视频内容生成同步的音乐和声音设计。

计费价格

公开资料未说明

输入形式

文本 / 视频

视频配乐声音设计音画同步
语音模型Pika稳定版

Pika Speech

Pika Speech 是 Pika 于 2026 年 8 月发布的语音生成模型,支持预设音色和用户授权的声音克隆。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音生成声音克隆旁白
语音模型小米稳定版

MiMo-V2.5-ASR

MiMo-V2.5-ASR 是小米 2026 年 4 月发布的开源语音识别模型,支持中英双语、中文方言、代码切换、歌词识别、噪声环境和多说话人场景。

计费价格

公开资料未说明

输入形式

音频

语音识别中文方言多说话人
多模态模型小米稳定版

MiMo-V2.5

MiMo 当前主力全模态理解模型,支持图像、视频、音频与文本输入,并具备原生 Agent 执行能力和 1M 上下文。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

多模态问答Agent内容理解
多模态模型小米即将下线

MiMo-V2-Omni

小米 MiMo 官方模型页提示 MiMo-V2 系列已于 2026 年 6 月 30 日正式下线,原模型名称已失效,应迁移到 V2.5 系列。

输入价格

¥2.80 / 1M Tokens

输出价格

¥14.00 / 1M Tokens

视觉理解语音理解多模态助手
语音模型小米稳定版

MiMo-V2.5-TTS

MiMo-V2.5-TTS 使用内置高质量音色做语音合成,支持唱歌模式与更细粒度的风格控制。

计费价格

限时免费

输入形式

文本

语音合成配音语音助手
语音模型小米即将下线

MiMo-V2-TTS

小米 MiMo 官方模型页提示 MiMo-V2 系列已于 2026 年 6 月 30 日正式下线,原模型名称已失效,应迁移到 V2.5 系列。

计费价格

限时免费

输入形式

文本

语音合成默认音色文本转语音
语音模型Microsoft稳定版

VibeVoice-ASR-BitNet

VibeVoice-ASR-BitNet 是 Microsoft 发布的多语言低资源语音识别模型,采用 BitNet 量化以支持 CPU 推理。

计费价格

公开资料未说明

输入形式

音频

语音识别多语言CPU 推理
视频生成Pika稳定版

Pikaformance

Pika 当前公开的表演驱动视频模型,适合音频驱动的人像表演与角色演绎视频。

计费价格

公开资料未说明

生成形式

performance_video

数字人表演音频驱动视频角色口播