Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

语音模型Google预览版

Gemini 2.5 Flash Live Preview

Gemini 2.5 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。

计费价格

$0.50 / 1M Tokens

输入形式

音频 / 视频 / 文本

实时语音语音助手音频对话
语音模型Google预览版

Gemini 2.5 Flash Text-to-Speech

Gemini 2.5 Flash Text-to-Speech 是 Google 的语音合成模型,适合语音合成、语音助手等语音输出场景。 当前仍是预览版。

计费价格

$0.50 / 1M Tokens

输入形式

文本

语音合成语音助手配音内容
语音模型Google预览版

Gemini 2.5 Pro Text-to-Speech

Gemini 2.5 Pro Text-to-Speech 是 Google 的语音合成模型,适合语音合成、语音助手等语音输出场景。 当前仍是预览版。

计费价格

$1.00 / 1M Tokens

输入形式

文本

语音合成语音助手配音内容
语音模型Google预览版

Gemini 3.1 Flash Live Preview

Gemini 3.1 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。

计费价格

$0.75 / 1M Tokens

输入形式

文本 / 图像 / 音频 / 视频

实时语音语音助手音频对话
语音模型通义稳定版

Qwen3-ASR 1.7B

Qwen3-ASR 1.7B 是 Qwen 2026 年 6 月发布的开放权重自动语音识别模型,支持多语种、方言和代码切换识别。

计费价格

公开资料未说明

输入形式

音频

语音识别多语种方言识别
语音模型通义稳定版

Qwen3-ASR 0.6B

Qwen3-ASR 0.6B 是 Qwen 2026 年 6 月发布的轻量开放权重自动语音识别模型,适合低成本、多语种语音转文字。

计费价格

公开资料未说明

输入形式

音频

轻量语音识别多语种本地部署
语音模型通义稳定版

Qwen3 ForcedAligner 0.6B

Qwen3 ForcedAligner 0.6B 是 Qwen 2026 年 6 月发布的开放权重语音强制对齐模型,用于将语音与文本进行时间戳对齐。

计费价格

公开资料未说明

输入形式

音频 / 文本

语音对齐时间戳字幕处理
语音模型xAI预览版

Grok Speech to Text

Grok Speech to Text 是 xAI 的语音识别模型,用于音频转写和语音输入处理。

计费价格

公开资料未说明

输入形式

音频

语音转写语音输入多模态 Agent
语音模型xAI预览版

Grok Text to Speech

Grok Text to Speech 是 xAI 的文本转语音模型,用于语音输出和语音 Agent 场景。

计费价格

公开资料未说明

输入形式

文本

文本转语音语音 Agent语音输出
语音模型xAI稳定版

Voice Agent API

Voice Agent API 是 xAI 当前公开的实时语音会话能力线,面向低延迟语音交互和语音 Agent。

计费价格

$0.05 / min

输入形式

音频 / 文本

语音助手实时通话语音 Agent
语音模型xAI稳定版

Text to Speech

Text to Speech 是 xAI 当前公开的文本转语音能力线,适合语音播报和语音助手输出。

计费价格

$4.20 / 1M characters

输入形式

文本

文本转语音语音播报语音助手
语音模型xAI稳定版

Speech to Text REST

Speech to Text REST 是 xAI 当前公开的语音转文本批处理能力线,适合录音转写和离线识别。

计费价格

$0.10 / hr

输入形式

音频

录音转写批处理识别语音输入
语音模型火山预览版

Seed Audio 1.0

Seed Audio 1.0 是字节跳动 Seed 团队于 2026 年 7 月发布的音频创作模型,面向全场景音频生成。官方页面暂未公开稳定 API 模型 ID。

计费价格

公开资料未说明

输入形式

文本 / 音频

音频生成音乐创作音效创作
语音模型智谱稳定版

GLM-TTS

GLM-TTS 是智谱当前文本转语音模型,支持非流式与流式语音合成。

计费价格

公开资料未说明

输入形式

文本

语音播报有声内容语音助手
语音模型智谱稳定版

GLM-TTS-Clone

GLM-TTS-Clone 是智谱当前音色克隆模型,可用短音频快速生成专属音色。

计费价格

公开资料未说明

输入形式

文本 / 音频

音色克隆情感配音角色语音