Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

语音模型Deepgram稳定版

Deepgram Flux TTS

Deepgram Flux TTS 是 2026 年 8 月发布的面向实时语音 Agent 的对话式文本转语音模型,支持跨轮上下文、打断处理和流式输出。

计费价格

公开资料未说明

输入形式

文本

实时语音 Agent对话式 TTS低延迟语音
语音模型阶跃稳定版

step-1o-audio

提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。

计费价格

¥25.00 / 1M Tokens

输入形式

音频 / 文本

实时交互工具调用Agent
语音模型Deepgram稳定版

Flux General English

Deepgram 当前面向英语实时语音 Agent 的 Flux 会话转写模型,主打 turn detection、打断处理和更低语音交互延迟。

计费价格

公开资料未说明

输入形式

音频

实时语音 Agent电话机器人低延迟对话
语音模型Deepgram稳定版

Flux General Multilingual

Deepgram 当前面向多语言实时对话的 Flux 版本,适合跨语言客服、语音助手和多语种语音 Agent。

计费价格

公开资料未说明

输入形式

音频

多语言实时对话语音 Agent跨语言客服
语音模型Amazon Nova稳定版

Nova Sonic

Amazon Nova V1 语音对话模型,支持实时双向流式语音理解与生成,适合语音助手和客服交互。

计费价格

公开资料未说明

输入形式

音频

语音助手实时客服双向语音
语音模型Amazon Nova稳定版

Nova 2 Sonic

Amazon Nova 2 语音对话模型,兼顾文本与语音输入输出,适合下一代语音 Agent 和低时延交互。

计费价格

公开资料未说明

输入形式

音频 / 文本

语音 Agent低时延交互多轮对话
语音模型NVIDIA稳定版

NemotronLabs VoiceChat 11B

NemotronLabs VoiceChat 11B 是 NVIDIA 于 2026 年 7 月发布的端到端全双工实时语音模型,支持自然轮流对话、打断和实时工具调用。

计费价格

公开资料未说明

输入形式

音频

实时语音全双工对话语音 Agent
语音模型NVIDIA稳定版

Nemotron 3.5 ASR Streaming 0.6B

Nemotron 3.5 ASR Streaming 0.6B 是 NVIDIA 于 2026 年 5 月发布的多语种流式语音识别模型,面向实时转写和语音 Agent。

计费价格

公开资料未说明

输入形式

音频

流式语音识别实时转写多语种
语音模型NVIDIA预览版

Nemotron-Voicechat

语音对话模型,支持用户语音输入、代理文本与语音输出,以及用户语音转写。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音助手双向语音交互英文语音对话
语音模型Cartesia稳定版

Sonic 3.5

Sonic 3.5 是 Cartesia 当前公开的新一代流式文本转语音模型,适合实时语音 Agent、低延迟交互和高自然度语音生成。

计费价格

公开资料未说明

输入形式

文本

实时语音 Agent低延迟 TTS高自然度语音
语音模型Cartesia稳定版

Ink-2

Ink-2 是 Cartesia 于 2026 年 7 月 9 日发布的语音识别模型,重点优化实时语音 Agent 的转写、端点检测和上下文理解。

计费价格

公开资料未说明

输入形式

音频

实时语音 Agent低延迟转写端点检测
语音模型Cartesia稳定版

Sonic-3

Sonic-3 是 Cartesia 当前最新的流式 TTS 主力模型,强调更自然的表达、更细的情绪与速度控制,以及实时语音交互。

计费价格

公开资料未说明

输入形式

文本

实时语音 Agent电话机器人高自然度语音
语音模型AssemblyAI稳定版

Universal-3.5 Pro Realtime

Universal-3.5 Pro Realtime 是 AssemblyAI 于 2026 年 6 月发布的实时语音识别模型,支持上下文感知转写和低延迟语音 Agent。

计费价格

公开资料未说明

输入形式

音频

实时转写语音 Agent低延迟交互
语音模型AssemblyAI稳定版

Universal-3 Pro Streaming

Universal-3 Pro Streaming 是 AssemblyAI 当前高准确率实时转写主力模型,适合低延迟语音 Agent 和电话流式场景。

计费价格

公开资料未说明

输入形式

音频

实时语音 Agent电话机器人高准确率流式转写
语音模型Speechmatics稳定版

Realtime STT Enhanced

Speechmatics 的 Realtime STT Enhanced 面向更高准确率的实时语音识别,适合语音 Agent、直播和高要求电话场景。

计费价格

公开资料未说明

输入形式

音频

高准确率实时转写语音 Agent直播字幕
语音模型Speechmatics稳定版

Speechmatics Flow

Speechmatics Flow 是官方公开的 Voice Agent 工作流能力线,负责实时对话编排、TTS 返回和工具调用。

计费价格

公开资料未说明

输入形式

音频 / 文本

语音 Agent实时对话工具调用