Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

语音模型OpenAI稳定版

gpt-realtime-1.5

OpenAI 当前最新语音旗舰,适合语音助手、客服和实时语音 Agent。

计费价格

$4.00 / 1M Tokens

输入形式

文本 / 图像 / 音频

语音交互实时对话Agent
语音模型OpenAI稳定版

gpt-audio-1.5

OpenAI 当前最新 Chat Completions 音频主力,适合音频输入输出和语音交互工作流。

计费价格

$2.50 / 1M Tokens

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

gpt-realtime

OpenAI 当前首个 GA 实时模型,支持 WebRTC、WebSocket 或 SIP 下的实时文本和音频交互。

计费价格

$4.00 / 1M Tokens

输入形式

文本 / 图像 / 音频

语音交互实时对话Agent
语音模型OpenAI稳定版

gpt-realtime-mini

GPT Realtime 的低成本版本,适合成本敏感的实时文本与语音交互场景。

计费价格

$0.60 / 1M Tokens

输入形式

文本 / 图像 / 音频

语音交互实时对话成本敏感
语音模型OpenAI稳定版

gpt-audio

OpenAI 当前通用音频输入输出模型,适合音频对话和音频到文本流程。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

gpt-audio-mini

GPT Audio 的低成本版本,适合更便宜的语音输入输出和语音自动化流程。

计费价格

$0.60 / 1M Tokens

输入形式

文本 / 音频

语音交互成本敏感音频内容
语音模型OpenAI稳定版

GPT-4o Audio

GPT-4o Audio 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

GPT-4o mini Audio

GPT-4o mini Audio 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音交互音频内容Agent
语音模型OpenAI稳定版

GPT-4o Realtime

GPT-4o Realtime 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

实时对话语音助手Agent
语音模型OpenAI稳定版

GPT-4o mini Realtime

GPT-4o mini Realtime 是 OpenAI 的音频交互模型,适合语音助手、实时对话和多模态语音工作流。

计费价格

公开资料未说明

输入形式

文本 / 音频

实时对话语音助手Agent
语音模型Google预览版

Gemini 3.5 实时翻译

Gemini 3.5 实时翻译 是 Google 的实时语音模型,适合实时翻译、语音交互等低延迟语音交互场景。 当前仍是预览版。

计费价格

$3.50 / 1M Tokens

输入形式

音频 / 文本

实时翻译语音交互低延迟
语音模型Google预览版

Gemini 2.5 Flash Live Preview

Gemini 2.5 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。

计费价格

$0.50 / 1M Tokens

输入形式

音频 / 视频 / 文本

实时语音语音助手音频对话
语音模型Google预览版

Gemini 3.1 Flash Live Preview

Gemini 3.1 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。

计费价格

$0.75 / 1M Tokens

输入形式

文本 / 图像 / 音频 / 视频

实时语音语音助手音频对话
语音模型智谱稳定版

GLM-Realtime

GLM-Realtime 是智谱当前实时音视频模型,支持语音对话、视频理解和函数调用。

计费价格

音频 ¥0.18 / min,视频 ¥1.20 / min

输入形式

文本 / 音频 / 视频

实时语音视频通话多模态交互
语音模型智谱稳定版

GLM-4-Voice

GLM-4-Voice 是智谱当前端到端语音模型,可直接理解和生成中英文语音。

计费价格

¥80.00 / 1M Tokens

输入形式

文本 / 音频

语音对话中英文语音方言风格控制
语音模型ElevenLabs稳定版

Eleven v3

ElevenLabs 当前旗舰语音模型,主打更自然的情绪、多人对话和更丰富的角色表达。

计费价格

公开资料未说明

输入形式

文本

高质量配音多人对话角色语音
语音模型ElevenLabs稳定版

Eleven v3 Conversational

Eleven v3 Conversational 是 ElevenLabs 面向实时对话的表现力语音模型,延迟约 280ms,支持 70 多种语言和上下文对话表达。

计费价格

公开资料未说明

输入形式

文本

实时语音对话低延迟情绪表达
语音模型Deepgram稳定版

Deepgram Flux TTS

Deepgram Flux TTS 是 2026 年 8 月发布的面向实时语音 Agent 的对话式文本转语音模型,支持跨轮上下文、打断处理和流式输出。

计费价格

公开资料未说明

输入形式

文本

实时语音 Agent对话式 TTS低延迟语音
语音模型阶跃稳定版

StepAudio 2.5 Realtime

StepAudio 2.5 Realtime 是阶跃星辰当前公开的实时语音对话模型,支持副语言感知、情绪反馈和人设自定义。

计费价格

公开资料未说明

输入形式

文本 / 音频

实时语音副语言感知人设自定义
语音模型阶跃稳定版

StepAudio 2.5 Chat

StepAudio 2.5 Chat 是阶跃星辰当前公开的对话模型,突出副语言感知、情绪理解和可自定义人设。

计费价格

公开资料未说明

输入形式

文本 / 音频

对话情绪理解人设自定义