语音模型Google预览版
Gemini 2.5 Flash Live Preview
Gemini 2.5 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。
计费价格
$0.50 / 1M Tokens
输入形式
音频 / 视频 / 文本
实时语音语音助手音频对话
官方模型目录与价格对比
按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。
先缩小候选,再进详情页看接口、计费和能力边界。
已收录模型
1,303
覆盖厂商
63
带价格信息
355
Gemini 2.5 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。
计费价格
$0.50 / 1M Tokens
输入形式
音频 / 视频 / 文本
Gemini 2.5 Pro Text-to-Speech 是 Google 的语音合成模型,适合语音合成、语音助手等语音输出场景。 当前仍是预览版。
计费价格
$1.00 / 1M Tokens
输入形式
文本
Gemini 3.1 Flash Live Preview 是 Google 的实时语音模型,适合实时语音、语音助手等低延迟语音交互场景。 当前仍是预览版。
计费价格
$0.75 / 1M Tokens
输入形式
文本 / 图像 / 音频 / 视频
NemotronLabs VoiceChat 11B 是 NVIDIA 于 2026 年 7 月发布的端到端全双工实时语音模型,支持自然轮流对话、打断和实时工具调用。
计费价格
公开资料未说明
输入形式
音频
Nemotron-Labs Audex 2B 是 NVIDIA 于 2026 年 7 月发布的音频语言模型,支持语音识别、翻译、音频理解和语音生成任务。
计费价格
公开资料未说明
输入形式
音频 / 文本
VibeVoice-ASR-BitNet 是 Microsoft 发布的多语言低资源语音识别模型,采用 BitNet 量化以支持 CPU 推理。
计费价格
公开资料未说明
输入形式
音频