Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

语音模型Pika稳定版

Pika SFX

Pika SFX 是 Pika 于 2026 年 8 月发布的音效生成模型,可根据文字描述生成 44.1kHz 立体声音效和环境声。

计费价格

公开资料未说明

输入形式

文本

音效生成环境声视频后期
语音模型Pika稳定版

Pika Soundtrack

Pika Soundtrack 是 Pika 于 2026 年 8 月发布的视频配乐生成模型,可根据视频内容生成同步的音乐和声音设计。

计费价格

公开资料未说明

输入形式

文本 / 视频

视频配乐声音设计音画同步
语音模型Pika稳定版

Pika Speech

Pika Speech 是 Pika 于 2026 年 8 月发布的语音生成模型,支持预设音色和用户授权的声音克隆。

计费价格

公开资料未说明

输入形式

文本 / 音频

语音生成声音克隆旁白
语音模型小米稳定版

MiMo-V2.5-ASR

MiMo-V2.5-ASR 是小米 2026 年 4 月发布的开源语音识别模型,支持中英双语、中文方言、代码切换、歌词识别、噪声环境和多说话人场景。

计费价格

公开资料未说明

输入形式

音频

语音识别中文方言多说话人
语音模型小米稳定版

MiMo-V2.5-TTS

MiMo-V2.5-TTS 使用内置高质量音色做语音合成,支持唱歌模式与更细粒度的风格控制。

计费价格

限时免费

输入形式

文本

语音合成配音语音助手
语音模型小米即将下线

MiMo-V2-TTS

小米 MiMo 官方模型页提示 MiMo-V2 系列已于 2026 年 6 月 30 日正式下线,原模型名称已失效,应迁移到 V2.5 系列。

计费价格

限时免费

输入形式

文本

语音合成默认音色文本转语音
语音模型Microsoft稳定版

VibeVoice-ASR-BitNet

VibeVoice-ASR-BitNet 是 Microsoft 发布的多语言低资源语音识别模型,采用 BitNet 量化以支持 CPU 推理。

计费价格

公开资料未说明

输入形式

音频

语音识别多语言CPU 推理
语音模型Cartesia稳定版

Sonic 3.5

Sonic 3.5 是 Cartesia 当前公开的新一代流式文本转语音模型,适合实时语音 Agent、低延迟交互和高自然度语音生成。

计费价格

公开资料未说明

输入形式

文本

实时语音 Agent低延迟 TTS高自然度语音
语音模型Cartesia稳定版

Ink-2

Ink-2 是 Cartesia 于 2026 年 7 月 9 日发布的语音识别模型,重点优化实时语音 Agent 的转写、端点检测和上下文理解。

计费价格

公开资料未说明

输入形式

音频

实时语音 Agent低延迟转写端点检测
语音模型Reka稳定版

Reka Tiny ASR

Introduction to Reka's Speech API for audio transcription and translation

计费价格

公开资料未说明

输入形式

音频

语音转写音频翻译轻量语音接口
语音模型Reka稳定版

Reka Spark

Introduction to Reka's Speech API for audio transcription and translation

计费价格

公开资料未说明

输入形式

音频

语音翻译高精度翻译语音到语音
语音模型Cartesia稳定版

Sonic-3

Sonic-3 是 Cartesia 当前最新的流式 TTS 主力模型,强调更自然的表达、更细的情绪与速度控制,以及实时语音交互。

计费价格

公开资料未说明

输入形式

文本

实时语音 Agent电话机器人高自然度语音
语音模型Cartesia旧版

Sonic-2

Sonic-2 是 Cartesia 上一代主力流式 TTS 模型,当前仍公开提供给兼容旧链路和历史项目使用。

计费价格

公开资料未说明

输入形式

文本

旧链路兼容实时语音历史项目维护
语音模型Cartesia旧版

Sonic-Turbo

Sonic-Turbo 是 Cartesia 公开保留的更低时延老型号,适合强实时、成本更敏感的语音交互。

计费价格

公开资料未说明

输入形式

文本

极低时延语音对话成本敏感实时语音
语音模型Cartesia旧版

Sonic

Sonic 是 Cartesia 第一代流式 TTS 模型,当前仅适合老项目兼容和历史结果对照。

计费价格

公开资料未说明

输入形式

文本

历史兼容旧项目维护老链路对照
语音模型Cartesia稳定版

Ink-Whisper

Ink-Whisper 是 Cartesia 当前公开主推的语音转写模型,支持 base model 自动路由到最新快照,也支持固定快照版本。

计费价格

公开资料未说明

输入形式

音频

实时转写批量转写多语言语音识别
语音模型Cartesia稳定版

Voice Changer

Voice Changer 是 Cartesia 的语音变声工作流,可保留输入语调与节奏,只替换输出说话人的声音。

计费价格

公开资料未说明

输入形式

音频

变声配音替换保留语调
语音模型Cartesia稳定版

Infilling

Infilling 是 Cartesia 的语音补写工作流,可在已有音频上下文里插入新文本,并尽量保持音色与节奏连续。

计费价格

公开资料未说明

输入形式

音频 / 文本

语音编辑补写台词已有音频修补