
MiniMax
语音、视频、音乐和多模态布局比较完整,近期官方页面已补充 MiniMax-M3 旗舰多模态编程模型、MiniMax H3 视频生成模型与 2026 年 8 月公开的 Music 3.0 开放权重音乐模型,适合对话、代码、Agent、语音交互和内容生成产品。
代表模型
多模态模型 · Image 01 / Lyrics Generation 等 28 款
付费方式
平台余额充值 / 企业采购
可用范围
中国大陆 / 国际可用
官方厂商入口与接入判断
全球主流 AI 厂商官方入口、模型方向、价格页和文档入口已经按栏目整理,适合先确认哪家能用、哪家值得长期关注。
先找官方入口,再决定注册、测试还是接入。
已收录厂商
80
覆盖类型
6
带价格说明
80

语音、视频、音乐和多模态布局比较完整,近期官方页面已补充 MiniMax-M3 旗舰多模态编程模型、MiniMax H3 视频生成模型与 2026 年 8 月公开的 Music 3.0 开放权重音乐模型,适合对话、代码、Agent、语音交互和内容生成产品。
代表模型
多模态模型 · Image 01 / Lyrics Generation 等 28 款
付费方式
平台余额充值 / 企业采购
可用范围
中国大陆 / 国际可用

ElevenLabs 当前将产品明确拆分为 ElevenCreative、ElevenAgents 和 ElevenAPI,覆盖语音生成、音乐、配音、语音 Agent、语音转文本和开发者 API,适合内容创作、客服和多语言音频产品。
代表模型
语音模型 · Eleven English STS v2 / Eleven Flash v2 等 19 款
付费方式
信用卡 / 订阅套餐 · 含试用
可用范围
国际可用

Deepgram 是语音识别和实时语音基础设施里的代表厂商,适合做语音转写、客服质检和语音 Agent。它更偏开发者和企业基础设施路线,不走消费级创作产品定位。
代表模型
语音模型 · Aura-1 Voices / Aura-2 Voices 等 41 款
付费方式
信用卡 / 企业合同 · 含试用
可用范围
国际可用

中文语音、教育和行业交互场景是讯飞的优势区,适合做语音助手、教育产品和需要语音能力联动的应用。它的价值更多在垂直能力结合,不是单纯拼通用模型低价。
代表模型
语音模型 · Spark Lite / Spark Pro 等 6 款
付费方式
平台余额充值 / 企业采购
可用范围
中国大陆

Cartesia 主打超低延迟语音模型和实时语音基础设施,适合电话机器人、实时语音助手和 Voice Agent。它在实时 TTS 方向很有代表性,值得作为第二批优先补齐。
代表模型
语音模型 · Infilling / Ink-2 等 9 款
付费方式
信用卡 / 企业合同 · 含试用
可用范围
国际可用

Venice 主打隐私、不留存和创作自由,适合聊天、图像、音频和偏创意型工作流。它和主流闭源平台相比更强调私密性与开放模型组合,不完全是传统企业风格路线。
代表模型
多模态模型 · Venice Role Play Uncensored / Venice Uncensored 1.1 等 4 款
付费方式
信用卡 / 订阅
可用范围
国际可用

AssemblyAI 是开发者心智很强的语音识别厂商,适合转写、语音理解和呼叫中心分析。它的卖点在于 API 友好、模型清晰,适合当作主流语音基础设施备选。
代表模型
语音模型 · Universal-2 / Universal-3.5 Pro 等 8 款
付费方式
信用卡 / 企业合同 · 含试用
可用范围
国际可用

Speechmatics 的优势在于多语言语音识别、企业部署和全球化语音产品支持,适合国际化语音场景。它更偏企业基础设施型厂商,适合收录在第二批语音补全名单里。
代表模型
语音模型 · Batch STT Enhanced / Batch STT Standard 等 6 款
付费方式
信用卡 / 企业合同 · 含试用
可用范围
国际可用