Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

语言模型阶跃稳定版

step-1-32k

典型应用场景有问答助手、词条编辑、行业分析、搜索查询词生成等。

输入价格

¥15.00 / 1M Tokens

输出价格

¥70.00 / 1M Tokens

文本数学代码
多模态模型阶跃稳定版

step-r1-v-mini

典型应用场景有图片内容识别、图片分析和推理、代码生成和补全、数学问题回答、逻辑问题解答、日常问答等。

输入价格

¥2.50 / 1M Tokens

输出价格

¥8.00 / 1M Tokens

推理图片理解代码
多模态模型阶跃稳定版

step-1o-vision-32k

典型应用场景有管家机器人、智慧座舱助手、医学影像分析助手、食物识别、图片信息判断、图片内容描述等。单次请求限制最多50张图片,总大小控制在20M以内。

输入价格

¥15.00 / 1M Tokens

输出价格

¥70.00 / 1M Tokens

图片理解文本生成视觉理解
多模态模型阶跃稳定版

step-1v-8k

典型应用场景为图片描述、食物识别、心理咨询、穿搭建议等。单次请求限制最多20张图片,总大小控制在20M以内。

输入价格

¥5.00 / 1M Tokens

输出价格

¥20.00 / 1M Tokens

图片理解短上下文视觉理解
多模态模型阶跃稳定版

step-1v-32k

典型应用场景有文献阅读助手、图片理解、角色扮演、日常问答等。单次请求限制最多50张图片,总大小控制在20M以内。

输入价格

¥15.00 / 1M Tokens

输出价格

¥70.00 / 1M Tokens

图片理解长上下文视觉理解
图像生成阶跃稳定版

step-1x-medium

适用于需要高质量图像生成的场景,如艺术创作、游戏开发等。输入文本最大长度为1024个字符;输入图片需在10Mb以内,像素不大于2048x2048,格式为png或jpeg。单次可请求生成1张图像。

计费价格

¥0.1 / image

生成形式

text_to_image / image_edit

图片生成中文支持图像生成
图像生成阶跃稳定版

step-2x-large

新模型生成图片质感更真实,中英文文字生成能力更强。输入文本最大长度为1024个字符;输入图片需在10Mb以内,像素不大于2048x2048,格式为png或jpeg。单次可请求生成1张图像。

计费价格

限时免费

生成形式

text_to_image / image_edit

图片生成中文提示词图像生成
图像生成阶跃稳定版

step-1x-edit

模型能够理解用户的意图,并生成符合要求的图像编辑结果,适合应用于图像编辑、人像美化、艺术创作等场景。输入文本最大长度为512个字符;输入图片需在10Mb以内,像素不大于1024x1024,格式为png或jpeg。单次可请求生成1张图像。

计费价格

限时免费

生成形式

text_to_image / image_edit

图片编辑图像增强图像生成
语音模型阶跃稳定版

stepaudio-2.5-asr

阶跃新一代流式语音识别模型,基于 4B MTP 架构,在识别准确率与响应延迟之间取得良好平衡。支持中英文识别与 ITN 文本规范化,适合实时字幕、语音输入、会议记录等对识别速度与准确率均有要求的场景。

计费价格

0.15元/小时

输入形式

音频

高准确率低延迟中英双语
语音模型阶跃稳定版

step-asr

具有强大的中英文语音识别能力的ASR模型,能够自动区分语音和噪音,支持中英文混合语音识别和多种重口音普通话识别。可广泛应用于语音输入、语音控制、会议记录等场景。

计费价格

0.9元/小时

输入形式

音频

语音识别实时离线
语音模型阶跃稳定版

step-1o-audio

提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。

计费价格

¥25.00 / 1M Tokens

输入形式

音频 / 文本

实时交互工具调用Agent
语言模型Cohere稳定版

Command A

Command A is a performant mode good at tool use, RAG, agents, and multilingual use cases. It has 111 billion parameters and a 256k context length.

输入价格

公开资料未说明

输出价格

公开资料未说明

Agent知识库检索长文问答
语言模型Cohere稳定版

Command R7B

Command R7B is the smallest, fastest, and final model in our R family of enterprise-focused large language models. It excels at RAG, tool use, and agents.

输入价格

公开资料未说明

输出价格

公开资料未说明

Agent知识库检索长文问答
语言模型Cohere稳定版

Command A Translate

Command A Translate is a state of the art model performant in 23 languages. It has a context length of 16K tokens and 111B parameters.

输入价格

公开资料未说明

输出价格

公开资料未说明

机器翻译多语言应用跨语种工作流
语言模型Cohere稳定版

Command A Reasoning

Command A Reasoning excels in tool use, agentic workflows, and complex problem-solving. It has 111 billion parameters and a 256k context length.

输入价格

公开资料未说明

输出价格

公开资料未说明

复杂推理多步任务Agent
多模态模型Cohere稳定版

Command A Vision

Command A Vision is a powerful visual language model capable of interacting with image inputs. This document contains information about its capabilities.

输入价格

公开资料未说明

输出价格

公开资料未说明

视觉理解图文问答多语言任务
语言模型Cohere稳定版

Command R 08-2024

Command R is a conversational model that excels in language tasks and supports multiple languages, making it ideal for coding use cases.

输入价格

公开资料未说明

输出价格

公开资料未说明

Agent知识库检索长文问答
语言模型Cohere稳定版

Command R+ 08-2024

Command R+ is Cohere's optimized for conversational interaction and long-context tasks, best suited for complex RAG workflows and multi-step tool use.

输入价格

公开资料未说明

输出价格

公开资料未说明

Agent知识库检索长文问答
语言模型Cohere即将下线

Command R 03-2024

Command R is an instruction-following conversational model that performs language tasks at a higher quality, more reliably, and with a longer context than previous models. It can be used for complex workflows like code generation, retrieval augmented generation (RAG), tool use, and agents.

输入价格

公开资料未说明

输出价格

公开资料未说明

Agent知识库检索长文问答