Step 3.7 Flash
分类:多模态模型 / 上下文:256K / 调用名:step-3.7-flash
Step 3.7 Flash 是阶跃星辰当前公开的旗舰多模态推理模型,支持图片、视频输入、推理强度调节、工具调用和 Agent 工作流。

在多模态和新模型热度上有存在感,适合关注国内新一线厂商、想尝试新能力路线的团队。价格和长期稳定性还需要持续观察,但作为增量选择有收录价值。
主分类:多模态模型
适合:新能力尝鲜 / 多模态产品 / 国内备选
付费:平台余额充值 / 企业采购
地区:中国大陆
接入判断
按原生接口接阶跃星辰 StepFun 适合作为官方原生入口,接入前先按文档核对鉴权方式、模型 ID 和计费口径。
协议:官方原生 API
价格:以官方价格页为准
模型:已收录 25 个
分类:多模态模型 / 上下文:256K / 调用名:step-3.7-flash
Step 3.7 Flash 是阶跃星辰当前公开的旗舰多模态推理模型,支持图片、视频输入、推理强度调节、工具调用和 Agent 工作流。
分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-realtime
StepAudio 2.5 Realtime 是阶跃星辰当前公开的实时语音对话模型,支持副语言感知、情绪反馈和人设自定义。
分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-chat
StepAudio 2.5 Chat 是阶跃星辰当前公开的对话模型,突出副语言感知、情绪理解和可自定义人设。
分类:图像生成 / 上下文:- / 调用名:step-image-edit-2
Step Image Edit 2 是阶跃星辰当前公开的轻量图像生成与编辑模型,支持文生图、图像编辑和低延迟交互修图。
分类:语言模型 / 上下文:256K / 调用名:step-3.5-flash-2603
基于 Step 3.5 Flash 针对高频 Agent 场景优化,在保留旗舰推理与工具调用能力的同时,进一步提升 Token 效率与推理速度,并支持切换低推理模式以降低消耗。对 Coding 与 Agent 框架兼容性也做了专项优化。
分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-tts
真正具有声音表演能力的语音合成模型,首次将语境理解能力引入语音生成全流程。通过 Global Context(全局语境)+ Inline Context(文中语境)双档控制,配合 Zero-shot Clone,让合成语音有呼吸感、轻重主次和情绪弧线,适合有声书、短剧配音、广告旁白、情感叙事等高表现力场景。
价格记录更新时间:2026-04-23
查看模型详情分类:语言模型 / 上下文:256K / 调用名:step-3.5-flash
旗舰级推理模型,专为智能体构建而生。推理深度比肩顶尖闭源模型,同时具备极速响应与稳定可靠的工具调用能力。在通用推理能力基础之上,更擅长复杂项目规划与长程任务执行。
价格记录更新时间:2026-04-23
查看模型详情分类:多模态模型 / 上下文:64K / 调用名:step-3
兼顾智能与效率的高性价比推理模型,典型应用场景有图片内容识别和提取、图片分析和推理、逻辑与数学问题回答、代码生成和补全、智能助手和日常问答、复杂问题调研和解答等。
价格记录更新时间:2026-04-23
查看模型详情分类:语言模型 / 上下文:32K / 调用名:step-2-mini
典型应用场景有文本创意改写、文本摘要生成、文本内容翻译、专业问题回答、角色扮演、信息提取与合并、query指令补全等。
价格记录更新时间:2026-04-23
查看模型详情分类:多模态模型 / 上下文:32K / 调用名:step-1o-turbo-vision
典型应用场景有社媒发帖文案创作、AI问答助手、图片与视频理解等。单次请求限制输入最多50张,总大小控制在20M以内的图片,输入视频为小于128MB的MP4文件。
价格记录更新时间:2026-04-23
查看模型详情分类:语音模型 / 上下文:- / 调用名:step-tts-mini
支持中、英、日语、粤语、四川话,提供19种官方音色,兼具出色的音色复刻能力,支持中、英、日语复刻。适合客服外呼、情感陪伴、智能助手语音交互等对发音真人感要求高的场景。
价格记录更新时间:2026-04-23
查看模型详情分类:语言模型 / 上下文:16K / 调用名:step-2-16k
典型应用场景有资源处理引擎、聊天主播扮演、用户记忆数据整理、食物重量热量预估、意图识别与推荐query生成等。
价格记录更新时间:2026-04-23
查看模型详情分类:语言模型 / 上下文:8K / 调用名:step-1-8k
典型应用场景有对话中控引擎、销售客服、自动化快讯生成、问题改写、角色扮演、文本分类或关键词提取等。
价格记录更新时间:2026-04-23
查看模型详情价格记录更新时间:2026-04-23
查看模型详情分类:多模态模型 / 上下文:100K / 调用名:step-r1-v-mini
典型应用场景有图片内容识别、图片分析和推理、代码生成和补全、数学问题回答、逻辑问题解答、日常问答等。
价格记录更新时间:2026-04-23
查看模型详情分类:多模态模型 / 上下文:32K / 调用名:step-1o-vision-32k
典型应用场景有管家机器人、智慧座舱助手、医学影像分析助手、食物识别、图片信息判断、图片内容描述等。单次请求限制最多50张图片,总大小控制在20M以内。
价格记录更新时间:2026-04-23
查看模型详情分类:多模态模型 / 上下文:8K / 调用名:step-1v-8k
典型应用场景为图片描述、食物识别、心理咨询、穿搭建议等。单次请求限制最多20张图片,总大小控制在20M以内。
价格记录更新时间:2026-04-23
查看模型详情分类:多模态模型 / 上下文:32K / 调用名:step-1v-32k
典型应用场景有文献阅读助手、图片理解、角色扮演、日常问答等。单次请求限制最多50张图片,总大小控制在20M以内。
价格记录更新时间:2026-04-23
查看模型详情分类:图像生成 / 上下文:- / 调用名:step-1x-medium
适用于需要高质量图像生成的场景,如艺术创作、游戏开发等。输入文本最大长度为1024个字符;输入图片需在10Mb以内,像素不大于2048x2048,格式为png或jpeg。单次可请求生成1张图像。
价格记录更新时间:2026-04-23
查看模型详情分类:图像生成 / 上下文:- / 调用名:step-2x-large
新模型生成图片质感更真实,中英文文字生成能力更强。输入文本最大长度为1024个字符;输入图片需在10Mb以内,像素不大于2048x2048,格式为png或jpeg。单次可请求生成1张图像。
价格记录更新时间:2026-04-23
查看模型详情分类:图像生成 / 上下文:- / 调用名:step-1x-edit
模型能够理解用户的意图,并生成符合要求的图像编辑结果,适合应用于图像编辑、人像美化、艺术创作等场景。输入文本最大长度为512个字符;输入图片需在10Mb以内,像素不大于1024x1024,格式为png或jpeg。单次可请求生成1张图像。
价格记录更新时间:2026-04-23
查看模型详情分类:语音模型 / 上下文:- / 调用名:stepaudio-2.5-asr
阶跃新一代流式语音识别模型,基于 4B MTP 架构,在识别准确率与响应延迟之间取得良好平衡。支持中英文识别与 ITN 文本规范化,适合实时字幕、语音输入、会议记录等对识别速度与准确率均有要求的场景。
价格记录更新时间:2026-04-23
查看模型详情价格记录更新时间:2026-04-23
查看模型详情分类:语音模型 / 上下文:- / 调用名:step-asr
具有强大的中英文语音识别能力的ASR模型,能够自动区分语音和噪音,支持中英文混合语音识别和多种重口音普通话识别。可广泛应用于语音输入、语音控制、会议记录等场景。
价格记录更新时间:2026-04-23
查看模型详情分类:语音模型 / 上下文:- / 调用名:step-1o-audio
提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。
价格记录更新时间:2026-04-23
查看模型详情