Token导航 LogoToken导航TokenDH.com

官方模型目录与价格对比

找模型,不只看名字,还要看 能力和价格

按模型类型、上下文、价格和厂商整理官方模型目录,方便你快速筛出适合写代码、做推理、跑视觉或搭 Agent 的那一批模型。

先缩小候选,再进详情页看接口、计费和能力边界。

已收录模型

1,303

覆盖厂商

63

带价格信息

355

视频生成智谱稳定版

SCAIL-2

SCAIL-2 是智谱 Z.ai 于 2026 年 6 月发布的端到端角色动画模型,支持驱动视频、角色替换和多角色场景。

计费价格

公开资料未说明

生成形式

image_to_video / video_to_video

角色动画视频生成开放权重
多模态模型智谱稳定版

GLM-5V-Turbo

面向视觉编程的多模态 Coding 基座模型,原生处理图片和视频输入。

输入价格

¥5.00 / 1M Tokens

输出价格

¥22.00 / 1M Tokens

视觉编程多模态理解Agent
多模态模型智谱稳定版

GLM-4.6V

GLM-4.6V 是智谱当前上一代主力视觉推理模型,强调视觉理解、前端复刻和工具调用。

输入价格

¥1.00 / 1M Tokens

输出价格

¥3.00 / 1M Tokens

视觉推理前端复刻工具调用
多模态模型智谱稳定版

GLM-OCR

GLM-OCR 是智谱当前轻量图文解析模型,面向图片、扫描件和 PDF 文档的结构化识别。

输入价格

¥0.20 / 1M Tokens

输出价格

¥0.20 / 1M Tokens

OCR文档解析版面理解
多模态模型智谱稳定版

GLM-4.1V-Thinking-FlashX

GLM-4.1V-Thinking-FlashX 是智谱当前轻量视觉推理模型,强调复杂场景理解和高并发。

输入价格

公开资料未说明

输出价格

公开资料未说明

轻量视觉推理高并发图表理解
多模态模型智谱稳定版

GLM-4.6V-Flash

GLM-4.6V-Flash 是智谱当前免费视觉模型,支持视觉推理、工具调用和可开关思考模式。

输入价格

¥0.00 / 1M Tokens

输出价格

¥0.00 / 1M Tokens

免费试用视觉推理工具调用
多模态模型智谱稳定版

GLM-4.1V-Thinking-Flash

GLM-4.1V-Thinking-Flash 是智谱当前免费视觉推理模型,强调图表、视频理解和前端 Coding。

输入价格

¥0.00 / 1M Tokens

输出价格

¥0.00 / 1M Tokens

免费试用视觉推理图表理解
多模态模型智谱稳定版

GLM-4V-Flash

GLM-4V-Flash 是智谱当前免费图像理解模型,适合基础视觉问答和多语言图像解析。

输入价格

¥0.00 / 1M Tokens

输出价格

¥0.00 / 1M Tokens

免费试用图像理解多语言
视频生成智谱稳定版

CogVideoX-3

CogVideoX-3 是智谱当前主力高智能视频模型,强调清晰度、稳定度和物理真实感。

计费价格

¥1.00 / video

生成形式

text_to_video / image_to_video / start_end_frame_to_video

视频生成高清画质首尾帧
视频生成智谱稳定版

Vidu Q1

Vidu Q1 是智谱当前偏高质量的视频生成模型,强调影视级画质和转场流畅度。

计费价格

¥2.50 / video

生成形式

text_to_video / image_to_video / start_end_frame_to_video

高质量视频影视画质转场表现
视频生成智谱稳定版

Vidu 2

Vidu 2 是智谱当前更偏速度和性价比的视频生成模型,强调多参考图一致性。

计费价格

¥1.25 / video

生成形式

text_to_video / image_to_video / reference_image_to_video / start_end_frame_to_video

性价比视频多参考图快速生成
视频生成智谱稳定版

CogVideoX-Flash

CogVideoX-Flash 是智谱当前免费视频模型,适合快速体验文本或图像生成视频。

计费价格

免费

生成形式

text_to_video / image_to_video

免费试用快速视频创意验证
语音模型智谱稳定版

GLM-Realtime

GLM-Realtime 是智谱当前实时音视频模型,支持语音对话、视频理解和函数调用。

计费价格

音频 ¥0.18 / min,视频 ¥1.20 / min

输入形式

文本 / 音频 / 视频

实时语音视频通话多模态交互
已展示全部 13 个模型