Token导航 LogoToken导航TokenDH.com
效率敏感数据clawhub未标认证来源可访问clear审计提醒

model-benchmark模型基准

Agent Skill

model-benchmark 用于补充效率相关能力,适合在 OpenClaw 中需要让 Agent 承接效率相关任务时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

4,068

周安装

163

GitHub Stars

公开资料未说明

下载量

1,317
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:model-benchmark(模型基准)
来源仓库:https://github.com/leosheep821-debug/model-benchmark
安装命令:
openclaw skills install model-benchmark
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install model-benchmark

简介

深度测评各模型在 OpenClaw 上的实际表现,支持中文理解/代码/推理/工具调用多维度评估。

SKILL.md

name
model-benchmark
description
深度测评各模型在 OpenClaw 上的实际表现,支持中文理解/代码/推理/工具调用多维度评估。
version
0.1.0
tags
[benchmark, model, evaluation, openclaw]

OpenClaw 模型测评框架

创建:2026-03-23 目标:深度测评各模型在 OpenClaw 上的实际表现

测试环境

  • 平台:Matrix Agent(OpenClaw 2026.3.3)
  • 当前模型:minimax/auto(上下文200k,MaxTokens 8192)
  • 代理:127.0.0.1:8766(MiniMax内部代理)
  • Thinking:关闭状态

待测模型池

模型Provider状态优先级
MiniMax Autominimax✅已测
GLM-5智谱/百炼🔜待测P1
Qwen3-235B-A22B百炼(MoE,235B参数)🔜待测P1
Claude Opus 4 (thinking-medium)anthropic-via-proxy🔜待测P1
DeepSeek R1待确认🔜待测P2
GPT-4oOpenAI待确认P2

API Key 需求

  • GLM-5:需智谱API Key(GLM-4V/GLM-4已集成百炼,可能复用百炼Key)
  • Qwen3-235B-A22B:需阿里云百炼Key(洛书有Coding Plan)
  • 测试方法:通过 OpenClaw models.json 配置新 provider

测评维度

维度权重测试内容
中文理解25%解释复杂概念,用小学生能懂的话
代码能力25%Python实现,简洁可运行
工具调用20%解释工具调用对Agent的重要性
复杂推理20%多步骤逻辑推理题
响应速度10%从发题到返回的时间

测试题库(标准题)

测试1:中文理解与创意

请用一段不超过100字的话,解释"量子纠缠",要求:小学生能看懂,且有一定文采。

评分标准:

  • ✅ 能用比喻/类比解释(不堆术语)
  • ✅ 有文采(不是干巴巴的定义)
  • ✅ 字数<100

测试2:代码能力

写一个Python函数,判断一个字符串是否是回文,要求代码简洁、注释清晰、可直接运行。

评分标准:

  • ✅ 逻辑正确
  • ✅ 代码简洁(<15行)
  • ✅ 有注释
  • ✅ 可直接运行

测试3:工具调用能力

解释为什么"工具调用能力"对AI Agent至关重要?要求结合实际场景,不超过150字。

评分标准:

  • ✅ 有具体场景举例
  • ✅ 说清楚"为什么"(不是"是什么")
  • ✅ 字数<150

测试4:复杂推理

张三比李四大3岁。李四比王五小2岁。王五20岁。问:三人年龄之和是多少?

评分标准:

  • ✅ 推理过程清晰
  • ✅ 最终答案正确(20+22+25=67)
  • ✅ 写出推理步骤

报告格式

# 模型测评报告:{模型名}
日期:YYYY-MM-DD

## 总分:X/10

## 各维度得分

| 维度 | 得分 | 评语 |
|------|------|------|
| 中文理解 | X/10 | ... |
| 代码能力 | X/10 | ... |
| 工具调用 | X/10 | ... |
| 复杂推理 | X/10 | ... |
| 响应速度 | X/10 | ... |

## 亮点
-

## 不足
-

## 结论
-

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

76.71%
按下载量换算1,010

安全审计

VirusTotal

通过

ClawScan

可疑

Static analysis

通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills