Token导航 LogoToken导航TokenDH.com
研究检索权限需确认github未标认证来源可访问许可证需确认审计异常

caw-eval考评估

Agent Skill

caw-eval 用于查找、检索和筛选相关信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要根据关键词、任务场景或来源线索快速定位候选结果时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

1,133

周安装

51

GitHub Stars

公开资料未说明

下载量

420
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:caw-eval(考评估)
来源仓库:https://github.com/cobosteven/cobo-agent-wallet-manual
仓库路径:skills/caw-eval
安装命令:
npx skills add https://github.com/cobosteven/cobo-agent-wallet-manual --skill caw-eval
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/cobosteven/cobo-agent-wallet-manual --skill caw-eval

简介

caw-eval 评测 CAW Agent 在真实后端与弱模型下的端到端能力。

  • 支持 recipe 来源切换(真实/种子/空集)与多评测模式组合。
  • 自动识别运行环境,禁止在 openclaw 服务器本地执行以防冲突。
  • 生成结构化报告,含任务完成率、响应质量与合规性检查结果。
  • caw-eval 属于研究检索类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

CAW Eval

端到端评测 CAW Agent 质量:本地 Mac 作为调度器,dispatch 到远端服务器跑 headless claude (标准 / recipe 评测)或 openclaw agent(弱模型兼容性评测),评分和报告都在本地完成。

Step 0: 环境识别(必做)

[[ "$(hostname)" == *openclaw* ]] && echo "env=openclaw" || echo "env=local"
  • env=local:继续。确保 gcloud auth login 已完成、IAP 通道可用。
  • env=openclaw:停止。本 SKILL 是本地调度器,不能在 openclaw 服务器直接跑。 请回到本地 Mac 终端后重新触发。

流程路由

评测三个正交维度:

维度flag取值
评测模式--eval-modee2e(默认,全 E2E 含 task_completion)/ pact(仅评 pact 构造)/ onboard(onboarding 评估)
Recipe 来源--recipe-sourcereal(默认/调真实 backend)/ seed(注入 dataset 的 recipe)/ empty(注入空,对照组)
Agent 类型脚本分文件run_eval_cc.py(Claude Code headless)/ run_eval_openclaw.py(弱模型如 doubao/minimax/gpt)
老 cli 仍兼容:--eval-mode standard ↔ e2e--eval-mode recipe ↔ pact--recipe-mode cc_with_recipe/openclaw → seedcc_no_recipe → emptycc_real_recipe/oc_real_recipe → real

速查表(用户意图 → 命令模板)

用户说eval-moderecipe-source脚本服务器池run_name 模板详细步骤
"跑评测" / "全流程评估" / 默认e2erealrun_eval_cc.pySERVERS_CC_MAINeval-cc-{model}-e2e-real-recipe-{TS}run-eval-cc.md
"真实 recipe" / "live recipe" + CCe2epactrealrun_eval_cc.pySERVERS_CC_MAINeval-cc-{model}-{mode}-real-recipe-{TS}run-eval-recipe.md
"recipe 评测" / "pact 模式" + dataset recipe 注入pactseedrun_eval_cc.pySERVERS_CC_MAINeval-cc-{model}-pact-seed-recipe-{TS}run-eval-recipe.md
"recipe 对照组" / "无 recipe"pactemptyrun_eval_cc.pySERVERS_CC_CTRLeval-cc-{model}-pact-no-recipe-{TS}run-eval-recipe.md
"recipe 对比评测"三跑:pact+seedpact+emptypact+real两个脚本都用MAIN(seed/real)+ CTRL(empty)三 runrun-eval-recipe.md
"弱模型评测" / "doubao/minimax/gpt 评测" / "openclaw 评测"e2epactrealseedrun_eval_openclaw.pySERVERS_{MODEL}eval-oc-{model}-{mode}-{source-alias}-{TS}run-eval-openclaw.md

run_name 别名约定real → real-recipeseed → seed-recipeempty → no-recipe。模板:eval-{cc|oc}-{model}-{eval-mode}-{source-alias}-{YYYYMMDD-HHMM}

默认run_eval_cc.py --eval-mode e2e --recipe-source real(即 sonnet headless 全 E2E + agent 调真实 backend recipe)。

执行前的公共前置(SSH / gcloud / 服务器同步):common-execution.md


概览

e2e / pact 评测(CC headless)

本地 Mac 用 run_eval_cc.py dispatch 并行调度 N 台服务器,每台跑 headless claude -p

本地 dispatch → 动态队列(空闲服务器自动取下一个 item)
               → 远端 claude headless 跑任务
               → scp 拉回 session → 上传 Langfuse → 评分 → 报告
  • 时间:17 case / 3 台 ≈ 30-50 分钟(取决于难度)
  • 服务器池(详见 run-eval-cc.md Step 2):

- SERVERS_CC_MAIN:3 台(test09-11),跑 e2e / pact + recipe-source=real|seed - SERVERS_CC_CTRL:3 台(test12-14),仅跑 pact + recipe-source=empty 对照组 - 两池互不干扰,Recipe 对比可并行

Openclaw 弱模型评测

本地 Mac 用 run_eval_openclaw.py dispatch 并行调度多台 openclaw 服务器,每台串行跑 openclaw agent,session 直接上传 Langfuse,本地评分出报告。

本地 dispatch → 多台服务器 openclaw agent 跑任务 → 上传 Langfuse
             → 本地读 Langfuse trace 评分(LLM Judge subagent 并行)→ 报告
  • 时间:14 case / 3 台弱模型 ≈ 1-3 小时(取决于模型)
  • 详细步骤:run-eval-openclaw.md

评分体系

e2e 模式(全流程)

综合分 = task_completion × 0.3 + process_quality × 0.7
process_quality = S1(意图) × 0.15 + S2(Pact) × 0.45 + S3(执行) × 0.4

pact 模式(仅评 pact 构造)

综合分 = S1(意图) × 0.20 + S2(Pact) × 0.45 + S3(交易构建) × 0.35
S3 = tx_construction_correctness × 0.5 + recipe_adherence × 0.3 + tx_submission_success × 0.2

无 task_completion。仅评估交易是否被正确构建/提交,不评估链上执行结果。

所有分数 0-1。详见 scoring.md

问题归因(写报告时使用)

对每个 finding 按 7 层归类:🔵 被测 SKILL / 🟢 评分体系 / 🟡 数据集 / 🟤 Recipe / 🟠 评测工具链 / 🔴 产品代码 / 🟣 运行环境。细则见 issue-attribution.md

数据集

数据集Case 数场景说明
recipe-test-v37uniswap-swap / aave-lend / weth-wrapRecipe 评测(推荐),统一 schema v2
standard-test-v37同 recipe-test-v3标准评测(推荐),同一份测试集 + 不同 eval_mode 做 A/B
caw-agent-eval-seth-v214transfer / swap / lend / dca /...旧 schema(pact_hints/stage_criteria),仅历史回放
caw-recipe-eval-seth-v1-recipe 多步骤Sepolia 多步骤场景,部分 item 已部分新 schema
  • 默认 recipe-test-v3(pact 模式)/ standard-test-v3(e2e 模式)
  • recipe-test-v3standard-test-v3 内容完全一致(只是 metadata.eval_type 不同),区别仅在运行时:

- --eval-mode pact --recipe-source seed:dispatch 注入 CAW_RECIPE_FILE,judge 评 tx 构建(不评链上) - --eval-mode e2e --recipe-source real:dispatch 注入 CAW_RECIPE_FILE(agent 自主 caw recipe search),judge 评全流程(含 task_completion)

服务器环境搭建

新建 openclaw 评测服务器(GCP 实例 / openclaw / caw / onboarding / 充值 / 验证): → server-setup.md

Scripts

脚本用途
run_eval_cc.pyCC 评测编排(dispatch / run / upload / score / metrics)
run_eval_openclaw.pyOpenclaw 评测编排(dispatch / run / upload / pack)
score_traces.py评分管线(断言 + judge → 综合分 → Langfuse)
judge_cc.pyLLM-as-Judge(prompt 构建)
assertions.py结构化提取 + 门槛断言
eval_utils.py公共工具(Langfuse 客户端 / 数据集 / 批量上传)
upload_session.pysession → Langfuse trace
generate_dataset.py数据集生成
validate_dataset.py数据集 schema 校验
runtime_compliance.py评测运行时合规自检
sync_to_servers.sh服务器同步 + hash 校验

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

39.43%
按下载量换算166

Claude

27.78%
按下载量换算117

Cursor

18.18%
按下载量换算76

Gemini CLI

10.46%
按下载量换算44

安全审计

Gen Agent Trust Hub

未通过

Socket

可疑

Snyk

可疑

权限和风险

权限需确认

当前来源未能明确判断权限范围,默认进入异常复核队列。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills