Token导航 LogoToken导航TokenDH.com
研究检索敏感数据github未标认证来源可访问许可证需确认审计异常

verl-deploy版本部署

Agent Skill

用于辅助云资源、部署、容器、基础设施和运维自动化任务。它适合让 Agent 检查配置、整理部署步骤、分析资源状态、生成排障思路或辅助云服务接入。使用时需要明确目标环境、账号权限、区域和资源组,区分本地测试与生产操作;涉及删除资源、重启服务、修改网络或权限配置时,应先确认影响范围。

总安装

245

周安装

10

GitHub Stars

12

下载量

78
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:verl-deploy(版本部署)
来源仓库:https://github.com/ascend/agent-skills
仓库路径:skills/verl-deploy
安装命令:
npx skills add https://github.com/ascend/agent-skills --skill verl-deploy
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ascend/agent-skills --skill verl-deploy

简介

用于辅助云资源、部署、容器和基础设施管理。

  • 适合检查配置、整理部署步骤、分析资源状态或生成排障思路。
  • 使用时应明确目标环境、账号权限和资源组,区分本地测试与生产操作。
  • 安装命令:npx skills add https://github.com/ascend/agent-skills --skill verl-deploy
  • 涉及删除资源或修改网络配置时,应先确认影响范围。

SKILL.md

Verl Deploy - 训练服务一键拉起

在 NPU 集群上拉起 Verl 分布式训练服务,并灵活配置加速特性,支持 DAPO/GRPO 等 RLHF 算法。

核心原则

  1. 用户配置优先:用户明确指定 > 自动检测 > 默认值
  2. 配置必须验证:路径、镜像等运行前检测有效性,不猜测
  3. 用户确认是阻断点:执行前展示配置清单并等待确认
  4. 严格区分宿主机/容器内:docker cp 在宿主机执行,进入容器后不再使用 docker 前缀命令

整体流程

1. 环境预检查 → 2. 用户交互 → 3. 配置确认 → 4. 镜像准备+容器拉起 → 5. SwanLab 配置 → 6. 生成双脚本 → 7. 复制+执行 → 8. 验证

阶段 1:环境预检查

执行以下 bash 命令自动探测机器环境:

# NPU 信息
npu-smi info
npu-smi info -t board 2>/dev/null

# Docker 和镜像
docker ps -a | grep verl
docker images | grep -E "verl|ascend"

# 模型权重
find /mnt/public /mnt2 /mnt/project -maxdepth 4 -type d -name "Qwen*" 2>/dev/null

# 数据集
find /mnt /mnt2 -name "*.parquet" 2>/dev/null | head -20

# 网卡和 IP
hostname -I

将检测结果记录,供阶段 2 使用。


阶段 2:用户交互收集信息

通过 AskUserQuestion 分轮次收集,每轮提供预填值(来自阶段 1 检测结果)。

轮次 1:基础配置

  • 训练模式:单机 / 多机
  • NPU 卡号(预填检测结果,用户可改)
  • 模型路径(列出检测到的模型供选择,或手动指定路径)
  • 训练数据集路径
  • 测试数据集路径
  • Checkpoint 保存路径

轮次 2:镜像与容器配置

  • 容器处理方式:使用已有容器 / 新建容器
  • 如新建:

- 镜像选择:列出本地已有 verl 镜像 / 手动输入 / 从 quay.io 拉取 - 默认拉取地址:quay.io/ascend/verl:verl-8.3.rc1-910b-ubuntu22.04-py3.11-v0.7.0

轮次 3:SwanLab 配置

  • 是否开启 SwanLab 日志(是/否)

如果开启,逐项询问(提供默认值):

  • SwanLab Host:无默认值,必填(如 http://192.168.1.100:8000
  • SwanLab API Key:无默认值,必填
  • SwanLab Mode:默认 cloud
  • SwanLab Workspace:默认 TrainingMaster
  • SwanLab Log Dir:默认 /mnt/project/h4380/examples/verl/swanlab_cloud_fsdp_log/
  • Project Name:默认 verl_hlm

轮次 4:特性配置

输入 7 位二进制特性掩码:

位[0]位[1]位[2]位[3]位[4]位[5]位[6]
 ↓    ↓    ↓    ↓    ↓    ↓    ↓
RmvPad DynBSZ Offload PfxCache Recompute SwapOpt VPP

默认值:0000000(全部关闭)

特性说明:

名称类型说明
0Remove Padding简单开关减少无效 padding 计算
1Dynamic Batch Size简单开关按实际长度切分 batch
2Offload简单开关参数/梯度卸载到 CPU
3Prefix Cache追加行复用 KV 缓存前缀
4Recompute追加 3 行重计算替代缓存
5Swap Optimizer追加行优化器状态换入换出
6VPP追加行虚拟流水线并行

互斥警告:bit5(Swap Optimizer) 与 bit2(Offload) 的 optimizer_offload 不能同时开启,脚本会自动将 optimizer_offload 设为 False。

轮次 5:训练超参

提供默认值,用户可覆盖:

  • 训练步数(默认 4)
  • Batch Size(默认 32)
  • 学习率(默认 1e-6)
  • TP 张量并行(默认 4)
  • PP 流水线并行(默认 2)
  • 每 prompt 生成响应数(默认 8)

阶段 3:配置确认(阻断点)

展示完整配置清单,包括:

  • 硬件配置(NPU 卡号、数量)
  • 容器/镜像信息
  • 资源路径(模型、数据集、Checkpoint)
  • 训练超参
  • 特性掩码及各特性开关状态
  • SwanLab 配置(如开启)

等待用户确认后继续。用户确认前不执行任何修改操作。


阶段 4:镜像准备 + 容器拉起

已有容器

确认容器名,检查状态,如已停止则启动:

docker ps -a | grep <container_name>
docker start <container_name>  # 如已停止

新建容器

  1. 确认/拉取镜像
# 用户选择本地镜像 → 直接使用
# 用户选择拉取 → 执行
docker pull quay.io/ascend/verl:verl-8.3.rc1-910b-ubuntu22.04-py3.11-v0.7.0
  1. 拉起容器:使用 scripts/verl_docker_run.sh
bash scripts/verl_docker_run.sh <镜像ID> <容器名>
  1. 验证容器就绪
docker exec <container_name> bash -c "npu-smi info && python --version"

阶段 5:SwanLab 配置(如开启)

进入容器后,以容器内形式操作(无 docker 前缀)。

注意:此阶段需要先进入容器再操作。如果后面阶段 7 才正式进入容器,也可以在阶段 7 进入容器后、启动训练前执行 SwanLab 配置。

步骤 1:检查并安装 swanlab

python -c "import swanlab" 2>/dev/null && echo "swanlab 已安装" || pip install swanlab

步骤 2:登录

echo '<SWANLAB_API_KEY>' | swanlab login --host <SWANLAB_HOST>

步骤 3:验证登录

cat ~/.swanlab/config.json

文件存在且包含 API Key 信息即表示登录成功。


阶段 6:生成双脚本

使用 scripts/generate_training.sh 生成两个脚本。

生成结果

脚本职责对应参考
start_verl.sh上层:NPU/网络配置、Ray 集群启动、SwanLab 环境变量、调用下层start_flex.sh
run_training.sh下层:训练超参、特性配置、Hydra python 训练命令test_dapo_qwen3_8b_megatron_flex.sh

调用关系:start_verl.shbash run_training.sh

生成命令

bash scripts/generate_training.sh \
  --mask <FEATURE_MASK> \
  --output-dir /tmp/verl_scripts/ \
  --model-path <MODEL_PATH> \
  --train-file <TRAIN_FILE> \
  --test-file <TEST_FILE> \
  --ckpts-dir <CKPTS_DIR> \
  --npu-devices "0,1,2,3,4,5,6,7" \
  --master-addr <IP> \
  --socket-ifname <IFNAME> \
  --train-steps <STEPS> \
  --train-tp <TP> \
  --train-pp <PP> \
  --swanlab <yes|no> \
  --swanlab-host <HOST> \
  --swanlab-api-key <KEY> \
  --swanlab-mode <MODE> \
  --swanlab-workspace <WS> \
  --swanlab-log-dir <DIR> \
  --project-name <NAME>

特性处理机制

Type A(bit0-2):简单变量替换

模板中已存在占位符,sed 直接替换:

  • USE_REMOVE_PADDING_PLACEHOLDER → True/False
  • USE_DYNAMIC_BSZ_PLACEHOLDER → True/False
  • PARAM_OFFLOAD_PLACEHOLDER / OPTIMIZER_OFFLOAD_PLACEHOLDER / GRAD_OFFLOAD_PLACEHOLDER → 各自 True/False

Offload + Swap Optimizer 互斥:同时开启时自动将 OPTIMIZER_OFFLOAD 强制设为 False。

Type B(bit3-6):注释控制

模板中 Type B 特性行默认以 # 注释,根据 bit 位取消注释:

# bit3: Prefix Cache
[ "$bit3" = "1" ] && sed -i 's/^# \(actor_rollout_ref.rollout.enable_prefix_caching=True\)/\1/' "$script"

# bit4: Recompute(3 行)
if [ "$bit4" = "1" ]; then
    sed -i 's|^# \(+actor_rollout_ref.actor.megatron.override_transformer_config.recompute_granularity=full\)|\1|' "$script"
    sed -i 's|^# \(+actor_rollout_ref.actor.megatron.override_transformer_config.recompute_method=block\)|\1|' "$script"
    sed -i 's|^# \(+actor_rollout_ref.actor.megatron.override_transformer_config.recompute_num_layers=8\)|\1|' "$script"
fi

# bit5: Swap Optimizer
[ "$bit5" = "1" ] && sed -i 's|^# \(+actor_rollout_ref.actor.megatron.override_transformer_config.swap_optimizer=True\)|\1|' "$script"

# bit6: VPP
[ "$bit6" = "1" ] && sed -i 's|^# \(actor_rollout_ref.actor.megatron.virtual_pipeline_model_parallel_size=2\)|\1|' "$script"

# 清理未启用的注释行
sed -i '/^#.*\(+\?actor_rollout_ref\|enable_prefix_caching\)/d' "$script"

SwanLab 处理

模板默认 trainer.logger='["console","swanlab"]'。如 SwanLab 未开启:

sed -i "s|trainer.logger='\[\"console\",\"swanlab\"\]'|trainer.logger='[\"console\"]'|g" "$script"

阶段 7:复制脚本到容器 + 执行

步骤 1(宿主机):docker cp

关键:必须在宿主机环境执行 docker cp。确认当前不在容器内。
docker cp /tmp/verl_scripts/start_verl.sh <container_name>:/verl/start_verl.sh
docker cp /tmp/verl_scripts/run_training.sh <container_name>:/verl/run_training.sh

步骤 2:进入容器

docker exec -it <container_name> bash

步骤 3(容器内):SwanLab 配置 + 启动训练

进入容器后,以容器内形式执行(无 docker 前缀):

# 激活环境
source /usr/local/Ascend/cann/ascend-toolkit/set_env.sh
source /usr/local/Ascend/cann/nnal/atb/set_env.sh

# (如开启 SwanLab)注入环境变量 + 安装登录
export SWANLAB_HOST="<用户提供的地址>"
export SWANLAB_API_KEY="<用户提供的 API Key>"
export SWANLAB_MODE="<cloud 或 local>"
export SWANLAB_WORKSPACE="<工作空间>"
export SWANLAB_LOG_DIR="<日志目录>"
export PROJECT_NAME="<项目名>"

python -c "import swanlab" 2>/dev/null || pip install swanlab
echo "$SWANLAB_API_KEY" | swanlab login --host "$SWANLAB_HOST"
cat ~/.swanlab/config.json  # 验证

# 启动训练
cd /verl
bash start_verl.sh

start_verl.sh 自动完成:Ray 集群启动 → 调用 run_training.sh → 开始训练。


阶段 8:验证训练启动

在容器内检查:

ps aux | grep main_dapo
tail -20 logs/verl_qwen3_8b_*.log

并行策略约束

约束说明
gen_tp == train_tp推理和训练的张量并行必须相等
(train_tp x train_pp) % NPU_PER_NODE == 0tp x pp 必须能被每节点 NPU 数整除

可用脚本

脚本用途
scripts/generate_training.sh根据参数生成双脚本
scripts/feature_mask.sh7 位二进制特性掩码解析
scripts/pre_check.sh环境预检查
scripts/verl_docker_run.sh容器拉起

参考文档

  • references/feature-guide.md — 7 个加速特性详细说明
  • references/troubleshooting.md — 常见问题与解决方案(Q1-Q13)
  • references/ops-commands.md — 常用运维命令(Docker/NPU/Ray/日志)

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

38.05%
按下载量换算30

Claude

29.37%
按下载量换算23

Cursor

19.76%
按下载量换算15

Gemini CLI

8.66%
按下载量换算7

安全审计

Gen Agent Trust Hub

未通过

Socket

可疑

Snyk

未通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills