Token导航 LogoToken导航TokenDH.com
待分类只读github未标认证来源可访问许可证需确认审计通过

mindspeed-llm-data-prepmindspeed LLM 数据 prep

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

212

周安装

9

GitHub Stars

60

下载量

74
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:mindspeed-llm-data-prep(mindspeed LLM 数据 prep)
来源仓库:https://github.com/ascend-ai-coding/awesome-ascend-skills
仓库路径:skills/mindspeed-llm-data-prep
安装命令:
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill mindspeed-llm-data-prep
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill mindspeed-llm-data-prep

简介

用于数据清洗、表格分析和统计口径生成,支持 CSV/Excel 文件处理。

  • 可识别异常值、汇总指标并生成可视化图表说明。
  • 需确认数据来源字段含义和时间范围后再进行分析。
  • 涉及敏感数据时应先脱敏再操作,避免批量写回权限问题。
  • mindspeed-llm-data-prep 属于待分类类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

MindSpeed-LLM 数据预处理

本 Skill 指导用户为 MindSpeed-LLM 训练准备数据,覆盖预训练、指令微调和偏好对齐三种数据格式。

快速开始

指令微调数据(Alpaca 格式)

python preprocess_data.py \
    --input ./dataset/alpaca.parquet \
    --tokenizer-name-or-path ./model_from_hf/Qwen2.5-7B-Instruct/ \
    --output-prefix ./finetune_dataset/alpaca \
    --handler-name AlpacaStyleInstructionHandler \
    --tokenizer-type PretrainedFromHF \
    --workers 4 \
    --prompt-type qwen

预训练数据

python preprocess_data.py \
    --input ./dataset/raw_text.parquet \
    --tokenizer-name-or-path ./model_from_hf/Qwen2.5-7B/ \
    --output-prefix ./pretrain_dataset/data \
    --tokenizer-type PretrainedFromHF \
    --handler-name GeneralPretrainHandler \
    --json-keys text \
    --workers 4

数据处理器

Handler输入格式用途
GeneralPretrainHandler{"text": "..."}预训练
AlpacaStyleInstructionHandler{"instruction": "...", "output": "..."}单轮指令微调
SharegptStyleInstructionHandler{"conversations": [...]}多轮对话微调
AlpacaStylePairwiseHandler{"question": "...", "chosen": "...", "rejected": "..."}DPO 偏好对齐(Alpaca 风格)
SharegptStylePairwiseHandler{"conversations": [...], "chosen": "...", "rejected": "..."}DPO 偏好对齐(ShareGPT 风格)

输入数据格式

Alpaca 格式

{
    "instruction": "描述一下量子计算的基本原理",
    "input": "",
    "output": "量子计算利用量子比特..."
}

支持的字段:instruction(必需)、input(可选)、output(必需)。

ShareGPT 格式

{
    "conversations": [
        {"from": "human", "value": "你好"},
        {"from": "gpt", "value": "你好!有什么可以帮助你的吗?"},
        {"from": "human", "value": "请介绍一下深度学习"},
        {"from": "gpt", "value": "深度学习是机器学习的一个分支..."}
    ]
}

角色标识:human / gpt(或 user / assistant)。

Pairwise 格式(DPO)

{
    "system": "You are a helpful assistant.",
    "question": "解释什么是机器学习",
    "chosen": "机器学习是人工智能的一个子领域...",
    "rejected": "机器学习就是让机器学习。"
}

预训练数据

{"text": "这是一段用于预训练的长文本..."}

支持 .jsonl.json.parquet.csv.txt.arrow 输入格式。

关键参数

参数说明示例
--input输入数据文件路径./dataset/alpaca.parquet
--output-prefix输出文件前缀./finetune_dataset/alpaca
--tokenizer-name-or-path分词器路径(HF 模型目录)./model_from_hf/Qwen2.5-7B-Instruct/
--tokenizer-type分词器类型PretrainedFromHF
--handler-name数据处理器AlpacaStyleInstructionHandler
--prompt-type对话模板类型qwenllama3glm4
--json-keys预训练文本字段名text(预训练数据必需)
--map-keys字段映射(非标准数据格式)'{"prompt":"question"}'
--workers并行处理线程数4
--seq-length序列长度(打包时使用)4096
--log-interval日志打印间隔1000

Prompt 模板

模板名适用模型
qwenQwen、Qwen2.5
qwen3Qwen3
llama3LLaMA 3/3.1
llama2LLaMA 2
glm4GLM-4
deepseek3DeepSeek-V3
deepseek2DeepSeek-V2
baichuan2Baichuan2
mistralMistral
chatmlChatML 通用格式

输出文件结构

指令微调数据输出

预处理生成 packed 格式文件:

<prefix>_packed_input_ids_document.bin / .idx
<prefix>_packed_labels_document.bin / .idx
<prefix>_packed_attention_mask_document.bin / .idx

Pairwise 数据输出(DPO)

<prefix>_packed_chosen_input_ids_document.bin / .idx
<prefix>_packed_chosen_labels_document.bin / .idx
<prefix>_packed_rejected_input_ids_document.bin / .idx
<prefix>_packed_rejected_labels_document.bin / .idx

预训练数据输出

<prefix>_text_document.bin / .idx
注意:预训练 --data-path 需包含 _text_document 后缀(如 ./dataset/data_text_document),微调则使用前缀即可。

数据路径约定

重要:训练时 --data-path 应设为输出前缀(如 ./finetune_dataset/alpaca),不要包含 _packed。数据加载器 get_packed_indexed_dataset() 会自动拼接 _packed_*_document 后缀。
# 正确
--data-path ./finetune_dataset/alpaca

# 错误
--data-path ./finetune_dataset/alpaca_packed

多文件数据集

支持多个数据文件按权重混合:

--data-path 0.7 ./dataset/pretrain_zh 0.3 ./dataset/pretrain_en

常见问题

Q: 预处理报错 tokenizer 找不到

确保 --tokenizer-name-or-path 指向包含 tokenizer.jsontokenizer.model 的目录。

Q: 处理速度慢

增加 --workers 参数(建议不超过 CPU 核心数)。

Q: ShareGPT 格式的角色标识不匹配

确保使用 human / gptuser / assistant 作为角色标识。

使用顺序

数据预处理完成后:

  1. 权重转换 → 使用 mindspeed-llm-weight-prep
  2. 训练启动 → 使用 mindspeed-llm-training

参考资源

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

36.92%
按下载量换算27

Claude

28.09%
按下载量换算21

Cursor

21.16%
按下载量换算16

Gemini CLI

9.39%
按下载量换算7

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills