Token导航 LogoToken导航TokenDH.com
效率需要联网clawhub未标认证来源可访问clear审计通过

data-synthesis数据综合

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

2,564

周安装

109

GitHub Stars

公开资料未说明

下载量

898
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:data-synthesis(数据综合)
来源仓库:https://github.com/erxiong0/data-synthesis
安装命令:
openclaw skills install data-synthesis
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install data-synthesis

简介

从 CSV 语料切块后,用同一套 LLM 接口依次生成问题与答案,输出 JSONL 训练数据。 适用于文档/表格语料合成 QA、微调数据准备;支持 OpenAI 兼容网关与内网 Qwen 等服务。

SKILL.md

name
data-synthesis
description
>-

Data Synthesis

流程概览

CSV 语料 → 按字符切块 → 每块生成问题列表 → 对每个问题基于该块生成答案 → 写出 JSONL。 不包含单独的小模型质量过滤环节。

阶段说明
输入带表头的 CSV,需有一列长文本可供切块
切块与遍历scripts/synthesize_qa.py
问题生成每个文本块调用一次 LLM
答案生成每个「块 + 问题」调用一次 LLM
输出每行一条 JSON(JSONL)

Agent 建议执行顺序

  1. 准备:运行 scripts/parse_file.py,确认列名、行数、文本列与内容预览。
  2. 合成:运行 scripts/synthesize_qa.py,得到 JSONL。
  3. 模式:未开启 API 时为 dry-run(不联网);设置 DATA_SYNTHESIS_USE_API=1 后走真实推理。若网关需要鉴权,再配置 OPENAI_API_KEY

脚本与依赖

脚本作用
scripts/parse_file.py校验 CSV,输出列名、行数、detected_text_column、文本预览
scripts/synthesize_qa.py完整 QA 流水线;默认输出 <输入文件名_stem>_qa.jsonl,可用 -o 指定路径

仅依赖 Python 标准库。API 模式通过 urllib 调用 OpenAI 兼容POST .../v1/chat/completionsOPENAI_BASE_URL 可写成根路径 .../v1,也可写成完整 URL 直至 .../chat/completions)。

命令示例

# 1. 检查语料
python scripts/parse_file.py path/to/corpus.csv

# 2. 本地 dry-run(不写密钥、不调外网)
python scripts/synthesize_qa.py path/to/corpus.csv -o path/to/out.jsonl

内网 Qwen 示例(与环境变量一致,推荐):

export DATA_SYNTHESIS_USE_API=1
export OPENAI_BASE_URL='http://xxx'
export DATA_SYNTHESIS_MODEL='xxx'
export DATA_SYNTHESIS_MAX_TOKENS=2000
export DATA_SYNTHESIS_TEMPERATURE=0.7

python scripts/synthesize_qa.py path/to/corpus.csv \
  --text-column text \
  --chunk-size 6000 \
  --chunk-overlap 200 \
  --sleep 0.3 \
  -o path/to/out.jsonl

仅用命令行指定模型(与上面环境变量二选一即可):

python scripts/synthesize_qa.py path/to/corpus.csv \
  --text-column text \
  --model xxx \
  -o path/to/out.jsonl

常用参数:--max-rows 试跑前几行;--sleep 控制请求间隔。勿在已设置 DATA_SYNTHESIS_MODEL 时再传冲突的 --model

输入格式

  • CSV 第一行为表头。
  • 文本列自动匹配:textcontentbody正文文本;否则使用第一列
  • 手动指定:--text-column 列名

输出格式

  • JSONL:每行一个对象,主要字段包括 chunk_idrow_indexchunkquestionanswer,以及 source_fields(除主文本列外、值非空的其它列)。
  • 运行结束会在标准输出打印统计 JSON:rowschunksquestions_generatedqa_pairs_writtenerrors

能力与局限

能力: 适合从表格语料批量得到结构化 QA,便于后续清洗与训练;出题与作答共用同一模型与网关配置。

局限: 切块为字符滑动窗口,不是按段落语义切分;问题列表依赖模型返回可解析的 JSON,失败会记入 errors

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

82.64%
按下载量换算742

安全审计

VirusTotal

通过

ClawScan

通过

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills