Token导航 LogoToken导航TokenDH.com
效率只读clawhub未标认证来源可访问clear审计通过

data-cleaning-claw数据清理爪

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

3,636

周安装

150

GitHub Stars

公开资料未说明

下载量

1,188
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:data-cleaning-claw(数据清理爪)
来源仓库:https://github.com/tujinsama/data-cleaning-claw
安装命令:
openclaw skills install data-cleaning-claw
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install data-cleaning-claw

简介

Data-Cleaning-Claw 自动化清洗脏数据、重复项和广告噪音。

  • 适用于 Excel/CSV/JSON 文件的去重、标准化和缺失值处理。
  • 支持批量操作,输出高质量干净数据。
  • 安装命令:openclaw skills install data-cleaning-claw;建议确认数据源格式。
  • 注意处理过程中可能修改原文件,需备份重要数据。

SKILL.md

name
data-cleaning-claw
description
|

数据自动化清洗虾

处理脏数据的专用 skill。核心脚本:scripts/data_clean.py

工作流程

1. 接收数据

用户可通过以下方式提供数据:

  • 上传文件(CSV / Excel / JSON)→ 保存到 workspace,记录路径
  • 直接粘贴数据 → 写入临时 CSV 文件

2. 确认清洗需求

如果用户没有明确说明,询问以下信息(可一次性问完):

  • 需要哪些清洗操作(去重/缺失值/格式标准化/HTML去噪/数据验证)?
  • 去重时是否有关键字段(如手机号、邮箱)?
  • 输出格式(CSV/Excel/JSON)?

如果用户说"全部清洗"或"帮我清洗一下",默认执行所有规则:strip-html,deduplicate,fill-missing,standardize,validate

3. 执行清洗

使用 exec 运行脚本:

python3 ~/.openclaw/skills/data-cleaning-claw/scripts/data_clean.py \
  --input "<输入文件路径>" \
  --output "<输出文件路径>" \
  --rules "strip-html,deduplicate,fill-missing,standardize,validate" \
  --key-fields "<可选:去重关键字段,逗号分隔>"

可用规则(--rules 参数,逗号分隔):

  • strip-html — 去除 HTML 标签和广告噪音
  • deduplicate — 去重(默认全字段;--key-fields 指定关键字段)
  • fill-missing — 缺失值填充(数值→中位数,文本→"未知")
  • standardize — 格式标准化(自动识别日期/金额/电话列)
  • validate — 数据验证,异常行添加 _数据质量标记

可选字段强制指定参数:

  • --date-fields — 强制指定日期列(逗号分隔列名)
  • --amount-fields — 强制指定金额列
  • --phone-fields — 强制指定电话列

4. 输出结果

脚本自动生成两个文件:

  • <output> — 清洗后的数据文件
  • <output>.report.json — 清洗报告(删除行数、各列处理情况)

向用户展示清洗报告摘要,并发送清洗后的文件。

参考资料

需要了解具体规则时读取:

  • references/cleaning-rules.md — 去重、缺失值、格式标准化的详细规则
  • references/noise-patterns.md — HTML噪音、广告文案、无效字符的识别模板
  • references/data-types.md — 日期、金额、电话、邮箱的识别正则

注意事项

  • 清洗前提醒用户备份原始数据(如果是重要数据)
  • 默认策略是标记异常值(添加 _数据质量标记 列),不直接删除,保留人工复核
  • 脚本依赖:pandas numpy openpyxl beautifulsoup4,如缺少依赖先运行 pip install pandas numpy openpyxl beautifulsoup4

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

80.09%
按下载量换算951

安全审计

VirusTotal

通过

ClawScan

通过

Static analysis

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills