Token导航 LogoToken导航TokenDH.com
研究检索需要联网github未标认证来源可访问clear审计异常

exploratory-data-analysis探索性数据分析

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

1,139

周安装

47

GitHub Stars

14

下载量

372
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:exploratory-data-analysis(探索性数据分析)
来源仓库:https://github.com/jackspace/claudeskillz
仓库路径:skills/exploratory-data-analysis
安装命令:
npx skills add https://github.com/jackspace/claudeskillz --skill exploratory-data-analysis
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/jackspace/claudeskillz --skill exploratory-data-analysis

简介

exploratory-data-analysis 辅助数据整理、表格处理和 CSV/Excel 分析。

  • 适合清洗字段、汇总数据、发现异常并生成统计口径或可读说明。
  • 通过 npx skills add 命令从指定 GitHub 仓库安装,需确认权限和维护状态。
  • 使用时需确认数据来源、字段含义和时间范围,避免误用样本为全量事实。
  • 涉及敏感数据或批量写回时,应先确认权限和脱敏边界。

SKILL.md

Exploratory Data Analysis

Discover patterns, anomalies, and relationships in tabular data through statistical analysis and visualization.

Supported formats: CSV, Excel (.xlsx,.xls), JSON, Parquet, TSV, Feather, HDF5, Pickle

Standard Workflow

  1. Run statistical analysis:
python scripts/eda_analyzer.py <data_file> -o <output_dir>
  1. Generate visualizations:
python scripts/visualizer.py <data_file> -o <output_dir>
  1. Read analysis results from <output_dir>/eda_analysis.json
  2. Create report using assets/report_template.md structure
  3. Present findings with key insights and visualizations

Analysis Capabilities

Statistical Analysis

Run scripts/eda_analyzer.py to generate comprehensive analysis:

python scripts/eda_analyzer.py sales_data.csv -o ./output

Produces output/eda_analysis.json containing:

  • Dataset shape, types, memory usage
  • Missing data patterns and percentages
  • Summary statistics (numeric and categorical)
  • Outlier detection (IQR and Z-score methods)
  • Distribution analysis with normality tests
  • Correlation matrices (Pearson and Spearman)
  • Data quality metrics (completeness, duplicates)
  • Automated insights

Visualizations

Run scripts/visualizer.py to generate plots:

python scripts/visualizer.py sales_data.csv -o ./output

Creates high-resolution (300 DPI) PNG files in output/eda_visualizations/:

  • Missing data heatmaps and bar charts
  • Distribution plots (histograms with KDE)
  • Box plots and violin plots for outliers
  • Correlation heatmaps
  • Scatter matrices for numeric relationships
  • Categorical bar charts
  • Time series plots (if datetime columns detected)

Automated Insights

Access generated insights from the "insights" key in the analysis JSON:

  • Dataset size considerations
  • Missing data warnings (when exceeding thresholds)
  • Strong correlations for feature engineering
  • High outlier rate flags
  • Skewness requiring transformations
  • Duplicate detection
  • Categorical imbalance warnings

Reference Materials

Statistical Interpretation

See references/statistical_tests_guide.md for detailed guidance on:

  • Normality tests (Shapiro-Wilk, Anderson-Darling, Kolmogorov-Smirnov)
  • Distribution characteristics (skewness, kurtosis)
  • Correlation methods (Pearson, Spearman)
  • Outlier detection (IQR, Z-score)
  • Hypothesis testing and data transformations

Use when interpreting statistical results or explaining findings.

Methodology

See references/eda_best_practices.md for comprehensive guidance on:

  • 6-step EDA process framework
  • Univariate, bivariate, multivariate analysis approaches
  • Visualization and statistical analysis guidelines
  • Common pitfalls and domain-specific considerations
  • Communication strategies for different audiences

Use when planning analysis or handling specific scenarios.

Report Template

Use assets/report_template.md to structure findings. Template includes:

  • Executive summary
  • Dataset overview
  • Data quality assessment
  • Univariate, bivariate, and multivariate analysis
  • Outlier analysis
  • Key insights and recommendations
  • Limitations and appendices

Fill sections with analysis JSON results and embed visualizations using markdown image syntax.

Example: Complete Analysis

User request: "Explore this sales_data.csv file"

# 1. Run analysis
python scripts/eda_analyzer.py sales_data.csv -o ./output

# 2. Generate visualizations
python scripts/visualizer.py sales_data.csv -o ./output
# 3. Read results
import json
with open('./output/eda_analysis.json') as f:
    results = json.load(f)

# 4. Build report from assets/report_template.md
# - Fill sections with results
# - Embed images: ![Missing Data](./output/eda_visualizations/missing_data.png)
# - Include insights from results['insights']
# - Add recommendations

Special Cases

Dataset Size Strategy

If < 100 rows: Note sample size limitations, use non-parametric methods

If 100-1M rows: Standard workflow applies

If > 1M rows: Sample first for quick exploration, note sample size in report, recommend distributed computing for full analysis

Data Characteristics

High-dimensional (>50 columns): Focus on key variables first, use correlation analysis to identify groups, consider PCA or feature selection. See references/eda_best_practices.md for guidance.

Time series: Datetime columns auto-detected, temporal visualizations generated automatically. Consider trends, seasonality, patterns.

Imbalanced: Categorical analysis flags imbalances automatically. Report distributions prominently, recommend stratified sampling if needed.

Output Guidelines

Format findings as markdown:

  • Use headers, tables, and lists for structure
  • Embed visualizations: ![Description](path/to/image.png)
  • Include code blocks for suggested transformations
  • Highlight key insights

Make reports actionable:

  • Provide clear recommendations
  • Flag data quality issues requiring attention
  • Suggest next steps (modeling, feature engineering, further analysis)
  • Tailor communication to user's technical level

Error Handling

Unsupported formats: Request conversion to supported format (CSV, Excel, JSON, Parquet)

Files too large: Recommend sampling or chunked processing

Corrupted data: Report specific errors, suggest cleaning steps, attempt partial analysis

Empty columns: Flag in data quality section, recommend removal or investigation

Resources

Scripts (handle all formats automatically):

  • scripts/eda_analyzer.py - Statistical analysis engine
  • scripts/visualizer.py - Visualization generator

References (load as needed):

  • references/statistical_tests_guide.md - Test interpretation and methodology
  • references/eda_best_practices.md - EDA process and best practices

Template:

  • assets/report_template.md - Professional report structure

Key Points

  • Run both scripts for complete analysis
  • Structure reports using the template
  • Provide actionable insights, not just statistics
  • Use reference guides for detailed interpretations
  • Document data quality issues and limitations
  • Make clear recommendations for next steps

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

04

需要参考平台分布和安装热度时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenCode

26.06%
按下载量换算97

Claude Code

25.7%
按下载量换算96

Codex

19.33%
按下载量换算72

Antigravity

13.24%
按下载量换算49

windsurf

8.55%
按下载量换算32

Gemini CLI

3.58%
按下载量换算13

安全审计

Gen Agent Trust Hub

未通过

Socket

通过

Snyk

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。

来源信息

继续浏览同类 Skills