Token导航 LogoToken导航TokenDH.com
待分类执行命令github未标认证来源可访问许可证需确认审计通过

data-profiler数据分析器

Agent Skill

用于辅助数据整理、表格处理、CSV/Excel 分析、指标计算和图表准备。它适合让 Agent 清洗字段、汇总数据、发现异常、生成统计口径或把分析结果转成可读说明。使用时需要确认数据来源、字段含义和时间范围,避免把样本数据当全量事实;涉及敏感数据、导出文件或批量写回时,应先确认权限和脱敏边界。

总安装

861

周安装

37

GitHub Stars

37

下载量

302
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:data-profiler(数据分析器)
来源仓库:https://github.com/majesticlabs-dev/majestic-marketplace
仓库路径:skills/data-profiler
安装命令:
npx skills add https://github.com/majesticlabs-dev/majestic-marketplace --skill data-profiler
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/majesticlabs-dev/majestic-marketplace --skill data-profiler

简介

用于辅助数据整理、表格处理和指标计算。适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

  • 适合清洗字段、汇总数据、发现异常或生成统计口径。
  • 使用时需确认数据来源、字段含义和时间范围。
  • 涉及敏感数据或批量写回应先确认权限与脱敏边界。
  • data-profiler 属于待分类类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

Data Profiler

Audience: Data engineers and analysts exploring new datasets.

Goal: Generate comprehensive profiles including statistics, correlations, and missing patterns.

Scripts

Execute profiling functions from scripts/profiling.py:

from scripts.profiling import (
    profile_dataframe,
    print_profile_summary,
    profile_correlations,
    profile_missing_patterns
)

Usage Examples

Basic Profiling

import pandas as pd
from scripts.profiling import profile_dataframe, print_profile_summary

df = pd.read_csv('data.csv')
profile = profile_dataframe(df)
print_profile_summary(profile)

Output:

Shape: 10,000 rows x 15 columns
Memory: 1.23 MB

Column Summary:
  id (int64): 10,000 unique, no nulls
  email (object): 9,847 unique, 1.53% null
  revenue (float64): 3,421 unique, no nulls
  created_at (datetime64[ns]): 365 unique, no nulls

Correlation Analysis

from scripts.profiling import profile_correlations

corr = profile_correlations(df, threshold=0.7)

if corr['high_correlations']:
    print("Highly correlated columns:")
    for c in corr['high_correlations']:
        print(f"  {c['col1']} <-> {c['col2']}: {c['correlation']}")

Missing Data Patterns

from scripts.profiling import profile_missing_patterns

missing = profile_missing_patterns(df)

for col, stats in missing.items():
    if col != 'co_missing_columns':
        print(f"{col}: {stats['percent']}% missing, max {stats['consecutive_max']} consecutive")

# Check for columns missing together
if 'co_missing_columns' in missing:
    for col1, col2, pct in missing['co_missing_columns']:
        print(f"{col1} and {col2} both missing {pct}% of time")

Profile Output Schema

shape: [rows, columns]
memory_mb: float
columns:
  column_name:
    dtype: string
    null_count: int
    null_pct: float
    unique_count: int
    unique_pct: float
    # Numeric columns add:
    min: float
    max: float
    mean: float
    std: float
    median: float
    zeros: int
    negatives: int
    # String columns add:
    min_length: int
    max_length: int
    top_values: {value: count}
    # Datetime columns add:
    min_date: string
    max_date: string
    date_range_days: int

Analysis Dimensions

Numeric Columns

  • Min, max, range, mean, median, mode
  • Standard deviation, variance, skewness, kurtosis
  • Percentiles (5, 25, 50, 75, 95)
  • Zero count, negative count
  • Outlier detection (IQR method)

String Columns

  • Min/max/avg length
  • Pattern analysis (emails, phones, URLs)
  • Top N frequent values
  • Whitespace issues (leading/trailing)
  • Case distribution (upper/lower/mixed)
  • Empty string count

DateTime Columns

  • Min/max dates, date range span
  • Missing dates in sequence
  • Day of week distribution
  • Hour distribution (if timestamp)

Categorical Columns

  • Cardinality, value distribution
  • Imbalance ratio
  • Rare categories (< 1%)

Correlation Analysis

correlation_matrix = df.select_dtypes(include=[np.number]).corr()

# Highly correlated pairs (> 0.8)
high_corr = []
for i in range(len(correlation_matrix.columns)):
    for j in range(i+1, len(correlation_matrix.columns)):
        if abs(correlation_matrix.iloc[i, j]) > 0.8:
            high_corr.append((
                correlation_matrix.columns[i],
                correlation_matrix.columns[j],
                correlation_matrix.iloc[i, j]
            ))

Quality Flags

Automatically flag:

  • High nulls: > 50% missing values
  • Constant column: Only 1 unique value
  • High cardinality: Unique ratio > 95% (possible ID)
  • Suspected duplicates: Based on key columns
  • Data type mismatch: Numeric stored as string
  • Future dates: Dates beyond today
  • Negative values: In typically positive columns

Report Sections

Executive Summary

  • Dataset shape (rows x columns), memory footprint
  • Overall quality score, critical issues count

Column-by-Column Analysis

  • Statistics table, distribution histogram (ASCII for terminal)
  • Top values (for categorical), quality warnings

Relationships

  • Correlation heatmap summary
  • Potential foreign key relationships, column dependencies

Recommendations

  • Suggested data type optimizations
  • Columns to investigate, potential data quality rules

Output Formats

  • Markdown Report: Full detailed report with tables
  • JSON Summary: Machine-readable profile for programmatic use
  • HTML Dashboard: Interactive report with charts (if ydata-profiling available)

Dependencies

pandas
numpy

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

34.32%
按下载量换算104

Claude

32.95%
按下载量换算100

Cursor

18.31%
按下载量换算55

Gemini CLI

9.6%
按下载量换算29

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

执行命令

安装流程涉及命令执行,可能通过 npx skills add https://github.com/majesticlabs-dev/majestic-marketplace --skill data-profiler 联网下载 Skill 或依赖。用户安装前应确认命令来源、仓库内容和执行环境。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills