Token导航 LogoToken导航TokenDH.com
开发规范只读github未标认证来源可访问clear审计通过

scikit-learn-best-practicesscikit 学习最佳实践

Agent Skill

scikit-learn-best-practices 用于记录任务执行中的错误、用户纠正、经验和能力缺口,适合在 Codex、Claude、Cursor、Gemini CLI 中希望让 Agent 持续沉淀问题、修正和最佳实践时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

6,452

周安装

261

GitHub Stars

87

下载量

2,025
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:scikit-learn-best-practices(scikit 学习最佳实践)
来源仓库:https://github.com/mindrally/skills
仓库路径:skills/scikit-learn-best-practices
安装命令:
npx skills add https://github.com/mindrally/skills --skill scikit-learn-best-practices
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/mindrally/skills --skill scikit-learn-best-practices

简介

scikit-learn-best-practices 用于记录任务执行中的错误、用户纠正、经验和能力缺口,适合让 Agent 持续沉淀问题、修正和最佳实践时使用。

  • 适用于模型开发、实验复现、团队协作等需要知识积累的场景。
  • 通过安装命令 npx skills add https://github.com/mindrally/skills --skill scikit-learn-best-practices 添加,需确认权限范围和维护状态。
  • 使用前应核实是否会触发联网、命令执行或文件读写操作,避免越权访问。
  • 建议结合原始 README 进一步核验具体用法和功能边界。

SKILL.md

Scikit-learn Best Practices

Expert guidelines for scikit-learn development, focusing on machine learning workflows, model development, evaluation, and best practices.

Code Style and Structure

  • Write concise, technical responses with accurate Python examples
  • Prioritize reproducibility in machine learning workflows
  • Use functional programming for data pipelines
  • Use object-oriented programming for custom estimators
  • Prefer vectorized operations over explicit loops
  • Follow PEP 8 style guidelines

Machine Learning Workflow

Data Preparation

  • Always split data before any preprocessing: train/validation/test
  • Use train_test_split() with random_state for reproducibility
  • Stratify splits for imbalanced classification: stratify=y
  • Keep test set completely separate until final evaluation

Feature Engineering

  • Scale features appropriately for distance-based algorithms
  • Use StandardScaler for normally distributed features
  • Use MinMaxScaler for bounded features
  • Use RobustScaler for data with outliers
  • Encode categorical variables: OneHotEncoder, OrdinalEncoder, LabelEncoder
  • Handle missing values: SimpleImputer, KNNImputer

Pipelines

  • Always use Pipeline to chain preprocessing and modeling
  • Prevents data leakage by fitting transformers only on training data
  • Makes code cleaner and more reproducible
  • Enables easy deployment and serialization
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.ensemble import RandomForestClassifier

pipeline = Pipeline([
    ('scaler', StandardScaler()),
    ('classifier', RandomForestClassifier(random_state=42))
])

Column Transformers

  • Use ColumnTransformer for different preprocessing per feature type
  • Combine numeric and categorical preprocessing in single pipeline

Model Selection and Tuning

Cross-Validation

  • Use cross-validation for reliable performance estimates
  • cross_val_score() for quick evaluation
  • cross_validate() for multiple metrics
  • Use appropriate CV strategy:

- KFold for regression - StratifiedKFold for classification - TimeSeriesSplit for temporal data - GroupKFold for grouped data

Hyperparameter Tuning

  • Use GridSearchCV for exhaustive search
  • Use RandomizedSearchCV for large parameter spaces
  • Always tune on training/validation data, never test data
  • Set n_jobs=-1 for parallel processing

Model Evaluation

Classification Metrics

  • Use appropriate metrics for your problem:

- accuracy_score for balanced classes - precision_score, recall_score, f1_score for imbalanced - roc_auc_score for ranking ability

  • Use classification_report() for comprehensive overview
  • Examine confusion_matrix() for error analysis

Regression Metrics

  • mean_squared_error (MSE) for general use
  • mean_absolute_error (MAE) for interpretability
  • r2_score for explained variance

Evaluation Best Practices

  • Report confidence intervals, not just point estimates
  • Use multiple metrics to understand model behavior
  • Compare against meaningful baselines
  • Evaluate on held-out test set only once, at the end

Handling Imbalanced Data

  • Use stratified splitting and cross-validation
  • Consider class weights: class_weight='balanced'
  • Use appropriate metrics (F1, AUC-PR, not accuracy)
  • Adjust decision threshold based on business needs

Feature Selection

  • Use SelectKBest with statistical tests
  • Use RFE (Recursive Feature Elimination)
  • Use model-based selection: SelectFromModel
  • Examine feature importances from tree-based models

Model Persistence

  • Use joblib for saving and loading models
  • Save entire pipelines, not just models
  • Version control model artifacts
  • Document model metadata

Performance Optimization

  • Use n_jobs=-1 for parallel processing where available
  • Consider warm_start=True for iterative training
  • Use sparse matrices for high-dimensional sparse data
  • Consider incremental learning with partial_fit() for large data

Key Conventions

  • Import from submodules: from sklearn.ensemble import RandomForestClassifier
  • Set random_state for reproducibility
  • Use pipelines to prevent data leakage
  • Document model choices and hyperparameters

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

04

需要参考平台分布和安装热度时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenCode

30.56%
按下载量换算619

Claude Code

24.33%
按下载量换算493

Antigravity

18.12%
按下载量换算367

Codex

13.58%
按下载量换算275

Gemini CLI

7.46%
按下载量换算151

github-copilot

3.28%
按下载量换算66

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。

来源信息

继续浏览同类 Skills