Token导航 LogoToken导航TokenDH.com
Deepghs MCP logo
运维云端stdio官方级别未说明来源级核验

Deepghs MCP

MCP Server

一个Python MCP服务器,为DeepGHS动漫AI生态系统提供数据集浏览、标签查询、角色数据集查找和训练脚本生成功能。

工具数

8

提示词数

0

GitHub Stars

1

资源数

0
PythonClaude云端部署Claude DesktopClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

citronlegacy

提供方

citronlegacy

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install -r requirements.txt

详细介绍

deepghs mcp

Python License: MIT MCP

蟒蛇 主控程序 服务器 DeepGHS 动漫人工智能生态系统。将其连接到任何兼容MCP的客户端(Claude Desktop、Cursor等),以浏览数据集,发现预构建的字符训练集,在18个平台上查找标签,并生成完整的数据管道脚本——所有这些都可以直接从您的AI助手中完成。

______________________________________________________________________

✨ 特性

📦 数据集和模型发现

  • 浏览所有DeepGHS数据集 --Danbooru2024(800多万张图片)、Sankaku、Gelbooru、Zerochan、BangumiBase等
  • 完整的文件树 --在下载任何内容之前,请准确查看数据集包含哪些tar/parlet文件以及它们有多大
  • 型号目录 --为您的任务找到合适的模型:CCIP、WD Tagger Enhanced、美学评分器、面部/头部检测器、动漫分类器等
  • 现场演示 --浏览DeepGHS Spaces(交互式web应用程序)以测试无代码的模型

🏷️ 跨平台标签智能

  • 站点标签查找 --在一个查询中,18个平台上统一了250多万个标签
  • 标签格式转换 --丹博鲁使用 hatsune_miku,Zerochan使用 Hatsune MikuPixiv使用 初音ミク --这个工具将它们全部映射在一起
  • 即用型Parquet查询 --获取复制粘贴代码,以编程方式筛选标记数据库

🎯 字符数据集查找器

  • 预构建的LoRA数据集 --搜索两者 deepghsCyberHarem 现有字符图像集合的命名空间
  • 准备运行下载命令 --获取确切信息 cheesechaser 命令提取你需要的东西
  • 智能回退 --如果不存在预构建的数据集,该工具将直接移交给waifoc脚本生成器

🤖 训练管道代码生成

  • waifoc脚本 --为来自任何来源的任何字符(Danbooru、Pixiv、Gelbouru、Zerochan、Sankaku或Auto)生成完整的、带注释的Python数据收集管道
  • 奶酪追逐者脚本 --生成有针对性的下载脚本,从索引的多TB数据集中提取特定的帖子ID,而无需下载整个存档
  • 格式感知 --自动调整作物大小、铲斗范围和导出格式以适应SD 1.5、SDXL或Flux

______________________________________________________________________

📦 安装

先决条件

  • Python 3.10+
  • git

快速开始

  1. 克隆存储库:
git clone https://github.com/citronlegacy/deepghs-mcp.git
cd deepghs-mcp
  1. 运行安装程序:
chmod +x install.sh && ./install.sh
# or without chmod:
bash install.sh
  1. 或手动安装:
pip install -r requirements.txt

______________________________________________________________________

🔑 认证

HF_TOKEN 对于公共数据集是可选的,但强烈建议-它提高了HuggingFace的API速率限制,对于任何封闭或私有存储库都是必需的。

获取您的代币 huggingface.co/settings/tokens (读取权限就足够了)。

没有它,服务器仍然适用于所有公共DeepGHS数据集。

______________________________________________________________________

▶️ 运行服务器

python deepghs_mcp.py
# or via the venv created by install.sh:
.venv/bin/python deepghs_mcp.py

______________________________________________________________________

⚙️ 配置

克劳德桌面版

将以下内容添加到您的 claude_desktop_config.json:

{
  "mcpServers": {
    "deepghs": {
      "command": "/absolute/path/to/.venv/bin/python",
      "args": ["/absolute/path/to/deepghs_mcp.py"],
      "env": {
        "HF_TOKEN": "hf_your_token_here"
      }
    }
  }
}

其他MCP客户端

  • 命令: /absolute/path/to/.venv/bin/python
  • 参数: /absolute/path/to/deepghs_mcp.py
  • 运输标准: stdio

______________________________________________________________________

💡 用法示例

浏览可用数据集

“DeepGHS在HuggingFace上有哪些动漫数据集?”

助理打来电话 deepghs_list_datasets 并返回按下载计数排序的所有数据集——Danbooru2024、Sankaku、Gelbooru WebP、BangumiBase、site_tags等——以及链接和更新日期。

______________________________________________________________________

下载前检查数据集内容

“deepghs/danbooru2024中有哪些文件?有多大?”

助理打来电话 deepghs_get_repo_info 并返回完整的文件树——每个 .tar.parquet 文件包含单个和总大小,以便您在下载之前确切地知道要提交什么。

______________________________________________________________________

查找预构建的字符数据集

“Re:Zero中的Rem数据集已经可以用于LoRA训练了吗?”

助理打来电话 deepghs_find_character_dataset,搜索两者 deepghsCyberHarem 命名空间,并返回与下载计数和单行下载命令的任何匹配。

示例响应:

## Character Dataset Search: Rem

Found 2 dataset(s):

### CyberHarem/rem_rezero
Downloads: 4.2K | Likes: 31 | Updated: 2024-08-12

Download with cheesechaser:
  from cheesechaser.datapool import SimpleDataPool
  pool = SimpleDataPool('CyberHarem/rem_rezero')
  pool.batch_download_to_directory('./dataset', max_workers=4)

______________________________________________________________________

在所有平台上查找标签

“Danbooru、Zerochan和Pixiv上的‘Hatsune Miku’的正确标签是什么?”

助理打来电话 deepghs_search_tags 并返回每个平台的格式,以及指向site_tags数据集查看器和Parquet查询代码的预过滤链接。

示例响应:

Tag Lookup: Hatsune Miku

  Danbooru:  hatsune_miku
  Gelbooru:  hatsune_miku
  Sankaku:   character:hatsune_miku
  Zerochan:  Hatsune Miku
  Pixiv:     初音ミク (Japanese preferred)
  Yande.re:  hatsune_miku
  Wallhaven: hatsune miku

这直接解决了MultiBoru标签规范化问题。

______________________________________________________________________

生成完整的数据收集管道

“生成一个waifuc脚本,为Arknights的Surtr、Danbooru和Pixiv的SDXL构建LoRA数据集,仅安全。”

助理打来电话 deepghs_generate_waifuc_script 并返回一个完整的带注释的Python脚本。以下是该脚本在运行时执行的操作:

1.  Crawls Danbooru (surtr_(arknights)) + Pixiv (スルト アークナイツ)
2.  Converts all images to RGB with white background
3.  Drops monochrome, sketch, manga panels, and 3D renders
4.  Filters to safe rating only
5.  Deduplicates near-identical images (差分 / variants)
6.  Drops images with no detected face
7.  Splits group images — each character becomes its own crop
8.  CCIP identity filter — AI verifies every image actually shows Surtr
9.  WD14 auto-tagging — writes .txt caption files automatically
10. Resizes and pads to 1024×1024 (SDXL standard)
11. Exports in kohya_ss-compatible folder structure

无需人工管理。无需手动标记。将输出文件夹直接放入您的培训师中。

______________________________________________________________________

生成目标下载脚本

“给我一个奶酪追逐者脚本,从deepghs/danbooru2024下载帖子ID 1234、5678、9012。”

助理打来电话 deepghs_generate_cheesechaser_script 并返回一个完整的Python脚本,其中包含按帖子ID列表下载、下载所有内容或按标签从Parquet索引中过滤的选项。

______________________________________________________________________

为任务找到合适的模型

“DeepGHS有图像美学评分模型吗?”

助理打来电话 deepghs_list_models 随着 search: "aesthetic" 并返回具有流水线任务、下载计数和直接HuggingFace链接的匹配模型。

______________________________________________________________________

在浏览器中尝试模型

“DeepGHS人脸检测模型有现场演示吗?”

助理打来电话 deepghs_list_spaces 随着 search: "detection" 并返回与交互式演示直接链接的匹配空格。

______________________________________________________________________

🛠️ 可用工具

工具说明关键参数
deepghs_list_datasets通过搜索、排序和分页浏览所有DeepGHS数据集search, sort, limit, offset
deepghs_list_models浏览所有DeepGHS型号search, sort, limit
deepghs_list_spaces浏览所有DeepGHS直播演示空间search, limit
deepghs_get_repo_info完整的文件树+任何数据集/模型/空间的元数据repo_id, repo_type
deepghs_search_tags通过site_tags跨18个平台进行跨平台标签查找tag
deepghs_find_character_dataset查找角色的预构建LoRA训练数据集character_name
deepghs_generate_waifuc_script生成完整的数据收集+清理管道脚本character_name, sources, model_format, content_rating
deepghs_generate_cheesechaser_script生成目标数据集下载脚本repo_id, post_ids, output_dir

______________________________________________________________________

📖 工具参考

deepghs_list_datasets

列出DeepGHS的所有公共数据集,可按关键字排序和过滤。

参数

参数类型必填默认说明
searchstring关键字过滤器,例如。 danbooru, character, face
sortstringdownloadsdownloads, likes, createdAt, lastModified
limit整数20每页结果(最多100个)
offset整数0分页偏移
response_formatstringmarkdownmarkdownjson

______________________________________________________________________

deepghs_list_models

列出所有公共模型——CCIP、WD Tagger Enhanced、美学评分器、面部/头部/人物检测器、动漫分类器、毛茸茸检测器、NSFW审查器、风格时代分类器等。

参数

参数类型必填默认说明
searchstring关键字过滤器,例如。 ccip, tagger, aesthetic, face
sortstringdownloadsdownloads, likes, createdAt, lastModified
limit整数20每页结果(最多100个)
offset整数0分页偏移
response_formatstringmarkdownmarkdownjson

______________________________________________________________________

deepghs_list_spaces

列出所有公共空间——面部检测、头部检测、CCIP字符相似性、WD标记器、美学评分器、反向图像搜索、Danbooru字符查找等的实时演示。

参数

参数类型必填默认说明
searchstring关键字过滤器,例如。 detection, tagger, search
limit整数20每页结果(最多100个)
response_formatstringmarkdownmarkdownjson

______________________________________________________________________

deepghs_get_repo_info

获取任何数据集、模型或空间的完整元数据,包括具有单个文件大小的完整文件树。下载多TB数据集之前必不可少。

参数

参数类型必填默认说明
repo_idstring完整的HF回购ID,例如。 deepghs/danbooru2024
repo_typestringdatasetdataset, model,或 space
response_formatstringmarkdownmarkdownjson
提示: 包含以下内容的数据集 .tar 文件会自动附加一个准备复制的奶酪追逐者代码段。

______________________________________________________________________

deepghs_search_tags

使用以下工具在18个平台上查找任何标签 deepghs/site_tags 数据集。返回每个平台的格式指南、预过滤的数据集查看器链接和Parquet查询代码。

参数

参数类型必填默认说明
tagstring任何格式或语言的标签,例如。 hatsune_miku, Hatsune Miku, 初音ミク
response_formatstringmarkdownmarkdownjson
LLM提示: 之前叫这个 deepghs_generate_waifuc_script 以确认字符的正确Danbooru/Pixiv标签格式。

______________________________________________________________________

deepghs_find_character_dataset

搜索 deepghsCyberHarem HuggingFace上的预构建字符数据集。CyberHarem数据集是使用全自动管道构建的:爬行→ CCIP滤波器→ WD14标签→ 上传。

参数

参数类型必填默认说明
character_namestring字符名称,例如。 Rem, Hatsune Miku, surtr arknights
response_formatstringmarkdownmarkdownjson

______________________________________________________________________

deepghs_generate_waifuc_script

使用以下命令生成完整的带注释的Python管道脚本 韦夫克.

管道行动包括(按顺序):

行动它的作用为什么它对LoRA很重要
ModeConvertAction转换为RGB,白色背景标准化输入格式
NoMonochromeAction删除灰度/草图图像防止样式污染
ClassFilterAction仅保留插图/动画删除漫画面板和3D
RatingFilterAction按内容评级筛选如果需要,保持数据集SFW
FilterSimilarAction消除相似图像的重复防止对变体的过度拟合
FaceCountAction只需要一个面删除组照片和对象
PersonSplitAction从组图像中裁剪每个字符最大化可用数据
CCIPActionAI身份验证删除错误字符(最重要的一步)
TaggingActionWD14自动标记生成 .txt 自动字幕
AlignMinSizeAction调整到最小分辨率确保地板质量
PaddingAlignAction从垫子到正方形标准训练分辨率

参数

参数类型必填默认说明
character_namestring显示名称,例如。 Rem, Surtr
danbooru_tagstring自动猜测Danbooru标签,例如。 rem_(re:zero)
pixiv_querystringPixiv搜索查询,日语优先。如果需要 pixiv 来源
sources列表["danbooru"]danbooru, pixiv, gelbooru, zerochan, sankaku, auto
model_formatstringsd1.5sd1.5 (512像素), sdxl (1024px),或 flux (1024px)
content_ratingstringsafesafe, safe_r15,或 all
output_dirstring./dataset_output输出目录
max_images整数无限制限制收集的图像总数
pixiv_tokenstringPixiv刷新令牌(Pixiv源需要)

源标记格式:

来源标签格式注释
danboorurem_(re:zero)蛇病例系列
gelboorurem_(re:zero)和丹博鲁一样
pixivレム / rem re:zero日本人更喜欢更好的成绩
zerochanRem标题案例,启用严格模式
sankakurem_(re:zero)蛇病例
auto角色名称使用gchar数据库——最适合游戏角色

______________________________________________________________________

deepghs_generate_cheesechaser_script

使用以下命令生成Python下载脚本 奶酪追逐者 从索引的tar数据集中提取特定图像,而无需下载整个存档。

参数

参数类型必填默认说明
repo_idstringHF数据集,例如。 deepghs/danbooru2024
output_dirstring./downloads本地下载目录
post_idslist\[int\]特定帖子ID。如果省略,则下载全部(可能非常大)
max_workers整数4并行下载线程(1-16)

______________________________________________________________________

🗂️ DeepGHS关键数据集

回购ID描述用例
deepghs/danbooru2024完整的Danbooru档案,800多万张图片批量下载,数据挖掘
deepghs/danbooru2024-webp-4Mpixel压缩WebP版本下载速度更快
deepghs/sankaku_full完整的Sankaku Channel数据集替代标签生态系统
deepghs/gelbooru-webp-4MpixelGelbooru压缩西方fanart报道
deepghs/site_tags250多万个标签,18个平台标签规范化
deepghs/anime_face_detectionYOLO人脸检测标签列车检测模型
deepghs/bangumibase动漫中的角色框架角色数据集引导

______________________________________________________________________

🔄 推荐工作流程

工作流程A:使用预构建的数据集

1. deepghs_find_character_dataset   → check if dataset exists
2. deepghs_get_repo_info            → inspect file sizes
3. deepghs_generate_cheesechaser_script → get download command
4. Run the script → train

工作流程B:从头开始构建新数据集

1. deepghs_search_tags              → find the correct Danbooru tag
2. deepghs_generate_waifuc_script   → generate full pipeline script
3. Run the script                   → crawl, filter, tag, crop
4. Review output                    → remove any remaining noise
5. Train with kohya_ss

工作流程C:从大型数据集中挖掘特定图像

1. deepghs_get_repo_info            → inspect dataset Parquet structure
2. deepghs_search_tags              → confirm tag names
3. deepghs_generate_cheesechaser_script → generate Parquet-filter script
4. Run the script                   → downloads only matching images

______________________________________________________________________

🤖 LLM注意事项

  • 先检查预制件:总是打电话 deepghs_find_character_dataset 在生成waifoc脚本之前。CyberHarem拥有数百个现成的LoRA数据集。
  • Danbooru标签格式: character_(series) 带下划线-- rem_(re:zero),不 Rem (Re:Zero).使用 deepghs_search_tags 以确认。
  • 文件大小:数据集如 danbooru2024 多TB。始终检查 deepghs_get_repo_info 在推荐完整下载之前。使用带有帖子ID的奶酪追逐者进行有针对性的访问。
  • CCIP至关重要:这是最重要的流水线步骤——没有它,字符数据集的20-40%将是错误的字符噪声。始终将其包含在waifoc脚本中。
  • Pixiv源:需要a pixiv_token。如果用户没有设置,建议使用Danbooru+Gelbooru。
  • 模型格式裁剪尺寸:SD1.5=512×512,SDXL/Flux=1024×1024。此控制 AlignMinSizeActionPaddingAlignAction 在生成的脚本中。

______________________________________________________________________

⚠️ 已知限制

  • 拥抱人脸率限制:没有 HF_TOKEN,集线器API可能会在大量使用时限制请求。
  • 门控数据集:一些数据集在下载前需要在HuggingFace上获得明确批准。服务器返回一个明确的错误和指导。
  • CyberHarem搜索:小众角色可能需要手动浏览 huggingface.co/CyberHarem.
  • waifoc运行时:生成的脚本需要 waifuc 单独安装(不在此服务器的deps中)。首次运行下载约500MB CCIP+WD14型号重量。

______________________________________________________________________

🐛 故障排除

服务器无法启动:

  • 确保Python 3.10+: python --version
  • 重新运行安装程序: bash install.sh

速率限制/429个错误:

403/数据集上禁止:

  • 数据集是封闭的——访问HuggingFace上的数据集页面,点击“请求访问”
  • 确保 HF_TOKEN 来自已被授予访问权限的帐户

未找到字符数据集:

  • 尝试其他拼写: "Rem", "rem_(re:zero)", "rem re:zero"
  • 手动浏览: huggingface.co/CyberHarem
  • 从头开始生成 deepghs_generate_waifuc_script

waifoc脚本失败:

  • 安装waifuc: pip install git+https://github.com/deepghs/waifuc.git
  • GPU支持: pip install "waifuc[gpu]" (更快的CCIP+标记)
  • 首次运行下载约500MB的模型权重——这是预期的

______________________________________________________________________

🤝 贡献

欢迎拉取请求!如果工具返回的数据不正确,脚本模板过时,或者应该突出显示新的DeepGHS数据集或模型,请打开问题或PR。

  1. 分叉存储库
  2. 创建要素分支
  3. 进行更改
  4. 提交拉取请求

______________________________________________________________________

📄 许可证

MIT许可证——见 许可证 了解详情。

______________________________________________________________________

🔗 链接

相关MCP服务器

  • 盖尔博鲁mcp --搜索Gelbooru,从字符标签数据生成SD提示
  • zerochan mcp--浏览zerochan的高品质动漫形象板

目录标签

目录标签

PythonClaude云端部署动漫数据处理本地部署AI训练数据集管理标签查询角色数据集

支持客户端

Claude DesktopClaudeCursor

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

部署方式(deploymentType,部署类型)

remote-capable

工具数量(toolCount,工具数)

8

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiononeremote-capable

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP