deepghs mcp
蟒蛇 主控程序 服务器 DeepGHS 动漫人工智能生态系统。将其连接到任何兼容MCP的客户端(Claude Desktop、Cursor等),以浏览数据集,发现预构建的字符训练集,在18个平台上查找标签,并生成完整的数据管道脚本——所有这些都可以直接从您的AI助手中完成。
______________________________________________________________________
✨ 特性
📦 数据集和模型发现
- 浏览所有DeepGHS数据集 --Danbooru2024(800多万张图片)、Sankaku、Gelbooru、Zerochan、BangumiBase等
- 完整的文件树 --在下载任何内容之前,请准确查看数据集包含哪些tar/parlet文件以及它们有多大
- 型号目录 --为您的任务找到合适的模型:CCIP、WD Tagger Enhanced、美学评分器、面部/头部检测器、动漫分类器等
- 现场演示 --浏览DeepGHS Spaces(交互式web应用程序)以测试无代码的模型
🏷️ 跨平台标签智能
- 站点标签查找 --在一个查询中,18个平台上统一了250多万个标签
- 标签格式转换 --丹博鲁使用
hatsune_miku,Zerochan使用Hatsune MikuPixiv使用初音ミク--这个工具将它们全部映射在一起 - 即用型Parquet查询 --获取复制粘贴代码,以编程方式筛选标记数据库
🎯 字符数据集查找器
- 预构建的LoRA数据集 --搜索两者
deepghs和CyberHarem现有字符图像集合的命名空间 - 准备运行下载命令 --获取确切信息
cheesechaser命令提取你需要的东西 - 智能回退 --如果不存在预构建的数据集,该工具将直接移交给waifoc脚本生成器
🤖 训练管道代码生成
- waifoc脚本 --为来自任何来源的任何字符(Danbooru、Pixiv、Gelbouru、Zerochan、Sankaku或Auto)生成完整的、带注释的Python数据收集管道
- 奶酪追逐者脚本 --生成有针对性的下载脚本,从索引的多TB数据集中提取特定的帖子ID,而无需下载整个存档
- 格式感知 --自动调整作物大小、铲斗范围和导出格式以适应SD 1.5、SDXL或Flux
______________________________________________________________________
📦 安装
先决条件
- Python 3.10+
git
快速开始
- 克隆存储库:
git clone https://github.com/citronlegacy/deepghs-mcp.git
cd deepghs-mcp- 运行安装程序:
chmod +x install.sh && ./install.sh
# or without chmod:
bash install.sh- 或手动安装:
pip install -r requirements.txt______________________________________________________________________
🔑 认证
HF_TOKEN 对于公共数据集是可选的,但强烈建议-它提高了HuggingFace的API速率限制,对于任何封闭或私有存储库都是必需的。
获取您的代币 huggingface.co/settings/tokens (读取权限就足够了)。
没有它,服务器仍然适用于所有公共DeepGHS数据集。
______________________________________________________________________
▶️ 运行服务器
python deepghs_mcp.py
# or via the venv created by install.sh:
.venv/bin/python deepghs_mcp.py______________________________________________________________________
⚙️ 配置
克劳德桌面版
将以下内容添加到您的 claude_desktop_config.json:
{
"mcpServers": {
"deepghs": {
"command": "/absolute/path/to/.venv/bin/python",
"args": ["/absolute/path/to/deepghs_mcp.py"],
"env": {
"HF_TOKEN": "hf_your_token_here"
}
}
}
}其他MCP客户端
- 命令:
/absolute/path/to/.venv/bin/python - 参数:
/absolute/path/to/deepghs_mcp.py - 运输标准: stdio
______________________________________________________________________
💡 用法示例
浏览可用数据集
“DeepGHS在HuggingFace上有哪些动漫数据集?”
助理打来电话 deepghs_list_datasets 并返回按下载计数排序的所有数据集——Danbooru2024、Sankaku、Gelbooru WebP、BangumiBase、site_tags等——以及链接和更新日期。
______________________________________________________________________
下载前检查数据集内容
“deepghs/danbooru2024中有哪些文件?有多大?”
助理打来电话 deepghs_get_repo_info 并返回完整的文件树——每个 .tar 和 .parquet 文件包含单个和总大小,以便您在下载之前确切地知道要提交什么。
______________________________________________________________________
查找预构建的字符数据集
“Re:Zero中的Rem数据集已经可以用于LoRA训练了吗?”
助理打来电话 deepghs_find_character_dataset,搜索两者 deepghs 和 CyberHarem 命名空间,并返回与下载计数和单行下载命令的任何匹配。
示例响应:
## Character Dataset Search: Rem
Found 2 dataset(s):
### CyberHarem/rem_rezero
Downloads: 4.2K | Likes: 31 | Updated: 2024-08-12
Download with cheesechaser:
from cheesechaser.datapool import SimpleDataPool
pool = SimpleDataPool('CyberHarem/rem_rezero')
pool.batch_download_to_directory('./dataset', max_workers=4)______________________________________________________________________
在所有平台上查找标签
“Danbooru、Zerochan和Pixiv上的‘Hatsune Miku’的正确标签是什么?”
助理打来电话 deepghs_search_tags 并返回每个平台的格式,以及指向site_tags数据集查看器和Parquet查询代码的预过滤链接。
示例响应:
Tag Lookup: Hatsune Miku
Danbooru: hatsune_miku
Gelbooru: hatsune_miku
Sankaku: character:hatsune_miku
Zerochan: Hatsune Miku
Pixiv: 初音ミク (Japanese preferred)
Yande.re: hatsune_miku
Wallhaven: hatsune miku这直接解决了MultiBoru标签规范化问题。
______________________________________________________________________
生成完整的数据收集管道
“生成一个waifuc脚本,为Arknights的Surtr、Danbooru和Pixiv的SDXL构建LoRA数据集,仅安全。”
助理打来电话 deepghs_generate_waifuc_script 并返回一个完整的带注释的Python脚本。以下是该脚本在运行时执行的操作:
1. Crawls Danbooru (surtr_(arknights)) + Pixiv (スルト アークナイツ)
2. Converts all images to RGB with white background
3. Drops monochrome, sketch, manga panels, and 3D renders
4. Filters to safe rating only
5. Deduplicates near-identical images (差分 / variants)
6. Drops images with no detected face
7. Splits group images — each character becomes its own crop
8. CCIP identity filter — AI verifies every image actually shows Surtr
9. WD14 auto-tagging — writes .txt caption files automatically
10. Resizes and pads to 1024×1024 (SDXL standard)
11. Exports in kohya_ss-compatible folder structure无需人工管理。无需手动标记。将输出文件夹直接放入您的培训师中。
______________________________________________________________________
生成目标下载脚本
“给我一个奶酪追逐者脚本,从deepghs/danbooru2024下载帖子ID 1234、5678、9012。”
助理打来电话 deepghs_generate_cheesechaser_script 并返回一个完整的Python脚本,其中包含按帖子ID列表下载、下载所有内容或按标签从Parquet索引中过滤的选项。
______________________________________________________________________
为任务找到合适的模型
“DeepGHS有图像美学评分模型吗?”
助理打来电话 deepghs_list_models 随着 search: "aesthetic" 并返回具有流水线任务、下载计数和直接HuggingFace链接的匹配模型。
______________________________________________________________________
在浏览器中尝试模型
“DeepGHS人脸检测模型有现场演示吗?”
助理打来电话 deepghs_list_spaces 随着 search: "detection" 并返回与交互式演示直接链接的匹配空格。
______________________________________________________________________
🛠️ 可用工具
| 工具 | 说明 | 关键参数 |
|---|---|---|
deepghs_list_datasets | 通过搜索、排序和分页浏览所有DeepGHS数据集 | search, sort, limit, offset |
deepghs_list_models | 浏览所有DeepGHS型号 | search, sort, limit |
deepghs_list_spaces | 浏览所有DeepGHS直播演示空间 | search, limit |
deepghs_get_repo_info | 完整的文件树+任何数据集/模型/空间的元数据 | repo_id, repo_type |
deepghs_search_tags | 通过site_tags跨18个平台进行跨平台标签查找 | tag |
deepghs_find_character_dataset | 查找角色的预构建LoRA训练数据集 | character_name |
deepghs_generate_waifuc_script | 生成完整的数据收集+清理管道脚本 | character_name, sources, model_format, content_rating |
deepghs_generate_cheesechaser_script | 生成目标数据集下载脚本 | repo_id, post_ids, output_dir |
______________________________________________________________________
📖 工具参考
deepghs_list_datasets
列出DeepGHS的所有公共数据集,可按关键字排序和过滤。
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
search | string | ❌ | — | 关键字过滤器,例如。 danbooru, character, face |
sort | string | ❌ | downloads | downloads, likes, createdAt, lastModified |
limit | 整数 | ❌ | 20 | 每页结果(最多100个) |
offset | 整数 | ❌ | 0 | 分页偏移 |
response_format | string | ❌ | markdown | markdown 或 json |
______________________________________________________________________
deepghs_list_models
列出所有公共模型——CCIP、WD Tagger Enhanced、美学评分器、面部/头部/人物检测器、动漫分类器、毛茸茸检测器、NSFW审查器、风格时代分类器等。
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
search | string | ❌ | — | 关键字过滤器,例如。 ccip, tagger, aesthetic, face |
sort | string | ❌ | downloads | downloads, likes, createdAt, lastModified |
limit | 整数 | ❌ | 20 | 每页结果(最多100个) |
offset | 整数 | ❌ | 0 | 分页偏移 |
response_format | string | ❌ | markdown | markdown 或 json |
______________________________________________________________________
deepghs_list_spaces
列出所有公共空间——面部检测、头部检测、CCIP字符相似性、WD标记器、美学评分器、反向图像搜索、Danbooru字符查找等的实时演示。
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
search | string | ❌ | — | 关键字过滤器,例如。 detection, tagger, search |
limit | 整数 | ❌ | 20 | 每页结果(最多100个) |
response_format | string | ❌ | markdown | markdown 或 json |
______________________________________________________________________
deepghs_get_repo_info
获取任何数据集、模型或空间的完整元数据,包括具有单个文件大小的完整文件树。下载多TB数据集之前必不可少。
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
repo_id | string | ✅ | — | 完整的HF回购ID,例如。 deepghs/danbooru2024 |
repo_type | string | ❌ | dataset | dataset, model,或 space |
response_format | string | ❌ | markdown | markdown 或 json |
提示: 包含以下内容的数据集 .tar 文件会自动附加一个准备复制的奶酪追逐者代码段。______________________________________________________________________
deepghs_search_tags
使用以下工具在18个平台上查找任何标签 deepghs/site_tags 数据集。返回每个平台的格式指南、预过滤的数据集查看器链接和Parquet查询代码。
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
tag | string | ✅ | — | 任何格式或语言的标签,例如。 hatsune_miku, Hatsune Miku, 初音ミク |
response_format | string | ❌ | markdown | markdown 或 json |
LLM提示: 之前叫这个 deepghs_generate_waifuc_script 以确认字符的正确Danbooru/Pixiv标签格式。______________________________________________________________________
deepghs_find_character_dataset
搜索 deepghs 和 CyberHarem HuggingFace上的预构建字符数据集。CyberHarem数据集是使用全自动管道构建的:爬行→ CCIP滤波器→ WD14标签→ 上传。
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
character_name | string | ✅ | — | 字符名称,例如。 Rem, Hatsune Miku, surtr arknights |
response_format | string | ❌ | markdown | markdown 或 json |
______________________________________________________________________
deepghs_generate_waifuc_script
使用以下命令生成完整的带注释的Python管道脚本 韦夫克.
管道行动包括(按顺序):
| 行动 | 它的作用 | 为什么它对LoRA很重要 |
|---|---|---|
ModeConvertAction | 转换为RGB,白色背景 | 标准化输入格式 |
NoMonochromeAction | 删除灰度/草图图像 | 防止样式污染 |
ClassFilterAction | 仅保留插图/动画 | 删除漫画面板和3D |
RatingFilterAction | 按内容评级筛选 | 如果需要,保持数据集SFW |
FilterSimilarAction | 消除相似图像的重复 | 防止对变体的过度拟合 |
FaceCountAction | 只需要一个面 | 删除组照片和对象 |
PersonSplitAction | 从组图像中裁剪每个字符 | 最大化可用数据 |
CCIPAction | AI身份验证 | 删除错误字符(最重要的一步) |
TaggingAction | WD14自动标记 | 生成 .txt 自动字幕 |
AlignMinSizeAction | 调整到最小分辨率 | 确保地板质量 |
PaddingAlignAction | 从垫子到正方形 | 标准训练分辨率 |
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
character_name | string | ✅ | — | 显示名称,例如。 Rem, Surtr |
danbooru_tag | string | ❌ | 自动猜测 | Danbooru标签,例如。 rem_(re:zero) |
pixiv_query | string | ❌ | — | Pixiv搜索查询,日语优先。如果需要 pixiv 来源 |
sources | 列表 | ❌ | ["danbooru"] | danbooru, pixiv, gelbooru, zerochan, sankaku, auto |
model_format | string | ❌ | sd1.5 | sd1.5 (512像素), sdxl (1024px),或 flux (1024px) |
content_rating | string | ❌ | safe | safe, safe_r15,或 all |
output_dir | string | ❌ | ./dataset_output | 输出目录 |
max_images | 整数 | ❌ | 无限制 | 限制收集的图像总数 |
pixiv_token | string | ❌ | — | Pixiv刷新令牌(Pixiv源需要) |
源标记格式:
| 来源 | 标签格式 | 注释 |
|---|---|---|
danbooru | rem_(re:zero) | 蛇病例系列 |
gelbooru | rem_(re:zero) | 和丹博鲁一样 |
pixiv | レム / rem re:zero | 日本人更喜欢更好的成绩 |
zerochan | Rem | 标题案例,启用严格模式 |
sankaku | rem_(re:zero) | 蛇病例 |
auto | 角色名称 | 使用gchar数据库——最适合游戏角色 |
______________________________________________________________________
deepghs_generate_cheesechaser_script
使用以下命令生成Python下载脚本 奶酪追逐者 从索引的tar数据集中提取特定图像,而无需下载整个存档。
参数
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
repo_id | string | ✅ | — | HF数据集,例如。 deepghs/danbooru2024 |
output_dir | string | ❌ | ./downloads | 本地下载目录 |
post_ids | list\[int\] | ❌ | — | 特定帖子ID。如果省略,则下载全部(可能非常大) |
max_workers | 整数 | ❌ | 4 | 并行下载线程(1-16) |
______________________________________________________________________
🗂️ DeepGHS关键数据集
| 回购ID | 描述 | 用例 |
|---|---|---|
deepghs/danbooru2024 | 完整的Danbooru档案,800多万张图片 | 批量下载,数据挖掘 |
deepghs/danbooru2024-webp-4Mpixel | 压缩WebP版本 | 下载速度更快 |
deepghs/sankaku_full | 完整的Sankaku Channel数据集 | 替代标签生态系统 |
deepghs/gelbooru-webp-4Mpixel | Gelbooru压缩 | 西方fanart报道 |
deepghs/site_tags | 250多万个标签,18个平台 | 标签规范化 |
deepghs/anime_face_detection | YOLO人脸检测标签 | 列车检测模型 |
deepghs/bangumibase | 动漫中的角色框架 | 角色数据集引导 |
______________________________________________________________________
🔄 推荐工作流程
工作流程A:使用预构建的数据集
1. deepghs_find_character_dataset → check if dataset exists
2. deepghs_get_repo_info → inspect file sizes
3. deepghs_generate_cheesechaser_script → get download command
4. Run the script → train工作流程B:从头开始构建新数据集
1. deepghs_search_tags → find the correct Danbooru tag
2. deepghs_generate_waifuc_script → generate full pipeline script
3. Run the script → crawl, filter, tag, crop
4. Review output → remove any remaining noise
5. Train with kohya_ss工作流程C:从大型数据集中挖掘特定图像
1. deepghs_get_repo_info → inspect dataset Parquet structure
2. deepghs_search_tags → confirm tag names
3. deepghs_generate_cheesechaser_script → generate Parquet-filter script
4. Run the script → downloads only matching images______________________________________________________________________
🤖 LLM注意事项
- 先检查预制件:总是打电话
deepghs_find_character_dataset在生成waifoc脚本之前。CyberHarem拥有数百个现成的LoRA数据集。 - Danbooru标签格式:
character_(series)带下划线--rem_(re:zero),不Rem (Re:Zero).使用deepghs_search_tags以确认。 - 文件大小:数据集如
danbooru2024多TB。始终检查deepghs_get_repo_info在推荐完整下载之前。使用带有帖子ID的奶酪追逐者进行有针对性的访问。 - CCIP至关重要:这是最重要的流水线步骤——没有它,字符数据集的20-40%将是错误的字符噪声。始终将其包含在waifoc脚本中。
- Pixiv源:需要a
pixiv_token。如果用户没有设置,建议使用Danbooru+Gelbooru。 - 模型格式裁剪尺寸:SD1.5=512×512,SDXL/Flux=1024×1024。此控制
AlignMinSizeAction和PaddingAlignAction在生成的脚本中。
______________________________________________________________________
⚠️ 已知限制
- 拥抱人脸率限制:没有
HF_TOKEN,集线器API可能会在大量使用时限制请求。 - 门控数据集:一些数据集在下载前需要在HuggingFace上获得明确批准。服务器返回一个明确的错误和指导。
- CyberHarem搜索:小众角色可能需要手动浏览 huggingface.co/CyberHarem.
- waifoc运行时:生成的脚本需要
waifuc单独安装(不在此服务器的deps中)。首次运行下载约500MB CCIP+WD14型号重量。
______________________________________________________________________
🐛 故障排除
服务器无法启动:
- 确保Python 3.10+:
python --version - 重新运行安装程序:
bash install.sh
速率限制/429个错误:
- 集
HF_TOKEN在您的MCP环境配置中 - 获取免费代币: huggingface.co/settings/tokens
403/数据集上禁止:
- 数据集是封闭的——访问HuggingFace上的数据集页面,点击“请求访问”
- 确保
HF_TOKEN来自已被授予访问权限的帐户
未找到字符数据集:
- 尝试其他拼写:
"Rem","rem_(re:zero)","rem re:zero" - 手动浏览: huggingface.co/CyberHarem
- 从头开始生成
deepghs_generate_waifuc_script
waifoc脚本失败:
- 安装waifuc:
pip install git+https://github.com/deepghs/waifuc.git - GPU支持:
pip install "waifuc[gpu]"(更快的CCIP+标记) - 首次运行下载约500MB的模型权重——这是预期的
______________________________________________________________________
🤝 贡献
欢迎拉取请求!如果工具返回的数据不正确,脚本模板过时,或者应该突出显示新的DeepGHS数据集或模型,请打开问题或PR。
- 分叉存储库
- 创建要素分支
- 进行更改
- 提交拉取请求
______________________________________________________________________
📄 许可证
MIT许可证——见 许可证 了解详情。
______________________________________________________________________
🔗 链接
相关MCP服务器
- 盖尔博鲁mcp --搜索Gelbooru,从字符标签数据生成SD提示
- zerochan mcp--浏览zerochan的高品质动漫形象板
