Token导航 LogoToken导航TokenDH.com
图像处理敏感数据github未标认证来源可访问许可证需确认审计未展示

jimliu%2fbaoyu-skills%40baoyu-image-genjimliu%2fbaoyu 技能%40baoyu 图片生成

Agent Skill

用于辅助图像生成、图片编辑、视觉素材处理或图像模型工作流。它适合让 Agent 根据文本生成图片、处理背景、整理视觉提示词或调用相关图像工具。使用时需要确认输入图片、版权来源、输出格式和模型限制;涉及人物、品牌、商品或公开展示素材时,应额外核对授权、真实性和内容合规边界。

总安装

1,077

周安装

44

GitHub Stars

1,709

下载量

345
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:jimliu%2fbaoyu-skills%40baoyu-image-gen(jimliu%2fbaoyu 技能%40baoyu 图片生成)
来源仓库:https://github.com/openakita/openakita
仓库路径:skills/jimliu%2Fbaoyu-skills%40baoyu-image-gen
安装命令:
npx skills add https://github.com/openakita/openakita --skill jimliu/baoyu-skills@baoyu-image-gen
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/openakita/openakita --skill jimliu/baoyu-skills@baoyu-image-gen

简介

用于辅助图像生成、图片编辑、视觉素材处理或图像模型工作流。

  • 适合让 Agent 根据文本生成图片、处理背景、整理视觉提示词或调用相关图像工具。
  • 使用时需要确认输入图片、版权来源、输出格式和模型限制。
  • 涉及人物、品牌、商品或公开展示素材时,应额外核对授权、真实性和内容合规边界。
  • 建议结合原始 README 核验具体用法和功能边界。

SKILL.md

Baoyu Image Gen — AI 图像生成

When to Use

  • 用户要求生成图片、插图、海报、封面、图标等视觉内容
  • 需要为文章、PPT、网站创建配图
  • 需要特定比例的图片(社交媒体封面、手机壁纸等)
  • 需要批量生成多张图片并选择
  • 需要针对不同 AI 绘图服务编写优化 prompt
  • 需要将自然语言描述转换为高质量 AI 图片

Prerequisites

API 密钥配置

至少需要配置一个图像生成服务的 API 密钥。在 .env 文件或环境变量中设置:

环境变量服务商获取方式
OPENAI_API_KEYOpenAI DALL-E 3https://platform.openai.com/api-keys
GOOGLE_API_KEYGoogle Imagen 3https://aistudio.google.com/apikey
DASHSCOPE_API_KEY通义万象 (阿里云)https://dashscope.console.aliyun.com/
REPLICATE_API_TOKENReplicate (Flux 等)https://replicate.com/account/api-tokens

必需依赖

依赖用途安装方式
Python ≥ 3.10运行生成脚本系统预装
httpxHTTP 请求pip install httpx
Pillow图片处理pip install Pillow

可选依赖

依赖用途安装方式
openaiOpenAI SDKpip install openai
google-genaiGoogle Gemini/Imagen SDKpip install google-genai
dashscope通义万象 SDKpip install dashscope
replicateReplicate SDKpip install replicate

Instructions

服务商能力对比

能力DALL-E 3Imagen 3通义万象Replicate (Flux)
图片质量★★★★★★★★★★★★★★★★★★★
中文 prompt★★★★★★★★★★★★★
文字渲染★★★★★★★★★★★★★★
速度中等
价格较贵中等便宜按模型
尺寸灵活度3 种固定多种多种自定义
风格多样性★★★★★★★★★★★★★★★★★★

服务商自动选择策略

Agent 根据以下规则自动选择最合适的服务商:

  1. 中文场景优先 — 如果 prompt 是中文或涉及中国文化元素,优先使用通义万象
  2. 文字渲染需求 — 需要在图片中嵌入文字时,优先使用 DALL-E 3 或 Imagen 3
  3. 速度优先 — 用户要求快速生成时,优先使用 Imagen 3 或通义万象
  4. 质量优先 — 用户要求最高质量时,使用 DALL-E 3 或 Flux Pro
  5. 成本优先 — 批量生成时优先使用通义万象
  6. 可用性 — 根据用户已配置的 API Key 选择

用户可通过指定服务商名称覆盖自动选择。

宽高比速查

比例像素(示例)适用场景
1:11024×1024头像、图标、社交媒体帖子
16:91792×1024PPT 配图、YouTube 封面、桌面壁纸
4:31365×1024传统幻灯片、相册
9:161024×1792手机壁纸、Instagram Stories、短视频封面
3:21536×1024摄影风格、杂志插图
2:31024×1536海报、书籍封面

质量预设

预设说明适用场景
draft快速草稿,低分辨率方案探索、快速迭代
standard标准质量日常使用、网页配图
hd高清,细节丰富正式出版、印刷
ultra最高质量,最长等待海报、展览

Workflows

Workflow 1: 单张图片生成

步骤 1 — 理解用户意图

从用户描述中提取以下信息:

要素默认值说明
主题图片的核心内容
风格写实摄影、插画、水彩、赛博朋克、扁平化等
比例1:1根据用途自动推断
质量standarddraft/standard/hd/ultra
服务商auto自动选择或用户指定

步骤 2 — 构建优化 Prompt

将用户描述转换为各服务商优化的 prompt(见 Prompt 工程部分)。

步骤 3 — 调用生成 API

根据选择的服务商调用对应 API。

步骤 4 — 返回结果

输出生成的图片文件路径,并附上使用的 prompt 和参数。


Workflow 2: 批量生成

一次生成多张图片供用户选择:

步骤 1 — 确定批量参数

参数说明
数量2-8 张(默认 4)
变体策略same-prompt(同 prompt 不同种子)/ varied-prompt(不同风格变体)

步骤 2 — 生成所有图片

并行调用 API 以加快速度。对于 varied-prompt 模式,为每张图调整 prompt 的风格描述词。

步骤 3 — 展示结果并让用户选择


Workflow 3: Prompt 优化咨询

当用户不确定如何描述想要的图片时:

  1. 与用户对话,逐步明确需求
  2. 提供 3-5 个不同方向的 prompt 建议
  3. 用户选择方向后微调 prompt
  4. 生成图片

Prompt 工程指南

通用 Prompt 结构

[主体描述], [环境/背景], [风格], [光线], [构图], [色调], [细节描述]

示例

A cozy coffee shop interior with warm lighting,
morning sunlight streaming through large windows,
a steaming cup of latte on a wooden table with an open book,
shot on 35mm film, soft warm tones,
shallow depth of field, photorealistic

DALL-E 3 专用技巧

  1. 自然语言描述 — DALL-E 3 理解长句叙述,不需要关键词堆砌
  2. 风格指定 — 明确说明 "digital art"、"oil painting"、"photograph" 等
  3. 避免否定词 — 说"蓝天"而非"没有云的天空"
  4. 文字嵌入 — 直接写 with text "Hello" 可以在图中渲染文字
  5. revisedPrompt — DALL-E 3 会重写 prompt,可从返回值获取实际使用的 prompt
from openai import OpenAI
client = OpenAI()

response = client.images.generate(
    model="dall-e-3",
    prompt="一只橘猫坐在窗台上看雨,窗外是东京夜景,赛博朋克风格,霓虹灯倒映在雨滴中",
    size="1792x1024",
    quality="hd",
    n=1
)
image_url = response.data[0].url
revised_prompt = response.data[0].revised_prompt

Google Imagen 3 专用技巧

  1. 结构化描述 — 主体 + 动作 + 环境 + 风格
  2. 摄影参数 — 可以指定镜头焦段、光圈、ISO 等
  3. 艺术家风格 — 可以参考知名艺术家的风格
  4. 多语言支持 — 支持中文 prompt 但英文效果更佳
from google import genai
client = genai.Client()

response = client.models.generate_images(
    model='imagen-3.0-generate-002',
    prompt='A serene Japanese garden in autumn, koi fish swimming in a crystal clear pond, maple trees with red and orange leaves',
    config=genai.types.GenerateImagesConfig(
        number_of_images=1,
        aspect_ratio='16:9'
    )
)

for image in response.generated_images:
    image.image.save('garden.png')

通义万象专用技巧

  1. 中文 prompt 最优 — 直接使用中文描述效果最佳
  2. 风格参数 — 支持 <photography><anime><3d cartoon> 等风格标签
  3. 负向提示 — 支持 negative_prompt 排除不想要的元素
  4. 参考图 — 支持 img2img 以图生图
import dashscope

response = dashscope.ImageSynthesis.call(
    api_key=os.getenv('DASHSCOPE_API_KEY'),
    model='wanx-v1',
    input={
        'prompt': '一座雪山下的小木屋,温暖的灯光从窗户透出,天空中有极光,油画风格',
        'negative_prompt': '低质量, 模糊, 变形'
    },
    parameters={
        'size': '1024*1024',
        'n': 1,
        'style': '<oil painting>'
    }
)

image_url = response.output.results[0].url

Replicate (Flux) 专用技巧

  1. 英文 prompt — Flux 模型英文效果远优于中文
  2. 极致细节 — 适合描述复杂场景和精细纹理
  3. 风格混搭 — 可以混合多种艺术风格
  4. 自定义参数 — 支持 guidance_scale、steps 等高级参数
import replicate

output = replicate.run(
    "black-forest-labs/flux-1.1-pro",
    input={
        "prompt": "An astronaut riding a horse on Mars, cinematic lighting, 8k resolution, hyperdetailed",
        "aspect_ratio": "16:9",
        "output_format": "png",
        "safety_tolerance": 2
    }
)

Output Format

文件命名

{描述关键词}_{服务商}_{比例}_{日期时间}.png

示例:coffee_shop_dalle3_16x9_20250301_143022.png

输出内容

每次图片生成后,返回以下信息:

📸 图片已生成
- 文件:./images/coffee_shop_dalle3_16x9.png
- 服务商:DALL-E 3
- 尺寸:1792 × 1024 (16:9)
- 质量:HD
- Prompt:[实际使用的 prompt]
- 耗时:8.3s
- 费用估算:$0.08

多图对比输出

批量生成时以网格形式对比展示,标注每张的差异(不同风格、不同构图等)。


Common Pitfalls

1. API Key 未配置

症状:调用失败,返回 401/403 错误 解决:检查 .env 或环境变量中的 API Key 是否已正确设置

2. Prompt 过于模糊

错误:"画一张好看的图" 正确:"一只白色的猫咪趴在阳光下的窗台上,背景是模糊的绿色植物,温暖的暖色调,胶片摄影风格"

3. 比例与用途不匹配

常见错误搭配:

  • PPT 配图用了 1:1 → 应该用 16:9
  • 手机壁纸用了 16:9 → 应该用 9:16
  • 社交媒体头像用了 16:9 → 应该用 1:1

4. 中文 prompt 发给 Flux/Replicate

Flux 等模型对中文支持有限,必须先翻译为英文再调用。Agent 应自动完成翻译。

5. 图片中文字乱码

AI 图像生成模型在渲染中文文字时质量不稳定。如果必须在图片中嵌入中文文字,建议:

  • 先生成不含文字的图片
  • 然后用 Pillow 在图片上叠加中文文字
from PIL import Image, ImageDraw, ImageFont

img = Image.open('base_image.png')
draw = ImageDraw.Draw(img)
font = ImageFont.truetype('msyh.ttc', size=48)
draw.text((100, 50), '标题文字', fill='white', font=font)
img.save('final_image.png')

6. 费用失控

批量生成时注意费用:

服务商单张费用(约)
DALL-E 3 HD$0.08
DALL-E 3 Standard$0.04
Imagen 3$0.03
通义万象¥0.04
Flux Pro$0.05

生成前提醒用户预估费用。

7. 内容安全限制

所有服务商都有内容安全审查。如果生成被拒绝:

  • 检查 prompt 是否包含敏感词
  • 调整描述方式
  • 不要尝试绕过安全限制

EXTEND.md 扩展

用户可在技能同目录下创建 EXTEND.md 添加:

  • 首选服务商和默认参数
  • 自定义风格预设模板
  • 品牌相关的 prompt 片段(Logo 描述、品牌色等)
  • 额外的 API 端点或自部署模型地址

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

39.28%
按下载量换算136

Claude

27.9%
按下载量换算96

Cursor

18.55%
按下载量换算64

Gemini CLI

10.05%
按下载量换算35

安全审计

暂无安全审计结果可展示。

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills