Token导航 LogoToken导航TokenDH.com
待分类敏感数据unknown未标认证来源可访问许可证需确认审计未展示

siliconflow-vision硅流愿景

Agent Skill

siliconflow-vision 用于处理图像、截图、视觉识别或图片素材相关工作,适合在 Local Agent 中需要让 Agent 分析图片、整理视觉素材或辅助图像流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

544

周安装

22

下载量

171
Local Agent

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:siliconflow-vision(硅流愿景)
来源仓库:https://skills.volces.com
仓库路径:siliconflow-vision
安装命令:
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。当前暂无明确安装命令,请以来源页面说明为准。

简介

siliconflow-vision 用于处理图像、截图和视觉识别相关工作,适合在 Local Agent 中分析图片或整理视觉素材。

  • 它能辅助图像流程,提升 Agent 对视觉内容的处理能力。
  • 通过 npx skills add 命令从 GitHub 仓库安装,具体用法可参考原始 README 文档。
  • 安装前需确认权限范围和维护状态,注意是否涉及联网、命令执行或文件读写操作。
  • 适用宿主包括 Local Agent,接入前应确认版本、权限和运行环境要求。

SKILL.md

图片识别与分析 Skill

工作流程

用户发图片 → 主模型直接调用 skill → skill 识别图片 → skill 输出详细结果 → 主模型分析+网络搜索 → 给出准确回答

核心原则(重要)

主模型必须遵守:

  1. 必须调用 skill:用户发图片时,主模型必须调用此 skill
  2. 禁止直接回答:不要用 OpenClaw 的 image 工具,不要跳过 skill
  3. skill 只识别:skill 只做客观识别,不做分析解读
  4. 主模型负责思考:分析、联想、回答由主模型完成

正确流程:

用户: [图片] 这个 meme 笑点在哪?

主模型: python scripts/analyze_image.py meme.jpg
       ↓
Skill 输出: 详细识别结果(文字+元素)
       ↓
主模型: 基于识别结果进行分析
       - 如果需要背景知识 → 网络搜索
       - 如果需要验证 → 网络搜索
       ↓
主模型回答: 结合事实的准确解析

错误示范:

❌ 直接调用 image 工具回答 ❌ 跳过 skill 自己猜测 ❌ skill 做过多分析解读 ❌ 不验证信息就回答

使用方式

脚本调用

# 基本用法(推荐)
python scripts/analyze_image.py /path/to/image.jpg

# 指定自定义问题
python scripts/analyze_image.py image.jpg -q "只提取文字"

# 智能模式(更精准,适合复杂图片)
python scripts/analyze_image.py meme.png -m smart

# 简短输出
python scripts/analyze_image.py screenshot.png -s

# 指定服务商
python scripts/analyze_image.py photo.jpg --provider openai

脚本参数

参数说明示例
image图片路径或 URL/path/to/image.jpg
-q, --question自定义问题-q "提取所有文字"
-m, --model模型选择-m smart
-s, --short简短模式-s
--provider指定服务商--provider openai
-c, --compress压缩图片-c

支持的服务商

服务商默认模型特点配置键
SiliconFlowdeepseek-ai/deepseek-vl2默认,快速稳定siliconflow_api_key
OpenAIgpt-4o通用强大openai_api_key
Anthropicclaude-sonnet-4推理能力强anthropic_api_key

模型选择

模式模型速度适用场景
fastdeepseek-ai/deepseek-vl2~5秒默认,详细识别日常图片
smartQwen/Qwen2.5-VL-72B-Instruct~2分钟复杂图片、图表、需要精准分析
balanceddeepseek-ai/deepseek-vl 待测试2-turbo平衡速度与精度

配置说明

文件: config/default.json

{
  "provider": "siliconflow",
  "api_key": "sk-xxx",
  "model": "fast"
}

也可通过环境变量:

  • SILICONFLOW_API_KEY
  • OPENAI_API_KEY
  • ANTHROPIC_API_KEY

Skill 输出格式(优化版)

当识别图片时,skill 会输出:

1. 图片类型:截图/表情包/聊天记录等
2. 清晰文字:完整提取所有文字
3. 画面元素:列出所有视觉元素
4. 整体布局:图片结构
5. 风格氛围:简约/搞笑/暗黑等
6. 其他细节:值得注意的元素

重要原则

  • 只做客观识别,不做分析解读
  • 只做简单描述,不过度思考
  • 文字必须完整准确
  • 让主模型负责思考分析

错误处理

错误解决方案
API key 失效检查配置或环境变量
图片不存在检查路径是否正确
超时切换到 fast 模式重试
服务商不支持切换到其他服务商

支持的图片类型

  • 📸 截图:代码错误、聊天记录、网页
  • 🎭 表情包/Meme:搞笑图片、网络梗图
  • 📄 文档:表格、合同、发票、名片
  • 📊 图表:数据可视化、流程图
  • 🖼️ 照片:风景、产品、人物

优化历史

2026-02-04 优化

  • ✅ 修改默认提示词为详细识别模式
  • ✅ 要求完整提取所有清晰文字
  • ✅ 要求描述画面元素和布局
  • ✅ 明确禁止 skill 做分析解读
  • ✅ 强调主模型负责思考分析
  • ✅ 强制主模型使用 skill(禁止用 image 工具)

2026-02-06 整合

  • ✅ 合并 image-understand 功能
  • ✅ 支持多服务商(SiliconFlow、OpenAI、Anthropic)
  • ✅ 支持多种图片格式
  • ✅ 支持图片 URL 和本地路径

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Local Agent

92.53%
按下载量换算158

安全审计

暂无安全审计结果可展示。

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills