Token导航 LogoToken导航TokenDH.com
图像处理权限需确认github未标认证来源可访问许可证需确认审计通过

ocr-image-to-markdownOCR 图像 TO Markdown

Agent Skill

用于辅助文档、README、Markdown、说明文和内容稿件的整理与改写。它适合让 Agent 提炼结构、补齐章节、统一术语、检查链接或把零散材料整理成可读文档。使用时应保留项目已有事实、命令和路径,不要把未确认的信息写成确定结论;涉及对外文案时,还需要控制语气,避免过度营销或夸大能力。

总安装

17,990

周安装

496

GitHub Stars

9,990

下载量

6,612
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:ocr-image-to-markdown(OCR 图像 TO Markdown)
来源仓库:https://github.com/hugohe3/ppt-master
仓库路径:skills/ocr-image-to-markdown
安装命令:
npx skills add https://github.com/hugohe3/ppt-master --skill 'OCR Image to Markdown'
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/hugohe3/ppt-master --skill 'OCR Image to Markdown'

简介

用于辅助文档、Markdown 和内容稿件的整理与改写,适合将图像内容转为结构化文本。

  • 适用于 PPT 转 Markdown、会议记录整理和图文内容归档等场景。
  • 使用时应保留项目已有事实和路径,避免将未确认信息写成确定结论。
  • 涉及对外文案时,需控制语气,避免过度营销或夸大能力。
  • ocr-image-to-markdown 属于图像处理类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

OCR 图像识别转 Markdown

本技能允许你“阅读”图片并将内容转换为可编辑的 Markdown 文本。这在提取数据表格、幻灯片内容或文档截图时特别有用,尤其是当无法使用外部 OCR 库时。

使用指南

  1. 确认目标图片:

- 定位你需要处理的图片文件。 - 如有需要,使用 list_dir 浏览目录。

  1. 查看图片:

- 使用 view_file 工具来“看”图片内容。系统允许你直接处理图像数据。 - 关键: 你必须对图片路径使用 view_file,这样你的视觉模型才能消化它。

  1. 转录内容:

- 基于你所看到的,将文本转录为 Markdown。 - 表格: 将视觉看到的表格转换为标准 Markdown 表格 (| 表头 |... |)。 - 标题: 使用 #, ## 等来标记图片中的标题,保持层级结构。 - 文本: 将段落转录为普通文本。 - 数字: 仔细核对所有数字,特别是财务报表中的数据。

  1. 保存输出:

- 使用 write_to_file 将转录的内容写入 .md 文件(例如 ocr_results.md)。 - 如果处理多张图片,考虑将其追加到同一个文件中,或按逻辑组织。

最佳实践技巧

  • 表格: 仔细对齐行和列。标准 Markdown 表格不支持单元格合并(rowspan/colspan)。你需要根据逻辑流将合并的单元格展开,或者留空。
  • 复杂布局: 如果图片布局复杂(例如左右分栏),请按照逻辑阅读顺序(从上到下,从左到右)将其序列化。
  • 图表/图形: 如果图片包含图表,请描述趋势,或者将可见的数据点提取为列表或表格。
  • 无需代码执行: 不要 试图编写或使用 Python 库(如 pytesseract, easyocr, PIL)来进行文本提取。请直接利用你自身的视觉能力。

示例场景

请求: "把这 3 张财务报告的截图转为 markdown。"

执行:

  1. list_dir 查看文件: img1.png, img2.png, img3.png
  2. view_file 读取 img1.png
  3. (内部处理): 识别表头 "Q1 Revenue" 和表格行数据。
  4. view_file 读取 img2.pngimg3.png
  5. write_to_file 创建 financial_report.md 并写入汇总的内容。

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

33.43%
按下载量换算2,210

Claude

29.02%
按下载量换算1,919

Cursor

19.52%
按下载量换算1,291

Gemini CLI

8.71%
按下载量换算576

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

权限需确认

当前来源未能明确判断权限范围,默认进入异常复核队列。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills