Token导航 LogoToken导航TokenDH.com
效率需要联网clawhub未标认证来源可访问clear审计通过

pdf-processorPDF processor 工具

Agent Skill

pdf-processor 用于补充效率相关能力,适合在 OpenClaw 中需要让 Agent 承接效率相关任务时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

8,217

周安装

339

GitHub Stars

公开资料未说明

下载量

2,685
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:pdf-processor(PDF processor 工具)
来源仓库:https://github.com/reaperchen/pdf-processor
安装命令:
openclaw skills install pdf-processor
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install pdf-processor

简介

学术PDF处理:提取文字、判断语言、翻译(英文→中文)、生成200字纯中文概述。使用本地Ollama模型,不消耗线上API。适用于学术论文、研究报告等PDF文件的处理。当用户说"处理PDF"、"翻译论文"、"生成论文概述"时,或用户将PDF放入论文处理目录时使用。

SKILL.md

name
pdf-processor
description
学术PDF处理:提取文字、判断语言、翻译(英文→中文)、生成200字纯中文概述。使用本地Ollama模型,不消耗线上API。适用于学术论文、研究报告等PDF文件的处理。当用户说"处理PDF"、"翻译论文"、"生成论文概述"时,或用户将PDF放入论文处理目录时使用。

PDF Processor

Overview

处理学术论文PDF的完整工作流:文字提取、语言判断、翻译、概述生成。使用本地Ollama模型(qwen2.5:7b),成本为0元,适合处理大量学术文献。

核心功能

  • 提取PDF全部文字(按页分隔)
  • 判断语言(中文/英文)
  • 提取和翻译论文标题(英文→中文)
  • 英文PDF分段翻译(每段2000字符)
  • 实时进度显示(显示当前段/总段数、百分比)
  • 断点续传(中断后可从断点继续)
  • 生成200字纯中文概述
  • 自动文件组织和清理

Quick Start

处理单个PDF

python3 scripts/process_pdf.py <pdf_path> <output_base_dir>

示例

# 处理英文PDF
python3 scripts/process_pdf.py \
  ~/Documents/论文处理/未处理/英文/2602.23362v1.pdf \
  ~/Documents/论文处理

# 处理中文PDF
python3 scripts/process_pdf.py \
  ~/Documents/论文处理/未处理/中文/test.pdf \
  ~/Documents/论文处理

目录结构

PDF处理前需先创建目录:

~/Documents/论文处理/
├── 未处理/
│   ├── 中文/
│   └── 英文/
├── 处理中/
├── 已完成/
│   ├── 原文/
│   ├── 翻译/
│   └── 概述/
└── 索引/

详见 directory-structure.md

Workflow

完整处理流程

1. PDF提取文字 → 保存到"处理中/文件名_提取.txt"
2. 提取和翻译论文标题(英文→中文)
3. 判断语言(中文/英文)
4. 如果是英文:
   - 分段(每段2000字符)
   - 逐段翻译(本地Ollama)
   - **显示实时进度**(当前段/总段数 | 百分比 | 字符数)
   - **保存进度**(处理中/文件名_progress.json)
   - 合并翻译结果
   - **删除进度文件**
5. 生成概述(200字纯中文,本地Ollama)
6. 保存翻译文件到"已完成/翻译/"
7. 保存概述文件到"已完成/概述/"(包含中英文标题)
8. 移动PDF到"已完成/原文/"
9. 删除"处理中/提取.txt"

详细说明见 workflow.md

分段翻译策略

  • 分段大小: 每段最多4000字符
  • 分段边界: 优先在段落边界断开(\

\ \ , \ \ , 。, !, ?)

  • 翻译模型: 本地Ollama (qwen2.5:7b)
  • 优势: 避免长文本处理问题,提高翻译质量

概述生成

  • 输入: 前5000字符(摘要和引言)
  • 输出: 200字纯中文
  • 内容: 研究背景、主要方法、核心贡献、应用价值
  • 清理: 移除所有英文、数字、符号

Technical Details

依赖项

  • Python库: pdfplumber, requests, re, shutil, pathlib
  • Ollama: qwen2.5:7b模型
  • Ollama服务: 本地运行在http://localhost:11434

性能特点

  • 成本: 0元(本地模型,不消耗线上API)
  • 处理时间:

- 提取: 秒级 - 翻译: 每段30秒-1分钟,总时间取决于段数 - 概述: 秒级

  • 质量:

- 翻译: 学术准确性高,保持段落结构 - 概述: 200字纯中文,简洁准确

  • v2.0新功能:

- 实时进度显示: 显示当前段/总段数、百分比、字符数 - 断点续传: 中断后可从断点继续,自动跳过已翻译段落 - 进度保存: 保存到临时JSON文件,完成后自动删除

分段示例

对于45,873字符的PDF:

  • 分段数: 17段
  • 每段字符数: 2,000-4,000
  • 总翻译时间: 约8-17分钟

Output Files

翻译文件

位置: 已完成/翻译/文件名_翻译.txt

格式:

# 论文翻译

**源文件**: 文件名.pdf
**处理时间**: YYYY-MM-DD HH:MM:SS
**翻译模型**: 本地Ollama (qwen2.5:7b)
**分段数**: N

## 📄 翻译内容

[翻译内容]

概述文件

位置: 已完成/概述/文件名_概述.txt

格式:

# 论文概述

**源文件**: 文件名.pdf
**处理时间**: YYYY-MM-DD HH:MM:SS
**概述模型**: 本地Ollama (qwen2.5:7b)

## 📚 论文标题

**英文**: [论文英文标题]
**中文**: [论文中文标题]

## 📝 论文概述

[200字纯中文概述]

Resources

scripts/

  • process_pdf.py: 完整的PDF处理脚本(v2.0)

- 文字提取、语言判断、翻译、概述生成 - 实时进度显示(当前段/总段数 | 百分比) - 断点续传(中断后可从断点继续,自动跳过已翻译段落) - 自动文件组织和清理 - 可独立运行或被其他脚本调用

  • generate_index.py: 索引生成脚本

- 生成已完成论文的索引文件 - 包含标题、语言、概述、处理时间 - 支持关键词搜索

references/

  • workflow.md: 完整工作流程说明

- 关键步骤说明 - 技术依赖 - 性能特点

  • directory-structure.md: 目录结构和使用说明

- 完整目录树 - 文件夹用途 - 文件生命周期

Troubleshooting

Ollama服务未启动

错误: Connection refused

解决:

# 启动Ollama服务
ollama serve

Ollama模型未安装

错误: model 'qwen2.5:7b' not found

解决:

# 安装模型
ollama pull qwen2.5:7b

# 查看已安装模型
ollama list

PDF路径错误

错误: PDF文件不存在

检查:

  • 确认PDF路径正确
  • 确认输出目录存在
  • 确认有读写权限

翻译质量不佳

可能原因:

  • 分段过大(超过4000字符)
  • 温度设置过高(当前0.3)

调整:

  • 修改split_text()函数的max_length参数
  • 修改translate_segment()temperature选项

Notes

  • 成本优势: 使用本地Ollama,完全避免线上API费用
  • 质量平衡: 分段翻译在质量和速度之间取得平衡
  • 自动化: 文件自动组织和清理,无需手动管理
  • v2.0改进:

- 进度显示: 实时显示翻译进度(当前段/总段数 | 百分比 | 字符数) - 断点续传: 中断后可从断点继续,自动跳过已翻译段落,节省时间 - 进度文件: 保存到处理中/文件名_progress.json,完成后自动删除 - 串行翻译: 稳定可靠,适合各类机器性能

  • 适用范围: 适用于学术论文、研究报告、技术文档等PDF文件

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

97.73%
按下载量换算2,624

安全审计

VirusTotal

通过

ClawScan

通过

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills