克罗伊茨贝格
从各种文件格式(56+)中提取文本和元数据,以本机速度生成嵌入和后处理,而无需GPU。
主要特点
- 可扩展架构 –用于自定义OCR后端、验证器、后处理器和文档提取器的插件系统
- 通晓多种语言的人 –Rust、Python、TypeScript/Node.js、Ruby、Go、Java、C#、PHP和Elixir的原生绑定
- 56种文件格式 –PDF、Office文档、图像、HTML、XML、电子邮件、档案、8类学术格式
- OCR支持 –Tesseract(通过本机绑定的所有语言)、EasyOCR/PaddleOCR(Python)、Guten(Node.js),可通过插件API扩展
- 高性能 –具有原生PDFium、SIMD优化和完全并行性的Rust核心
- 灵活部署 –用作库、CLI工具、REST API服务器或MCP服务器
- 内存效率高 –多GB文件的流式解析器
安装
每种语言绑定都提供了包含示例和最佳实践的全面文档。选择您的平台开始:
脚本语言:
- python –PyPI包、异步/同步API、OCR后端(Tesseract、EasyOCR、PaddleOCR)
- 红宝石 –RubyGems包、惯用Ruby API、本机绑定
- PHP –Composer包,现代PHP 8.2+支持,类型安全的API
- 灵药 –十六进制包、OTP集成、并发处理
JavaScript/TypeScript:
- **** –Node.js/Bun的原生NAPI-RS绑定,性能最快
- @kreuzberg/wasm –适用于浏览器的WebAssembly/Deno/Cloudflare Workers
编译语言:
本地:
- 锈 –核心库、灵活的功能标志、零拷贝API
容器:
- 码头工人 –具有API、CLI和MCP服务器模式的官方图像(核心:约1.0-1.3GB,完整:约1.5-2.1GB,带LibreOffice)
命令行:
- 命令行界面 –跨平台二进制、批处理、MCP服务器模式
所有语言绑定都包括Linux和macOS上x86_64和aarch64架构的预编译二进制文件。
Docker:
- 码头工人 -两张图片
core和full适用于x86和ARM
平台支持
涵盖所有语言绑定的完整架构:
| 语言 | Linux x86_64 | Linux aarch64 | macOS ARM64 | Windows x64 |
|---|---|---|---|---|
| python✅ | ✅ | ✅ | ✅ | |
| Node.js | ✅ | ✅ | ✅ | ✅ |
| Ruby | ✅ | ✅ | ✅ | - |
| 灵丹妙药 | ✅ | ✅ | ✅ | ✅ |
| 去吧✅ | ✅ | ✅ | ✅ | |
| Java✅ | ✅ | ✅ | ✅ | |
| C✅ | ✅ | ✅ | ✅ | |
| PHP | ✅ | ✅ | ✅ | ✅ |
| 锈蚀 | ✅ | ✅ | ✅ | ✅ |
| CLI | ✅ | ✅ | ✅ | ✅ |
| Docker | ✅ | ✅ | ✅ | - |
备注: ✅ = 可即时安装的预编译二进制文件。所有平台都经过CI测试。macOS仅支持Apple Silicon。
嵌入支持(可选)
要使用嵌入功能,请执行以下操作:
- 安装ONNX运行时1.22.x:
- Linux:从下载 ONNX运行时版本 (Debian软件包可能有旧版本) - macOS: brew install onnxruntime - Windows:从下载 ONNX运行时版本
- 在代码中使用嵌入-请参阅 嵌入指南
注: Kreuzberg需要ONNX Runtime 1.22.x版本进行嵌入。所有其他Kreuzberg功能都可以在没有ONNX Runtime的情况下工作。
支持格式
具有智能格式检测和全面元数据提取功能的8个主要类别的56种文件格式。
办公文档
| 类别 | 格式 | 功能 |
|---|---|---|
| 文字处理 | .docx, .odt | 全文、表格、图像、元数据、样式 |
| 电子表格 | .xlsx, .xlsm, .xlsb, .xls, .xla, .xlam, .xltm, .ods | 工作表数据、公式、单元格元数据、图表 |
| 演示 | .pptx, .ppt, .ppsx | 幻灯片、演讲者笔记、图像、元数据 |
.pdf | 文本、表格、图像、元数据、OCR支持 | |
| 电子书 | .epub, .fb2 | 章节、元数据、嵌入式资源 |
图像(启用OCR)
| 类别 | 格式 | 功能 |
|---|---|---|
| 光栅 | .png, .jpg, .jpeg, .gif, .webp, .bmp, .tiff, .tif | OCR、表格检测、EXIF元数据、维度、颜色空间 |
| 高级 | .jp2, .jpx, .jpm, .mj2, .pnm, .pbm, .pgm, .ppm | OCR、表格检测、特定格式元数据 |
| 矢量 | .svg | DOM解析、嵌入文本、图形元数据 |
网络和数据
| 类别 | 格式 | 功能 |
|---|---|---|
| 标记 | .html, .htm, .xhtml, .xml, .svg | DOM解析、元数据(开放图、推特卡)、链接提取 |
| 结构化数据 | .json, .yaml, .yml, .toml, .csv, .tsv | 模式检测、嵌套结构、验证 |
| 文本和Markdown | .txt, .md, .markdown, .rst, .org, .rtf | CommonMark、GFM、重构文本、组织模式 |
电子邮件和档案
| 类别 | 格式 | 功能 |
|---|---|---|
| 电子邮件 | .eml, .msg | 页眉、正文(HTML/纯文本)、附件、线程 |
| 档案 | .zip, .tar, .tgz, .gz, .7z | 文件列表、嵌套档案、元数据 |
学术与科学
| 类别 | 格式 | 功能 |
|---|---|---|
| 引用 | .bib, .biblatex, .ris, .enw, .csl | 书目解析、引文提取 |
| 科学的 | .tex, .latex, .typst, .jats, .ipynb, .docbook | LaTeX、Jupyter笔记本、PubMed JATS |
| 文档 | .opml, .pod, .mdoc, .troff | 技术文件格式 |
主要特点
OCR with Table Extraction
多个OCR后端(Tesseract、EasyOCR、PaddleOCR),具有智能表格检测和重建功能。使用可配置的精度阈值从扫描的文档和图像中提取结构化数据。
Batch Processing
以可配置的并行方式同时处理多个文档。通过自动资源管理优化大规模文档处理工作负载的吞吐量。
Password-Protected PDFs
通过单次或多次密码尝试处理加密的PDF。支持RC4和AES加密,并具有自动回退策略。
Language Detection
使用快速语言检测对提取的文本进行自动语言检测。配置置信阈值和每种语言的访问统计信息。
Metadata Extraction
从所有支持的格式中提取全面的元数据:作者、标题、创建日期、页数、EXIF数据和特定于格式的属性。
文档
贡献
欢迎投稿!看 贡献.md 作为指导方针。
许可证
MIT许可证-请参阅 许可证 了解详情。您可以在商业和闭源产品中自由使用克罗伊茨贝格,没有义务,没有病毒效应,也没有许可限制。
