OpenAI OCR MCP服务器
一种模型上下文协议(MCP)服务器,使用OpenAI的视觉功能提供OCR(光学字符识别)功能。此服务器与Cursor IDE集成,可从图像中无缝提取文本。
特性
- 图像文本提取:使用OpenAI的GPT-4.1-mini视觉模型从各种图像格式中提取文本
- 自动创建文本文件:自动将提取的文本与源图像一起保存
- 基于内容的文件命名:使用独特的内容哈希进行有组织的文件管理
- 支持多种图像格式:支持JPG、PNG、GIF和WebP格式
- 稳健的错误处理:全面的验证和错误报告
- 详细日志记录:调试友好的日志记录用于故障排除
技术细节
视觉模型
- 使用OpenAI的GPT-4.1-mini模型
- 针对从图像中提取文本进行了优化
- 支持高细节图像分析
- 通过OpenAI的视觉API处理图像
文件处理
- 自动创建文本文件
- 基于内容的哈希生成
- 支持多种图像格式
- 内置文件大小验证
安装
- 克隆存储库
- 安装依赖项:
npm install- 构建TypeScript代码:
npm run build- 在中设置您的OpenAI API密钥
.env文件:
OPENAI_API_KEY=your_api_key_here用法
在游标IDE中
- 在游标设置中配置MCP服务器
- 通过Cursor的命令面板使用OCR工具
- 选择要处理的图像文件
- 提取的文本将是:
- 以光标显示 - 保存为图像旁边的文本文件
文本文件输出
对于每个处理过的图像,服务器都会创建一个具有以下命名约定的文本文件:
{original_image_name}-{content_hash}.txt例子:
- 输入图像:
document.jpg - 输出文件:
document-a1b2c3d4.txt
这 content_hash 是从提取的文本生成的唯一8个字符的哈希,确保:
- 不同文本内容的唯一文件名
- 源图像和提取的文本之间易于匹配
- 同一图像产生不同结果时的版本跟踪
支持的图像格式
- JPEG/JPG
- 便携式网络图形
- 图形交换格式
- WebP
文件大小限制
- 最大文件大小:5MB
- 超过此限制的文件将被拒绝,并显示错误消息
错误处理
服务器为常见问题提供详细的错误消息:
- 图像格式无效
- 超出文件大小
- 文件访问问题
- API关键问题
- 文本提取失败
发展
从源头构建
npm run build运行测试
npm test调试
服务器提供详细的日志,包括:
- API密钥验证
- 文件处理步骤
- 文本提取结果
- 文件保存操作
环境变量
OPENAI_API_KEY:您的OpenAI API密钥(必需)- 支持两种标准(
sk-...)具体项目(sk-proj-...)API密钥
贡献
欢迎投稿!请随时提交拉取请求。
