MCP视觉桥
一种模型上下文协议(MCP)服务器,使非视觉LLM能够通过OpenRouter通过视觉模型利用视觉能力。
概述
MCP视觉桥作为一个中间MCP服务器,通过OpenRouter的统一API将没有图像输入支持的LLM(如GLM-4.6)连接到多模式模型(如Grok)。这使得任何兼容MCP的客户端,包括OpenCode,都可以使用非视觉LLM执行视觉任务。
建筑
Non-vision LLM → MCP Vision Bridge → OpenRouter → Vision Model → Response Transformer → Text Response核心组件
- MCP视觉服务器 -主服务器通过MCP协议公开视觉工具
- 路由器型号 -非视觉和视觉模型之间的智能路由
- 图像处理器 -处理图像编码、预处理和格式转换
- 响应变压器 -将多模式响应转换为纯文本格式
- OpenRouter客户端 -管理与OpenRouter API的通信
- OpenCode集成层 -确保与OpenCode的MCP客户端兼容
特性
- 符合MCP协议 -标准MCP服务器实现
- OpenRouter集成 -通过统一的API访问75+人工智能模型
- OpenCode兼容 -与OpenCode的MCP客户端直接集成
- 隐私第一 -无持久存储,临时文件清理
- 多模型支持 -主要和后备视觉模型
- 速率限制 -内置请求限制和错误处理
- 流媒体支持 -实时响应流媒体功能
快速开始
安装
# Clone the repository
git clone
cd vision-mcp
# Install dependencies
npm install
# Configure environment
cp .env.example .env
# Edit .env with your OpenRouter API key基本用法
import { MCPVisionBridge } from './src/server/mcp-server'
const bridge = new MCPVisionBridge({
openrouter: {
apiKey: process.env.OPENROUTER_API_KEY!,
models: {
primary: 'x-ai/grok-beta-vision',
fallback: 'google/gemini-2.0-flash-001'
}
}
})
await bridge.start()OpenCode集成
添加到您的OpenCode配置中:
{
"mcpServers": {
"vision-bridge": {
"command": "node",
"args": ["dist/server/mcp-server.js"],
"env": {
"OPENROUTER_API_KEY": "your-api-key"
}
}
}
}可用工具
analyze_image
使用视觉模型分析图像。
参数:
image_url(string):URL或base64编码的图像数据prompt(string):分析提示model(字符串,可选):要使用的视觉模型max_tokens(数字,可选):响应长度限制
describe_image
获取图像内容的详细描述。
参数:
image_url(string):URL或base64编码的图像数据detail_level(字符串,可选):“低”或“高”
extract_text_from_image
从图像中提取文本内容(OCR)。
参数:
image_url(string):URL或base64编码的图像数据language(字符串,可选):OCR语言提示
文档
支持的型号
主要视觉模型
x-ai/grok-beta-vision-Grok视觉能力google/gemini-2.0-flash-001-谷歌最新的视觉模型anthropic/claude-3-5-sonnet-20241022-人类视觉模型
回退模型
- 自动故障转移到辅助模型
- 速率限制和错误处理
- 通过模型路由实现成本优化
安全与隐私
- 无持久存储 -图像在内存中处理并清理
- API密钥保护 -仅环境变量存储
- 输入验证 -图像格式和大小验证
- 速率限制 -内置请求限制
- 审计日志 -请求跟踪合规性
许可证
MIT许可证-有关详细信息,请参阅许可证文件。
贡献
- 分叉存储库
- 创建要素分支
- 进行更改
- 添加测试
- 提交拉取请求
支持
- GitHub问题:报告bug和功能请求
- 文档:查看文档/文件夹以获取详细指南
- 示例:有关使用示例,请参阅示例/文件夹
