CV_Robot_MCP
\*\*\**这个仓库不再维护,因为我将把重点放在AGi ROS机器人和AI服务器项目上。*
利用VLM CV_MCP_服务器 拥抱面部空间,通过机器人的摄像头“看到”物体。
概述
CV_Robot_MCP是一个基于Python的项目,旨在通过集成视觉语言模型(VLM)使机器人能够直观地解释其环境。系统与 CV_MCP_服务器拥抱人脸空间 以分析机器人相机捕获的图像并提供有意义的对象描述。
🎬 演示视频
🎬 观看演示视频 这里
特性
- 视觉语言模型集成: 通过HuggingFace Space将机器人的摄像头馈送与VLM无缝连接。
- Python实现: 完全用Python编写,具有灵活性和易于定制。
- 物体识别: 识别和描述机器人视野中的对象。
入门指南
先决条件
- Python 3.10+
- 访问 CV_MCP_服务器拥抱人脸空间
- 带摄像头支持的机器人硬件(可选用于使用样本图像进行测试)
安装
克隆此存储库:
git clone https://github.com/OppaAI/CV_Robot_MCP.git
cd CV_Robot_MCP安装Python要求:
pip install -r requirements.txt生成HuggingFace令牌并将其输入.env文件
用法
- 启动你的机器人,确保摄像头正常工作。
- 运行主脚本以捕获图像并将其发送到CV_MCP_Server:
python cv_robot.py- 查看VLM返回的对象描述。
配置
- 服务器URL: 如果端点发生变化,请更新代码/配置文件中的HuggingFace Space URL。
- 相机设置: 根据需要修改Python脚本中的分辨率、帧率或源代码。
贡献
欢迎投稿!请打开问题或提交功能请求、错误或改进的拉取请求。
许可证
该项目根据MIT许可证获得许可。看 许可证 了解详情。
致谢
- CV_MCP_服务器拥抱人脸空间
- HuggingFace用于托管VLM部署
- 高频空间中使用的VLM:Qwen2.5-VL-7B指令
