Token导航 LogoToken导航TokenDH.com
Pixel Ml MCP logo
音视频stdio官方级别未说明来源级核验

Pixel Ml MCP

MCP Server

一个用于AI代理的视频智能工具包,提供视频索引、搜索和事件检测功能。

工具数

0

提示词数

0

GitHub Stars

2

资源数

0
Python语音音频视频

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

PixelML

提供方

PixelML

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install pixelml-av

详细介绍

代理视频智能

索引。搜索。检测。 AI代理的视频智能工具包 像素ML.

pip install pixelml-av

av做什么

视频存储器 --摄取视频,按自然语言搜索,用RAG引文提问。

监视情报 --使用时间推理检测闭路电视录像中的跌倒、长队、人群聚集和轮椅依从性。

快速开始

视频搜索

# 1. Set up your provider
av config setup

# 2. Ingest a video
av ingest video.mp4

# 3. Search
av search "person with red bag"

# 4. Ask questions
av ask "what happened at 2:30?"

监控检测

# Cloud (quick start — Gemini free tier)
export AV_API_KEY=your-gemini-key
av sentinel video.mp4

# Local (free, private — runs on your Mac/GPU)
ollama pull mistral-small3.2
av sentinel video.mp4 --provider ollama

# Specific alerts
av sentinel video.mp4 --alerts FALL,LONG_QUEUE

# Batch a directory
av sentinel videos/ --camera cam_lobby

所有命令

# Video memory
av ingest video.mp4             # Index video content
av search "what was discussed"  # Semantic search
av ask "key decisions?"         # RAG Q&A with citations
av list                         # List indexed videos
av transcript  --format vtt # Get transcript
av export --format jsonl        # Export all data
av export --format jsonl

# Surveillance intelligence
av sentinel video.mp4              # Detect events (all 4 alert types)
av sentinel video.mp4 --alerts FALL # Fall detection only
av sentinel video.mp4 -p ollama    # Self-hosted (free)
av sentinel videos/ -c cam_lobby   # Batch with camera tracking

Sentinel——监视事件检测

使用VLM观测的时间推理检测4种事件类型:

警报检测工作原理
坠落位置跟踪standing→lying 跨帧过渡(F1=0.944)
长队列时间持久性在3+个连续块中检测到队列(90秒)
人群聚集密度+增长人群持续或人数迅速增加
轮椅_合规性服务时间轮椅用户无人值守>阈值

Sentinel供应商

提供商设置成本速度
双子座 (云)export AV_API_KEY=key可用免费层~5s/块
开放路由export OPENROUTER_API_KEY=key0.04-0.14美元/百万代币约10个/块
奥拉玛 (本地)ollama pull mistral-small3.2自由~25秒/块
开放人工智能export AV_API_KEY=key$$$~5s/块

自动检测:如果没有指定提供者,av会尝试Gemini→ 开放路由→ 奥拉玛→ OpenAI。

运作原理

Video → 30s chunks (5s overlap)
  → 8 frames per chunk
  → VLM perception (positions, queue, crowd, wheelchair)
  → Temporal agent (state across chunks)
  → Alert rules (transition detection, persistence, growth)
  → JSON output

基于21个视觉模型的107个实验。关键见解:结构提取+时间规则胜过通用的“检测异常”提示。

配置

交互式设置(推荐)

av config setup

从四个供应商中选择:

#提供者身份验证转录嵌入
1OpenAI(Codex OAuth)自动检测耳语文本嵌入3-small
2OpenAI(API密钥)sk-... key耳语文本嵌入3-small
3人类学(克劳德)API密钥不支持不支持
4谷歌(双子座)API密钥不支持text-embedding-004

配置已保存到 ~/.config/av/config.json 并在会话中持续存在。

注: Anthropic和Gemini不支持Whisper转录。对于这些提供商,请使用 av ingest --captions 用于基于帧的字幕,或设置 AV_OPENAI_API_KEY 用于转录回退。

环境变量

Env-vars总是覆盖config.json:

export AV_API_KEY="sk-..."
export AV_API_BASE_URL="https://api.openai.com/v1"  # or any OpenAI-compatible endpoint
export AV_TRANSCRIBE_MODEL="whisper"
export AV_VISION_MODEL="gpt-4-1"
export AV_EMBED_MODEL="text-embedding-3-small"
export AV_CHAT_MODEL="gpt-4-1"

需求

  • Python 3.11+
  • FFmpeg(brew install ffmpeg)
  • 来自OpenAI、Anthropic或Google或Codex CLI OAuth的API密钥

命令

命令描述
av config setup交互式提供者设置向导
av config show显示当前配置
`av ingest
`将视频文件摄取到索引中
av search 全文+语义搜索
av ask RAG问答及引用
av list列出所有索引视频
av info 详细的视频元数据
av transcript 输出成绩单(VTT/SRT/text)
av export导出为JSONL/VTT/SRT
av open --at 按时间戳打开视频
av version打印版本JSON

许可证

Apache许可证2.0——请参阅 许可证 了解详情。

目录标签

目录标签

Python语音音频视频视频索引本地部署自然语言搜索事件检测RAG问答监控智能

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

oauth

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiooauth部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP