Token导航 LogoToken导航TokenDH.com
MCP Video & Audio Text Extraction Server logo
音视频未说明官方级别未说明来源级核验

MCP Video & Audio Text Extraction Server

MCP Server

一个基于Whisper模型的MCP服务器,提供从多种视频平台和音频文件中提取文本的功能,支持多语言识别和多种音频格式处理。

工具数

3

提示词数

0

GitHub Stars

9

资源数

0
视频处理PythonClaudeClaude DesktopClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

SealinGp

提供方

SealinGp

最后核验

2026/5/17 20:19

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

MCP视频和音频文本提取服务器

一种MCP服务器,提供从各种视频平台和音频文件中提取文本的功能。该服务器实现了模型上下文协议(MCP),以提供对音频转录服务的标准化访问。

支持的平台

该服务支持从各种平台下载视频和提取音频,包括但不限于:

  • 油管
  • 哔哩哔哩
  • TikTok 的
  • Instagram
  • 推特/X
  • 脸书
  • Vimeo
  • 每日影像
  • SoundCloud

有关支持平台的完整列表,请访问 yt-dlp支持的网站.

核心技术

该项目利用OpenAI的Whisper模型通过MCP工具进行音频到文本处理。服务器公开了四个主要工具:

  1. 视频下载:从支持的平台下载视频
  2. 音频下载:在支持的平台上从视频中提取音频
  3. 视频文本提取:从视频中提取文本(下载并转录)
  4. 音频文件文本提取:从音频文件中提取文本

MCP集成

此服务器使用模型上下文协议构建,该协议提供:

  • 向LLM公开工具的标准化方法
  • 安全访问视频内容和音频文件
  • 与Claude Desktop等MCP客户端集成

特性

  • 基于Whisper的高质量语音识别
  • 多语言文本识别
  • 支持多种音频格式(mp3、wav、m4a等)
  • MCP兼容工具接口
  • 大文件的异步处理

技术栈

  • Python 3.10+
  • 模型上下文协议(MCP)Python SDK
  • yt-dlp(YouTube视频下载)
  • openai耳语(核心音频转文本引擎)
  • 媒染剂

系统要求

  • FFmpeg(音频处理所需)
  • 最低8GB RAM
  • 推荐GPU加速(NVIDIA GPU+CUDA)
  • 足够的磁盘空间(用于模型下载和临时文件)

重要的首次运行通知

重要提示: 首次运行时,系统将自动下载Whisper模型文件(约1GB)。此过程可能需要几分钟到几十分钟,具体取决于您的网络状况。模型文件将在本地缓存,后续运行时不需要再次下载。

安装

使用紫外线(推荐)

使用紫外线时,不需要特定的安装。我们将使用uvx直接运行视频提取服务器:

curl -LsSf https://astral.sh/uv/install.sh | sh

安装FFmpeg

音频处理需要FFmpeg。您可以通过各种方法安装它:

# Ubuntu or Debian
sudo apt update && sudo apt install ffmpeg

# Arch Linux
sudo pacman -S ffmpeg

# MacOS
brew install ffmpeg

# Windows (using Chocolatey)
choco install ffmpeg

# Windows (using Scoop)
scoop install ffmpeg

用法

为Claude/Cursor配置

添加到您的Claude/Cursor设置:

"mcpServers": {
  "video-extraction": {
    "command": "uvx",
    "args": ["mcp-video-extraction"]
  }
}

可用的MCP工具

  1. 视频下载:从支持的平台下载视频
  2. 音频下载:在支持的平台上从视频中提取音频
  3. 视频文本提取:从视频中提取文本(下载并转录)
  4. 音频文件文本提取:从音频文件中提取文本

配置

该服务可以通过环境变量进行配置:

Whisper配置

  • WHISPER_MODEL:Whisper型号尺寸(小/底座/小/中/大),默认值:“底座”
  • WHISPER_LANGUAGE:转录的语言设置,默认值:“auto”

YouTube下载配置

  • YOUTUBE_FORMAT:用于下载的视频格式,默认值:“bestaudio”
  • AUDIO_FORMAT:用于提取的音频格式,默认值:“mp3”
  • AUDIO_QUALITY:音频质量设置,默认值:'192'

存储配置

  • TEMP_DIR:临时文件存储位置,默认值:“/tmp/mcp-video”

下载设置

  • DOWNLOAD_RETRIES:下载重试次数,默认值:10
  • FRAGMENT_RETRIES:片段下载重试次数,默认值:10
  • SOCKET_TIMEOUT:套接字超时(秒),默认值:30

性能优化提示

  1. GPU加速:

- 安装CUDA和cuDNN - 确保安装了PyTorch的GPU版本

  1. 模型尺寸调整:

- 微小:最快但精度较低 - 基础:速度和精度平衡 - large:精度最高,但需要更多资源

  1. 使用SSD存储临时文件以提高I/O性能

备注

  • Whisper型号(约1GB)需要在首次运行时下载
  • 确保有足够的磁盘空间用于临时音频文件
  • 下载YouTube视频需要稳定的网络连接
  • GPU推荐用于更快的音频处理
  • 处理长视频可能需要相当长的时间

MCP集成指南

此服务器可以与任何兼容MCP的客户端一起使用,例如:

  • 克劳德桌面
  • 自定义MCP客户端
  • 其他启用MCP的应用程序

有关MCP的更多信息,请访问 模型上下文协议.

文档

有关本文档的中文版本,请参阅 README_zh.md

许可证

麻省理工学院

目录标签

目录标签

视频处理PythonClaude音频转文本本地部署多语言支持MCP集成Whisper模型

支持客户端

Claude DesktopClaudeCursor

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

3

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP