MCP服务器可读性解析器(Python/FastMCP)
学分/参考
此Python实现采用了原始概念,以基于Python的MCP运行,使用 FastMCP
Mozilla可读性解析器MCP服务器
Python实现 模型上下文协议(MCP) 该服务器提取网页内容并将其转换为干净、LLM优化的Markdown。
目录
特性
- 删除广告、导航、页脚和其他非必要内容
- 将干净的HTML转换为格式良好的Markdown
- 优雅地处理错误
- 针对LLM处理进行了优化
- 重量轻,速度快
为什么不直接取?
与简单的获取请求不同,此服务器:
- 使用可读性算法仅提取相关内容
- 消除广告、弹出窗口和导航菜单等噪音
- 通过删除不必要的HTML/CSS减少令牌使用
- 提供一致的Markdown格式,以实现更好的LLM处理
- 处理具有动态内容的复杂网页
安装
- 克隆存储库:
git clone https://github.com/jmh108/MCP-server-readability-python.git
cd MCP-server-readability-python- 创建并激活虚拟环境:
python -m venv venv
source venv/bin/activate # On Windows use: venv\Scripts\activate- 安装依赖项:
pip install -r requirements.txt快速开始
- 启动服务器:
fastmcp run server.py- 请求示例:
curl -X POST http://localhost:8000/tools/extract_content \
-H "Content-Type: application/json" \
-d '{"url": "https://example.com/article"}'工具参考
extract_content
提取网页内容并将其转换为干净的Markdown。
论据:
{
"url": {
"type": "string",
"description": "The website URL to parse",
"required": true
}
}退货:
{
"content": "Markdown content..."
}MCP服务器配置
要配置MCP服务器,请将以下内容添加到MCP设置文件中:
{
"mcpServers": {
"readability": {
"command": "fastmcp",
"args": ["run", "server.py"],
"env": {}
}
}
}然后,可以使用MCP协议启动服务器,并通过 parse 工具。
依赖项
许可证
MIT许可证-请参阅 许可证 了解详情。
