浏览器自动化MCP服务器
一种模型上下文协议(MCP)服务器,为Claude和其他兼容MCP的AI助手提供浏览器自动化功能。
特性
- Web自动化:以编程方式控制web浏览器
- 电脑屏幕截图工具:截取网页截图
- 元素交互:单击、键入并与web元素交互
- 导航:在页面之间导航并管理浏览器状态
- 表格填写:自动填写和提交表格
- 数据提取:从网页中提取数据
安装
# Clone the repository
git clone https://github.com/samihalawa/browser-automation-server.git
cd browser-automation-server
# Install dependencies
npm install
# Build the server
npm run build用法
启动服务器
npm start配置
将服务器添加到MCP配置中:
{
"servers": {
"browser-automation": {
"command": "/path/to/node",
"args": ["/path/to/browser-automation-server/build/index.js"],
"enabled": true,
"port": 3008,
"environment": {
"NODE_PATH": "/path/to/node_modules",
"PATH": "/usr/local/bin:/usr/bin:/bin"
}
}
}
}可用工具
导航
导航到URL。
参数:
url(字符串,必填):要导航到的URLwaitUntil(字符串,可选):导航等待条件。选项:“加载”、“加载域内容”、“网络空闲”。默认值:'load'
截图
截取当前页面的屏幕截图。
参数:
fullPage(布尔值,可选):是捕获整页还是仅捕获视口。默认值:falsepath(string,可选):保存截图的路径。如果没有提供,则返回base64编码的图像
点击
单击一个元素。
参数:
selector(string,必填):要单击的元素的CSS选择器waitForSelector(boolean,可选):是否等待选择器出现。默认值:true
类型
在输入框中键入文本。
参数:
selector(string,必填):输入元素的CSS选择器text(字符串,必填):要键入的文本delay(数字,可选):按键之间的延迟(毫秒)。默认值:0
提取
从页面中提取数据。
参数:
selector(string,必填):要提取的元素的CSS选择器attribute(字符串,可选):要提取的属性。如果未提供,则提取文本内容
评估
在浏览器上下文中评估JavaScript。
参数:
script(string,必填):要求值的JavaScript代码args(数组,可选):传递给脚本的参数
示例用法
- 导航到网站:
navigate(url: "https://example.com")- 截图:
screenshot(fullPage: true)- 单击按钮:
click(selector: "#submit-button")- 填写表格:
type(selector: "#username", text: "user123")
type(selector: "#password", text: "password123")
click(selector: "#login-button")- 提取数据:
extract(selector: ".product-title", attribute: "innerText")需求
- Node.js 14+
- 浏览器自动化剧作家
许可证
麻省理工学院

