Token导航 LogoToken导航TokenDH.com
研究检索操作浏览器clawhub未标认证来源可访问clear审计提醒

media-cluster媒体集群

Agent Skill

media-cluster 用于处理浏览器自动化、网页检查和页面信息提取,适合在 OpenClaw 中需要让 Agent 打开页面、读取网页或验证前端流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

7,104

周安装

296

GitHub Stars

公开资料未说明

下载量

2,368
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:media-cluster(媒体集群)
来源仓库:https://github.com/q1lin570/media-cluster
安装命令:
openclaw skills install media-cluster
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install media-cluster

简介

自动按关键词抓取中文社交媒体,总结内容,生成Markdown报告,并使用TTS生成简短的语音摘要。

SKILL.md

name
media-cluster
description
Crawls social media by search keyword (MediaCrawler: 小红书/抖音/微博/B站等), summarizes content and outputs report plus short voice summary. User gives one sentence only (e.g. “爬一下小红书关键词比特币并总结”); agent runs full workflow automatically—env setup, crawl, report, TTS. Use when the user asks to search/crawl a topic on Chinese social platforms and summarize.

Media Cluster – 社交平台关键词爬取与总结

路径约定:文中 {baseDir} 表示本技能所在目录(media-cluster 技能根目录)。Agent 执行命令时需将 {baseDir} 替换为实际路径。

基于 MediaCrawler 按「搜索关键词」爬取社交平台内容,汇总有哪些内容,并生成报告与简洁版语音总结。爬虫结果保存在 {baseDir}/MediaCrawler/data/ 下。

使用者一句话指令(仅文本输入)

使用者只需输入一句自然语言,例如:

  • 「帮我爬一下小红书关键词比特币,并总结」
  • 「搜一下抖音上关于 AI 的内容并出报告」
  • 「微博搜“编程副业”爬取并语音总结」

Agent 收到此类请求后,应自动完成全流程(无需用户再执行任何命令):

  1. 首次执行时下载 MediaCrawler:若 {baseDir}/MediaCrawler 目录不存在,则先执行 {baseDir}/scripts/ensure_mediacrawler.sh 或手动 git clone https://github.com/NanmiCoder/MediaCrawler.git {baseDir}/MediaCrawler(将 {baseDir} 换为实际路径),然后再进行后续步骤。
  2. 解析:从用户文本中识别平台(小红书/xhs、抖音/dy、微博/wb、B站/bili、快手/ks、贴吧/tieba、知乎/zhihu)和搜索关键词;若未指明平台则默认小红书(xhs)。
  3. 环境:若尚未配置,先执行 scripts/setup_env.sh(或等价 conda create + pip install + playwright install);否则跳过。
  4. 爬取:在 MediaCrawler 目录下执行 python main.py --platform <平台> --lt qrcode --type search --keywords "<关键词>" --save_data_option jsonl;提示用户首次需扫码登录。
  5. 报告与语音:爬取结束后执行 scripts/summarize_and_voice.py,带上对应的 --platform--keyword,并加上 --voice 生成简洁版语音总结;将报告路径与语音稿内容回复给用户。

使用者只需一次文本输入,其余由 Agent 按上述步骤完成。

前置条件

  • Conda:用于创建并激活 media-cluster 环境。
  • Node.js:>= 16(爬抖音、知乎时需要)。
  • 工具已位于:{baseDir}/MediaCrawler
  • 语音总结(TTS):需在环境变量中配置 SENSEAUDIO_API_KEY接口密钥);可选 SENSEAUDIO_VOICE_ID

0. 首次执行:下载 MediaCrawler

若本地尚未有 MediaCrawler 项目,需先从 GitHub 拉取到技能目录下。执行时将 {baseDir} 替换为实际技能根路径:

# macOS/Linux:使用脚本(推荐,会检测目录是否存在再克隆)
bash {baseDir}/scripts/ensure_mediacrawler.sh

# 所有平台(macOS/Windows/Linux):手动克隆
git clone https://github.com/NanmiCoder/MediaCrawler.git {baseDir}/MediaCrawler

完成后目录结构为:{baseDir}/MediaCrawler/(含 main.pyconfig/requirements.txt 等)。之后再执行环境配置与爬取。

1. 环境配置(首次或环境异常时执行)

以下命令适用于所有平台(macOS / Windows / Linux),在终端或命令提示符中执行:

# 创建 conda 环境(Python 3.11)
conda create -n media-cluster python=3.11 -y

# 激活环境
conda activate media-cluster

# 进入 MediaCrawler 目录
cd {baseDir}/MediaCrawler

# 安装依赖
pip install -r requirements.txt

# 安装 Playwright 浏览器驱动
playwright install

macOS/Linux 也可直接执行技能提供的脚本(将 {baseDir} 换为实际路径):

bash {baseDir}/scripts/setup_env.sh

2. 爬取流程

2.1 确定参数

  • 平台 --platformxhs(小红书)| dy(抖音)| ks(快手)| bili(B站)| wb(微博)| tieba(贴吧)| zhihu(知乎)。
  • 搜索关键词 --keywords:一个或多个,英文逗号分隔,如 比特币比特币,以太坊
  • 爬取类型:本技能使用关键词搜索,即 --type search
  • 登录方式:默认 --lt qrcode(扫码登录);首次运行会弹出浏览器,用对应 APP 扫码。

2.2 执行爬虫

先激活环境,再进入 {baseDir}/MediaCrawler 运行:

conda activate media-cluster
cd {baseDir}/MediaCrawler

# 示例:小红书搜索「比特币」
python main.py --platform xhs --lt qrcode --type search --keywords "比特币" --save_data_option jsonl

数据默认写入 MediaCrawler 下的 data/,即 {baseDir}/MediaCrawler/data/<platform>/。如需指定绝对路径,可加 --save_data_path <绝对路径>

2.3 可选参数(按需)

  • --save_data_option jsonl:推荐 jsonl,便于后续解析。
  • --get_comment yes/no:是否爬评论,默认从 config/base_config.py 读取。
  • --save_data_path <path>:自定义数据目录;不填则用默认 data/

3. 报告与语音总结

爬取完成后:

  1. 读数据:从 {baseDir}/MediaCrawler/data/<platform>/ 下读取最新生成的 jsonl(或 json/csv,视 --save_data_option)。
  2. 生成报告

- 统计条数、关键词/平台、时间范围。 - 按主题/类型归纳「有哪些内容」(标题、摘要、作者、互动数等)。 - 小红书笔记示例字段:note_id, type, title, desc, user_id, nickname, liked_count, collected_count, comment_count, share_count, ip_location, tag_list, note_url, source_keyword 等。

  1. 输出

- 写一份 Markdown 报告 到技能目录或用户指定路径(如 media_cluster_report_<关键词>_<日期>.md)。 - 生成一份 简洁版语音稿(3–5 句话):概括平台、关键词、条数、主要几类内容。 - 语音输出:使用 SenseAudio API 将语音稿合成并保存为 mp3(可选播放)。需在环境变量中配置 SENSEAUDIO_API_KEY(在 接口密钥 创建);可选 SENSEAUDIO_VOICE_ID

报告结构建议:

# 媒体爬取报告:<关键词>

- **平台**:<platform>
- **关键词**:<keywords>
- **爬取条数**:<count>
- **数据时间**:<时间范围>

## 内容概览
(按主题/类型归纳,列出代表性标题与摘要)

## 明细(可选)
(表格或列表:标题、作者、互动、链接等)

4. 小红书结果示例(JSON 单条)

爬虫得到的小红书笔记可能形如:

{
  "note_id": "68f0ae5b0000000003020914",
  "type": "normal",
  "title": "原以为比特币绝对安全呢",
  "desc": "比特币不是去中心化吗?美国司法部是怎么没收...",
  "video_url": "",
  "time": 1760603739000,
  "user_id": "60337046000000000101fd66",
  "nickname": "贝格尔号",
  "liked_count": "1308",
  "collected_count": "963",
  "comment_count": "664",
  "share_count": "573",
  "tag_list": "",
  "note_url": "https://www.xiaohongshu.com/explore/...",
  "source_keyword": "比特币"
}

总结时重点用:title, desc, nickname, liked_count, comment_count, source_keyword

5. 脚本说明

脚本用途
scripts/ensure_mediacrawler.sh(macOS/Linux)首次执行时若不存在 MediaCrawler 目录,则从 GitHub 克隆到技能目录下;Windows 请直接 git clone
scripts/setup_env.sh(macOS/Linux)创建 conda 环境、安装依赖与 Playwright;Windows 请按「环境配置」小节手动执行 conda/pip 命令。
scripts/summarize_and_voice.py读取 MediaCrawler/data/ 下数据,生成 Markdown 报告与简短语音稿,并用 SenseAudio API 合成语音(需环境变量 SENSEAUDIO_API_KEY)。

调用示例(将 {baseDir} 换为实际路径):

conda activate media-cluster
python {baseDir}/scripts/summarize_and_voice.py \
  --data-dir {baseDir}/MediaCrawler/data \
  --platform xhs \
  --keyword "比特币" \
  --report report.md \
  --voice
# 可选:--voice-id <音色ID>、--voice-out <输出mp3路径>;API 文档 https://senseaudio.cn/docs/

6. 注意事项

  • 仅用于学习与研究,遵守平台条款与法律法规。
  • 首次运行需扫码登录;登录态可被缓存,后续可减少扫码。
  • 若遇反爬或验证码,可尝试关闭无头模式(在 config/base_config.py 中设置 HEADLESS = False)。
  • 抖音/知乎需本机已安装 Node.js >= 16。
  • 语音总结:TTS 使用 SenseAudio API,需在环境变量中配置 SENSEAUDIO_API_KEY(在 senseaudio.cn 接口密钥 创建);可选 SENSEAUDIO_VOICE_ID。API 文档见 <https://senseaudio.cn/docs/>。

7. 参考

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

96.35%
按下载量换算2,282

安全审计

VirusTotal

可疑

ClawScan

可疑

Static analysis

通过

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills