Token导航 LogoToken导航TokenDH.com
研究检索操作浏览器github未标认证来源可访问许可证需确认审计提醒

crawl4ai-seocrawl4ai SEO 搜索

Agent Skill

crawl4ai-seo 用于处理浏览器自动化、网页检查和页面信息提取,适合在 Codex、Claude、Cursor、Gemini CLI 中需要让 Agent 打开页面、读取网页或验证前端流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

220

周安装

9

GitHub Stars

112

下载量

71
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:crawl4ai-seo(crawl4ai SEO 搜索)
来源仓库:https://github.com/artwist-polyakov/polyakov-claude-skills
仓库路径:skills/crawl4ai-seo
安装命令:
npx skills add https://github.com/artwist-polyakov/polyakov-claude-skills --skill crawl4ai-seo
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/artwist-polyakov/polyakov-claude-skills --skill crawl4ai-seo

简介

crawl4ai-seo 抓取网站页面进行 SEO 审计,提供内容、结构与内链完整性分析。

  • 适用于竞品分析、站内问题诊断与搜索可见性优化等数字营销场景。
  • 自动检测标题缺失、重复 H1 与规范链接问题,绘制内部链接图谱识别孤立页面。
  • 不替代 SERP 工具,而是补充页面真实内容与结构数据,支持导出审计报告。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

crawl4ai-seo

SEO-краулер для аудита сайтов и конкурентного анализа. Отвечает на вопрос: "что реально лежит на страницах и как сайт устроен изнутри".

Не заменяет SERP-инструменты (позиции, видимость) — дополняет их данными о содержимом и структуре страниц.

Что умеет

ЗадачаОписание
Site inventoryПолная инвентаризация страниц: URL, status, title, H1, meta, canonical, word count
On-page auditПоиск проблем: пустые title/H1, дубли заголовков, битые canonical, thin content
Internal linking auditГраф внутренних ссылок, orphan pages (0 входящих), слабо связанные страницы
Navigation auditBreadcrumbs, nav-блоки, menu consistency, hub-страницы без исходящих ссылок
Landing comparisonСравнение shortlist URL по on-page сигналам (title, H1, content, links)
Competitor researchПрогон страниц конкурентов через тот же pipeline, сравнение шаблонов

Config

Глобальные defaults: config/defaults.example.json, локальный override — config/defaults.json. Подробности: config/README.md.

Правило: в defaults не храним конкретный сайт или параметры клиента. Всё site-specific приходит через launch params и фиксируется в cache/jobs/<job_id>/resolved_config.json.

Workflow

Перед любым crawl

  1. Проверь окружение: python3 scripts/doctor.py Если crawl4ai/playwright не готовы — остановись на seed/discovery, не имитируй crawl.
  2. Определи цель исследования:

- Полный аудит сайта → site inventory + navigation audit - Аудит лендингов → landing comparison - Анализ конкурентов → competitor research - Аудит перелинковки → internal linking audit

  1. Собери launch params:

- target.domain — домен исследования - job.project — проект/клиент - job.label — метка запуска

Основной pipeline

# 1. Создать job
python3 scripts/init_job.py --domain https://example.com --project client-a --label full-audit

# 2. Собрать seed URL из sitemap/robots
python3 scripts/seed_urls.py --job-id <job_id>

# 3. Запустить crawl
uv run --script scripts/crawl_batch.py --job-id <job_id>

# 4. Построить навигационный отчёт
python3 scripts/build_navigation_report.py \
  --seed-job-id <seed_job_id> \
  --crawl-job-id <crawl_job_id> \
  --report-dir reports/<project>/<label>

# 5. Сравнить страницы
python3 scripts/compare_pages.py --job-id <job_id>

Быстрый вариант (без отдельного init)

python3 scripts/seed_urls.py --domain https://example.com --project client-a --label quick-check
uv run --script scripts/crawl_batch.py --job-id <job_id>

Scripts

ScriptНазначение
doctor.pyПроверка окружения: uv, Python, crawl4ai, playwright, config
init_job.pyСоздание job: job_id, launch_params.json, resolved_config.json
seed_urls.pyDiscovery URL из sitemap/robots/файла → seed.json (работает без crawl4ai)
crawl_batch.pyBatch crawl через crawl4ai → pages.ndjson, links.ndjson, summary.json
compare_pages.pyТабличное сравнение crawled pages по on-page сигналам
build_navigation_report.pyСводный навигационный аудит: orphans, weak hubs, breadcrumbs, menu drift
common.pyShared helpers (не запускать напрямую)

Extracted SEO Signals

На каждую страницу (pages.ndjson) извлекаются:

On-page: title, description, keywords, canonical, robots, og:title, og:description, og:image, H1, headings hierarchy, word count.

Navigation: path depth, breadcrumbs (texts + URLs), nav blocks count, nav links count, nav URLs sample.

Links: internal/external links count. В links.ndjson — полный граф: source → target, anchor text, nofollow, same_domain.

Navigation Audit Findings

build_navigation_report.py автоматически находит:

ПроблемаЧто значит для SEO
Orphan pages (0 входящих ссылок)Поисковик не найдёт страницу или не передаст ей вес
Weakly linked (1 входящая)Страница получает минимум link equity
Missing breadcrumbsНет навигационной цепочки для бота и пользователя
Breadcrumb inconsistencyРазные trail signatures в одной секции — путаница в иерархии
Weak nav templateHub-страница с подозрительно малым числом nav-ссылок
Menu inconsistencyСтраницы теряют часть common nav targets (шаблон "дрейфует")
Weak hubsКатегория/раздел отдаёт <5 внутренних ссылок
Duplicate titlesНесколько страниц с одинаковым title — каннибализация
Canonical mismatchescanonical указывает не на себя
Technical junklogin-URL, php endpoints, asset-ссылки в навигационном слое
Linked-not-seededСайт линкует URL, которых нет в sitemap

Связка с другими скиллами

СценарийСкилл-партнёрПорядок
SERP → on-page audityandex-search-apiПолучи shortlist из SERP → прогони через crawl4ai
Organic landings → audityandex-metrikaВозьми top organic pages → проверь on-page quality
Индексация + audityandex-webmasterСравни indexed pages с crawled inventory
Anti-block fallbackscrapedo-web-scraperПри блокировке crawl4ai — fallback через Scrape.do

Cache Layout

cache/jobs/<job_id>/
  launch_params.json      # raw params этого запуска
  resolved_config.json    # effective config после merge defaults + params
  manifest.json           # operational state и artifact paths
  seed.json               # seed URLs и метаданные discovery
  pages.ndjson            # одна запись на страницу
  links.ndjson            # одна запись на link edge
  summary.json            # компактная сводка
  markdown/               # сохранённый markdown контент

Каждый job изолирован. Параллельные запуски по разным сайтам безопасны.

Output Hygiene

  • stdout: только preview и пути к файлам.
  • Полные данные: только в job files.
  • Для анализа используй rg, head, wc -l по ndjson-файлам, не поднимай browser повторно.

References

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

34.92%
按下载量换算25

Claude

32.07%
按下载量换算23

Cursor

18.15%
按下载量换算13

Gemini CLI

10.11%
按下载量换算7

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

可疑

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills