Token导航 LogoToken导航TokenDH.com
研究检索权限需确认clawhub未标认证来源可访问clear审计提醒

doc-search-cloud文档搜索云

Agent Skill

用于辅助文档、README、Markdown、说明文和内容稿件的整理与改写。它适合让 Agent 提炼结构、补齐章节、统一术语、检查链接或把零散材料整理成可读文档。使用时应保留项目已有事实、命令和路径,不要把未确认的信息写成确定结论;涉及对外文案时,还需要控制语气,避免过度营销或夸大能力。

总安装

2,521

周安装

101

GitHub Stars

公开资料未说明

下载量

816
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:doc-search-cloud(文档搜索云)
来源仓库:https://github.com/cloudcba/doc-search-cloud
安装命令:
openclaw skills install doc-search-cloud
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install doc-search-cloud

简介

向量化存储与检索多种格式文档内容。doc-search-cloud 属于研究检索类 Skill,可作为该场景下的辅助能力补充。

  • 支持 Word、PDF 与 TXT 的混合语义搜索。
  • v3.0 新增缓存机制提升响应速度 70 倍。
  • 通过 clawhub 安装,需部署向量数据库后端。
  • 建议启用混合检索模式平衡精度与召回率。

SKILL.md

name
doc-search
description
处理文档向量化、存储和语义检索。支持 Word、Markdown、PDF、TXT 等格式。v3.0 新增查询缓存(速度提升 70x)、混合检索(BM25+ 向量)。Invoke when user needs to vectorize documents, search for similar content, or perform semantic queries on document collections.
version
v3.0.0

文档向量检索技能

功能概述

提供完整的文档向量化和语义检索功能,能够:

  • 读取多种文档格式(Word、Markdown、PDF、TXT)
  • 将文档分割成文本块并生成向量嵌入
  • 基于语义相似度进行智能检索
  • 支持批量文档处理和查询

使用场景

Invoke when:

  • 用户需要将文档转换为向量进行存储和检索
  • 用户要求搜索文档中与查询语句相似的内容
  • 用户需要处理 Word、Markdown、PDF 等格式的文档
  • 用户需要进行语义搜索而非关键词匹配
  • 用户需要管理文档向量库(添加、查询、统计)

主要方法

1. vectorize_file(file_path, metadata)

将文件向量化并添加到向量库

参数:

  • file_path: 文件路径(支持 .docx, .md, .pdf, .txt)
  • metadata: 可选的元数据字典

返回:

{
    "status": "success/error",
    "message": "操作消息",
    "chunks_added": 切片数量,
    "source": "源文件路径"
}

2. search_vectors(query_text, top_k)

根据查询文本检索最相似的文档片段

参数:

  • query_text: 查询文本
  • top_k: 返回的相似结果数量(默认 5)

返回:

[
    {
        "content": "文档内容",
        "similarity": 相似度 (0-1),
        "metadata": "元数据"
    },
    ...
]

3. get_collection_stats()

获取向量库统计信息

返回:

{
    "total_documents": 总文档数,
    "collection_name": 集合名称
}

4. clear_collection()

清空向量库所有数据

使用示例

基本文档向量化

from chromadb_document_vectorizer_simple import DocumentVectorizer

vector_service = DocumentVectorizer()

# 向量化文档
result = vector_service.vectorize_file("path/to/document.docx")
print(f"成功添加 {result['chunks_added']} 个文本切片")

语义搜索

# 查询相似内容
results = vector_service.search_vectors("智能家居监测系统功能", top_k=3)

for idx, item in enumerate(results, 1):
    print(f"[{idx}] 相似度:{item['similarity'] * 100:.2f}%")
    print(f"内容:{item['content'][:100]}...")

批量处理多个文档

files = [
    "doc1.docx",
    "doc2.md", 
    "doc3.pdf"
]

for file in files:
    result = vector_service.vectorize_file(file)
    if result["status"] == "success":
        print(f"✅ {file}: {result['chunks_added']} 个切片")

获取统计信息

stats = vector_service.get_collection_stats()
print(f"总文档数:{stats['total_documents']}")

技术细节

文本分割

  • 按中文句号(。)分割句子
  • 每个切片默认 200 字符(可配置)
  • 自动处理句子边界,保持语义完整性

向量生成(双模式)

模式 1: MD5 哈希模拟(默认)

  • 使用 MD5 哈希生成 384 维向量
  • 每个字符的 ASCII 值归一化到 0-1
  • 保证相同文本生成相同向量
  • 无需额外依赖

模式 2: Sentence Transformers(推荐)

  • 使用 paraphrase-multilingual-MiniLM-L12-v2 模型
  • 真实的语义向量表示
  • 支持多语言(中文、英文等)
  • 需要安装 sentence-transformers

持久化存储

数据存储

  • 向量数据:chroma_data/documents_data.pkl
  • 文件索引:chroma_data/documents_index.json
  • 自动保存:每次添加/删除文件后自动保存
  • 自动加载:初始化时自动恢复数据

相似度计算

  • 使用余弦相似度(Cosine Similarity)
  • 值域:0-1(1 表示完全相同)
  • 支持最小相似度阈值过滤

文件格式支持

格式扩展名依赖
Word.docxpython-docx
Markdown.mdmarkdown, beautifulsoup4
PDF.pdfPyPDF2
纯文本.txt内置

v3.0 重大改进(最新)

✅ 性能大幅提升

优化项v2.0v3.0提升
查询速度100ms1ms70x 提升
检索精度仅向量BM25+ 向量更精准 🎯
缓存命中率0%80-90%大幅优化 💾

🚀 新增功能

1. 查询缓存(LRU)

  • 自动缓存热门查询
  • 重复查询速度提升 70 倍
  • 可配置缓存大小(默认 1000 条)

2. 混合检索(BM25+ 向量)

  • 关键词匹配 + 语义相似度
  • 可调节权重(alpha 参数)
  • 检索结果更精准

v2.0 重大改进

✅ 已解决的局限性

问题 (v1.0)影响解决方案 (v2.0)
🔴 内存存储重启后数据全部丢失持久化存储 - 数据自动保存到磁盘,重启不丢失
🔴 哈希模拟向量准确度有限真实 Embedding - 支持 Sentence Transformers 模型
🟡 无持久化每次重启要重新向量化自动加载 - 启动时自动恢复向量库
🟡 非记忆管理不是对话记忆系统文档检索 - 明确定位为文档检索工具

使用真实 Embedding

# 安装依赖
pip install sentence-transformers

# 使用真实 Embedding 模型
vectorizer = DocumentVectorizer(
    persist_directory="./chroma_data",
    use_real_embedding=True  # 启用真实 Embedding
)

优势

  • 🎯 语义理解更准确
  • 🔍 检索质量更高
  • 🌍 支持多语言(中文、英文等)

注意:需要额外安装 sentence-transformers

性能建议

  • 大文件建议分批处理
  • 查询前确保已向量化相关文档
  • 对于大量文档,考虑增加 chunk_size 减少切片数量
  • 相似度阈值可根据需求调整(默认返回 top_k 个)

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

91.92%
按下载量换算750

安全审计

VirusTotal

可疑

ClawScan

可疑

Static analysis

通过

权限和风险

权限需确认

当前来源未能明确判断权限范围,默认进入异常复核队列。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills