Token导航 LogoToken导航TokenDH.com
研究检索需要联网clawhub未标认证来源可访问clear审计通过

midasheng-audio-text-distance米达声音频文字距离

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

4,822

周安装

205

GitHub Stars

公开资料未说明

下载量

1,689
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:midasheng-audio-text-distance(米达声音频文字距离)
来源仓库:https://github.com/jimbozhang/midasheng-audio-text-distance
安装命令:
openclaw skills install midasheng-audio-text-distance
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install midasheng-audio-text-distance

简介

米达声音频文字距离基于 GLAP 模型实现多语言音频与文本的相似度匹配。

  • 适用于语音检索、内容去重与跨模态对齐场景。midasheng-audio-text-distance 属于研究检索类 Skill,可作为该场景下的辅助能力补充。
  • 支持中英文混合查询,返回匹配音频片段与置信度评分。
  • 依赖预训练模型精度,长音频分段处理可能影响整体效果。
  • 安装于 OpenClaw,调用时需提供音频与文本查询对。

SKILL.md

name
midasheng-audio-text-distance
description
|
requirements

midasheng-audio-text-distance

Contrastive Language-Audio Pretraining (GLAP) based service for multilingual audio-text retrieval and classification.

1. Trigger

Use this skill when the user wants to:

  • Match audio files against text descriptions
  • Classify audio content using natural language queries
  • Perform zero-shot audio event detection
  • Search audio by text in any language (supports 50+ languages)

2. API Details

Endpoint: POST https://llmplus.ai.xiaomi.com/dasheng/audio/search (multipart form-data)

Parameters:

  • files: One or more audio files — can specify multiple times
  • text: Comma-separated text descriptions/labels to match against

3. Usage

Basic: Match audio against text labels

curl -X POST "https://llmplus.ai.xiaomi.com/dasheng/audio/search" \
  -F "files=@audio1.mp3" \
  -F "text=Noise,Speech,A person is speaking"

Script usage

python3 scripts/audiosearch.py audio1.mp3 --text "Speech,Music,Noise"
python3 scripts/audiosearch.py --queue   # Check queue status

4. Queue Status(排队情况)

查询命令

python3 scripts/audiosearch.py --queue
# 或直接调 API:
curl -X POST "https://llmplus.ai.xiaomi.com/metrics?path=/dasheng/audio/search"

返回字段

  • active: 当前活跃请求数
  • avg_latency_ms: 平均处理耗时(毫秒)
  • 预估等待时长 = active × avg_latency_ms

何时调用

  1. IM 即将超时但 search 服务还未返回结果时:查排队情况告知用户,请用户稍后来问。
  2. 用户稍后询问任务进度但服务仍未返回时:查最新排队情况返回给用户。

状态分级

  • 🟢 active=0 或预估等待 <5s → 服务空闲
  • 🟡 预估等待 5-30s → 轻微排队
  • 🔴 预估等待 >30s → 排队较长,建议稍后重试

5. Supported Audio Formats

Common formats: mp3, wav, flac, ogg, m4a.

6. Troubleshooting

  • Low scores across all labels: Try broader descriptions
  • API request failed: Verify network connectivity
  • Unsupported format: Convert to mp3 or wav first

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

75.5%
按下载量换算1,275

安全审计

VirusTotal

通过

ClawScan

通过

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills