Token导航 LogoToken导航TokenDH.com
研究检索需要联网github未标认证来源可访问许可证需确认审计异常

ais-bench艾斯长凳

Agent Skill

ais-bench 用于查找、检索和筛选相关信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要根据关键词、任务场景或来源线索快速定位候选结果时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

984

周安装

41

GitHub Stars

60

下载量

328
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:ais-bench(艾斯长凳)
来源仓库:https://github.com/ascend-ai-coding/awesome-ascend-skills
仓库路径:skills/ais-bench
安装命令:
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill ais-bench
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/ascend-ai-coding/awesome-ascend-skills --skill ais-bench

简介

ais-bench 是基于 OpenCompass 构建的模型评测工具,专用于 Ascend NPU 上的 AI 模型性能评估。

  • 支持准确性和性能测试,覆盖问答、推理及多模态场景下的基准数据集验证。
  • 可用于本地或服务部署模型的延迟、吞吐量及压力测试,辅助优化模型表现。
  • 需配置评测环境和数据集路径,可能涉及计算密集型任务,注意资源消耗。
  • ais-bench 属于研究检索类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

AISBench Benchmark Tool

AISBench Benchmark is a model evaluation tool built based on OpenCompass. It supports evaluation scenarios for both accuracy and performance testing of AI models on Ascend NPU.

Overview

  • Accuracy Evaluation: Accuracy verification of service-deployed models and local models on various QA and reasoning benchmark datasets, covering text, multimodal, and other scenarios.
  • Performance Evaluation: Latency and throughput evaluation of service-deployed models, extreme performance testing under stress test scenarios, steady-state performance evaluation, and real business traffic simulation.

Supported Scenarios

ScenarioDescription
Accuracy EvaluationModel accuracy on text/multimodal datasets
Performance EvaluationLatency, throughput, stress testing
Steady-State PerformanceObtain true optimal system performance
Real Traffic SimulationSimulate real business traffic patterns
Multi-turn DialogueEvaluate multi-turn conversation models
Function Call (BFCL)Function calling capability evaluation

Supported Benchmarks

  • Text: GSM8K, MMLU, Ceval, FewCLUE series, dapo_math, leval
  • Multimodal: docvqa, infovqa, ocrbench_v2, omnidocbench, mmmu, mmmu_pro, mmstar, videomme, textvqa, videobench, vocalsound
  • Multi-turn Dialogue: sharegpt, mtbench
  • Function Call: BFCL (Berkeley Function Calling Leaderboard)

Installation

Environment Requirements

Python Version: Only Python 3.10, 3.11, or 3.12 is supported.

# Create conda environment
conda create --name ais_bench python=3.10 -y
conda activate ais_bench

Install from Source

git clone https://github.com/AISBench/benchmark.git
cd benchmark/
pip3 install -e ./ --use-pep517

Verify installation:

ais_bench -h

Optional Dependencies

# For service-deployed model evaluation (vLLM, Triton, etc.)
pip3 install -r requirements/api.txt
pip3 install -r requirements/extra.txt

# For Huggingface multimodal / vLLM offline inference
pip3 install -r requirements/hf_vl_dependency.txt

# For BFCL Function Calling evaluation
pip3 install -r requirements/datasets/bfcl_dependencies.txt --no-deps

Quick Start

Basic Command Structure

ais_bench --models <model_task> --datasets <dataset_task> [--summarizer example]
  • --models: Specifies the model task configuration
  • --datasets: Specifies the dataset task configuration
  • --summarizer: Result presentation task (default: example)

Find Configuration Files

# List all available task configurations
ais_bench --models vllm_api_general_chat --datasets demo_gsm8k_gen_4_shot_cot_chat_prompt --search

Example: Service Model Accuracy Evaluation

  1. Start vLLM inference service (follow vLLM documentation)
  2. Prepare dataset:

- Download GSM8K from opencompass - Extract to ais_bench/datasets/gsm8k/

  1. Modify model configuration (vllm_api_general_chat.py): from ais_bench.benchmark.models import VLLMCustomAPIChat models = [dict(attr="service", type=VLLMCustomAPIChat, abbr='vllm-api-general-chat', path="", model="", stream=False, request_rate=0, retry=2, api_key="", host_ip="localhost", host_port=8080, url="", max_out_len=512, batch_size=1, trust_remote_code=False, generation_kwargs=dict(temperature=0.01, ignore_eos=False,))]
  2. Run evaluation: ais_bench --models vllm_api_general_chat --datasets demo_gsm8k_gen_4_shot_cot_chat_prompt

Output Results

dataset                 version  metric   mode  vllm_api_general_chat
----------------------- -------- -------- ----- ----------------------
demo_gsm8k              401e4c   accuracy gen                   62.50

Model Task Types

Service-Deployed Models

Model TypeDescription
vllm_api_general_chatGeneral vLLM API chat model
vllm_api_function_call_chatFunction calling model (BFCL)
triton_api_*Triton inference service

Local Models

Model TypeDescription
hf_*HuggingFace models
vllm_offline_*vLLM offline inference

Performance Evaluation

Key Metrics

MetricDescription
TTFTTime to First Token
TPOTTime Per Output Token
ThroughputTokens per second
LatencyRequest latency (P50, P90, P99)

Performance Test Example

ais_bench --models vllm_api_general_chat --datasets custom_performance \
    --mode performance --concurrency 100

Steady-State Performance

For obtaining true optimal system performance:

ais_bench --models vllm_api_general_chat --datasets sharegpt \
    --stable-stage --duration 300

Real Traffic Simulation

ais_bench --models vllm_api_general_chat --datasets custom \
    --rps-distribution rps_config.json

Multi-task Evaluation

Multiple Models

ais_bench --models model1 model2 model3 --datasets dataset1

Multiple Datasets

ais_bench --models model1 --datasets dataset1 dataset2 dataset3

Parallel Execution

ais_bench --models model1 model2 --datasets dataset1 dataset2 --parallel 4

Custom Datasets

Performance Custom Dataset

Create a JSONL file with custom requests:

{"input": "Your prompt here", "max_output_length": 512}

Accuracy Custom Dataset

Refer to Custom Dataset Guide


Output Structure

outputs/default/20250628_151326/
├── configs/           # Combined configuration
├── logs/              # Execution logs
│   ├── eval/          # Evaluation logs
│   └── infer/         # Inference logs
├── predictions/       # Raw inference results
├── results/           # Calculated scores
└── summary/           # Final summaries
    ├── summary_*.csv
    ├── summary_*.md
    └── summary_*.txt

Task Management Interface

During execution, a real-time task management interface displays:

  • Task name and progress
  • Time cost and status
  • Log path
  • Extended parameters

Controls:

  • P key: Pause/Resume screen refresh
  • Ctrl+C: Exit

Common CLI Options

OptionDescription
--modelsModel task name(s)
--datasetsDataset task name(s)
--summarizerResult summarizer
--searchList config file paths
--debugPrint detailed logs
--modeEvaluation mode (accuracy/performance)
--parallelNumber of parallel tasks
--resumeResume from breakpoint
--failed-onlyRe-run failed cases only

Advanced Features

Breakpoint Resume

ais_bench --models model1 --datasets dataset1 --resume outputs/default/20250628_151326

Failed Case Re-run

ais_bench --models model1 --datasets dataset1 --failed-only --resume outputs/default/20250628_151326

Multi-file Dataset Merge

For datasets like MMLU with multiple files:

ais_bench --models model1 --datasets mmlu_merged

Repeated Inference for pass@k

ais_bench --models model1 --datasets dataset1 --repeat-n 5

Troubleshooting

Installation Issues

  1. Python version mismatch: Use Python 3.10/3.11/3.12
  2. Dependency conflicts: Use conda environment
  3. bfcl_eval pathlib issue: Use --no-deps flag

Runtime Issues

  1. Model connection failed: Check host_ip, host_port, and service status
  2. Dataset not found: Download dataset to ais_bench/datasets/
  3. Memory issues: Reduce batch_size or use smaller dataset

Helper Scripts

Quick utility scripts for common operations:

ScriptDescription
scripts/check_env.shVerify environment setup
scripts/run_accuracy_test.shQuick accuracy test runner
scripts/run_performance_test.shQuick performance test runner
scripts/parse_results.pyParse and summarize results
# Check environment
bash scripts/check_env.sh

# Quick accuracy test
bash scripts/run_accuracy_test.sh vllm_api_general_chat demo_gsm8k --host-port 8080

# Quick performance test
bash scripts/run_performance_test.sh vllm_api_general_chat sharegpt --concurrency 100

# Parse results
python scripts/parse_results.py outputs/default/20250628_151326

References

Detailed documentation for specific use cases:


Templates

Ready-to-use templates for custom evaluation:

TemplateDescription
assets/model_config_template.pyModel configuration template
assets/custom_qa_template.jsonlQA dataset template
assets/custom_mcq_template.csvMultiple choice dataset template
assets/custom_meta_template.jsonDataset metadata template

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

34.65%
按下载量换算114

Claude

29.64%
按下载量换算97

Cursor

20.75%
按下载量换算68

Gemini CLI

9.84%
按下载量换算32

安全审计

Gen Agent Trust Hub

可疑

Socket

未通过

Snyk

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills