Token导航 LogoToken导航TokenDH.com
AI 工具需要联网github未标认证来源可访问clear审计提醒

llm-architectLLM 架构师

Agent Skill

llm-architect 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

2,885

周安装

119

GitHub Stars

76

下载量

942
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:llm-architect(LLM 架构师)
来源仓库:https://github.com/404kidwiz/claude-supercode-skills
仓库路径:skills/llm-architect
安装命令:
npx skills add https://github.com/404kidwiz/claude-supercode-skills --skill llm-architect
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/404kidwiz/claude-supercode-skills --skill llm-architect

简介

llm-architect 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。

  • 它可辅助梳理项目结构、依赖关系和协作流程,帮助 Agent 快速定位关键信息。
  • 通过 npx skills add 命令从指定仓库安装,具体用法请参考原始 README。
  • 安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

LLM Architect

Purpose

Provides expert large language model system architecture for designing, deploying, and optimizing LLM applications at scale. Specializes in model selection, RAG (Retrieval Augmented Generation) pipelines, fine-tuning strategies, serving infrastructure, cost optimization, and safety guardrails for production LLM systems.

When to Use

  • Designing end-to-end LLM systems from requirements to production
  • Selecting models and serving infrastructure for specific use cases
  • Implementing RAG (Retrieval Augmented Generation) pipelines
  • Optimizing LLM costs while maintaining quality thresholds
  • Building safety guardrails and compliance mechanisms
  • Planning fine-tuning vs RAG vs prompt engineering strategies
  • Scaling LLM inference for high-throughput applications

Quick Start

Invoke this skill when:

  • Designing end-to-end LLM systems from requirements to production
  • Selecting models and serving infrastructure for specific use cases
  • Implementing RAG (Retrieval Augmented Generation) pipelines
  • Optimizing LLM costs while maintaining quality thresholds
  • Building safety guardrails and compliance mechanisms

Do NOT invoke when:

  • Simple API integration exists (use backend-developer instead)
  • Only prompt engineering needed without architecture decisions
  • Training foundation models from scratch (almost always wrong approach)
  • Generic ML tasks unrelated to language models (use ml-engineer)

Decision Framework

Model Selection Quick Guide

RequirementRecommended Approach
Latency <100msSmall fine-tuned model (7B quantized)
Latency <2s, budget unlimitedClaude 3 Opus / GPT-4
Latency <2s, domain-specificClaude 3 Sonnet fine-tuned
Latency <2s, cost-sensitiveClaude 3 Haiku
Batch/async acceptableBatch API, cheapest tier

RAG vs Fine-Tuning Decision Tree

Need to customize LLM behavior?
│
├─ Need domain-specific knowledge?
│  ├─ Knowledge changes frequently?
│  │  └─ RAG (Retrieval Augmented Generation)
│  └─ Knowledge is static?
│     └─ Fine-tuning OR RAG (test both)
│
├─ Need specific output format/style?
│  ├─ Can describe in prompt?
│  │  └─ Prompt engineering (try first)
│  └─ Format too complex for prompt?
│     └─ Fine-tuning
│
└─ Need latency <100ms?
   └─ Fine-tuned small model (7B-13B)

Architecture Pattern

[Client] → [API Gateway + Rate Limiting]
              ↓
         [Request Router]
          (Route by intent/complexity)
              ↓
    ┌────────┴────────┐
    ↓                 ↓
[Fast Model]    [Powerful Model]
(Haiku/Small)   (Sonnet/Large)
    ↓                 ↓
[Cache Layer] ← [Response Aggregator]
    ↓
[Logging & Monitoring]
    ↓
[Response to Client]

Core Workflow: Design LLM System

1. Requirements Gathering

Ask these questions:

  • Latency: What's the P95 response time requirement?
  • Scale: Expected requests/day and growth trajectory?
  • Accuracy: What's the minimum acceptable quality? (measurable metric)
  • Cost: Budget constraints? ($/request or $/month)
  • Data: Existing datasets for evaluation? Sensitivity level?
  • Compliance: Regulatory requirements? (HIPAA, GDPR, SOC2, etc.)

2. Model Selection

def select_model(requirements):
    if requirements.latency_p95 < 100:  # milliseconds
        if requirements.task_complexity == "simple":
            return "llama2-7b-finetune"
        else:
            return "mistral-7b-quantized"

    elif requirements.latency_p95 < 2000:
        if requirements.budget == "unlimited":
            return "claude-3-opus"
        elif requirements.domain_specific:
            return "claude-3-sonnet-finetuned"
        else:
            return "claude-3-haiku"

    else:  # Batch/async acceptable
        if requirements.accuracy_critical:
            return "gpt-4-with-ensemble"
        else:
            return "batch-api-cheapest-tier"

3. Prototype & Evaluate

# Run benchmark on eval dataset
python scripts/evaluate_model.py \
  --model claude-3-sonnet \
  --dataset data/eval_1000_examples.jsonl \
  --metrics accuracy,latency,cost

# Expected output:
# Accuracy: 94.3%
# P95 Latency: 1,245ms
# Cost per 1K requests: $2.15

4. Iteration Checklist

  • Latency P95 meets requirement? If no → optimize serving (quantization, caching)
  • Accuracy meets threshold? If no → improve prompts, fine-tune, or upgrade model
  • Cost within budget? If no → aggressive caching, smaller model routing, batching
  • Safety guardrails tested? If no → add content filters, PII detection
  • Monitoring dashboards live? If no → set up Prometheus + Grafana
  • Runbook documented? If no → document common failures and fixes

Cost Optimization Strategies

StrategySavingsWhen to Use
Semantic caching40-80%60%+ similar queries
Multi-model routing30-50%Mixed complexity queries
Prompt compression10-20%Long context inputs
Batching20-40%Async-tolerant workloads
Smaller model cascade40-60%Simple queries first

Safety Checklist

  • Content filtering tested against adversarial examples
  • PII detection and redaction validated
  • Prompt injection defenses in place
  • Output validation rules implemented
  • Audit logging configured for all requests
  • Compliance requirements documented and validated

Red Flags - When to Escalate

ObservationAction
Accuracy <80% after prompt iterationConsider fine-tuning
Latency 2x requirementReview infrastructure
Cost >2x budgetAggressive caching/routing
Hallucination rate >5%Add RAG or stronger guardrails
Safety bypass detectedImmediate security review

Quick Reference: Performance Targets

MetricTargetCritical
P95 Latency<2x requirement<3x requirement
Accuracy>90%>80%
Cache Hit Rate>60%>40%
Error Rate<1%<5%
Cost/1K requestsWithin budget<150% budget

Additional Resources

- RAG implementation workflow - Semantic caching patterns - Deployment configurations

- Anti-patterns (fine-tuning when prompting suffices, no fallback) - Quality checklist for LLM systems - Resilient LLM call patterns

适合场景

01

研究助手

02

事实核查

03

知识库问答

04

带来源的搜索总结

能力概览

能力 1

组合搜索和大模型调用

能力 2

支持多来源检索和总结

能力 3

强调引用来源和事实核查

能力 4

适合研究型 Agent 流程

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Claude Code

28.92%
按下载量换算272

OpenCode

23.19%
按下载量换算218

Codex

19.52%
按下载量换算184

Gemini CLI

14.18%
按下载量换算134

Antigravity

9.27%
按下载量换算87

Cursor

3.87%
按下载量换算36

安全审计

Gen Agent Trust Hub

可疑

Socket

通过

Snyk

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。

来源信息

继续浏览同类 Skills