Token导航 LogoToken导航TokenDH.com
Local AI Coding Setup logo
开发工具未说明官方级别未说明来源级核验

Local AI Coding Setup

MCP Server

一个本地和云端GPU驱动的AI代码环境构建工具,支持Qwen3.6和Gemma 4等模型,适用于开发者和企业RAG应用。

工具数

0

提示词数

0

GitHub Stars

17

资源数

0
代码生成ShellClaudeClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

jamesarslan

提供方

jamesarslan

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

本地AI编码流水线——RTX 5090+云GPU+Qwen3.6+TurboQuant

构建在硬件上运行的完全本地AI驱动的编码环境的完整指南,以及用于重型模型和企业RAG的可选云GPU服务器。

这是什么

跨两台机器的生产就绪AI编码设置:

本地(RTX 5090,32GB)-- 更新于2026年4月

  • Qwen3.6-35B-A3B (主要)-教育部(3B名活跃人员,8名路由专家+1名共享专家,共256名)。混合 门控DeltaNet+门控注意力 架构(30个线性+10个全关注层)。原生262K上下文,可扩展到1M。 ~177吨/秒 TurboQuant涡轮增压器3。原生工具调用+开发者角色支持(Codex/OpenCode)。
  • Qwen3.5-35B-A3B (遗留)——MoE(3B有源),188吨/秒发电。
  • 杰玛4 31B --致密(31B活性),61吨/秒发电。单次射击任务的最佳质量/推理。

云(RTX PRO 6000,96GB)

  • Qwen3.5-122B-A10B --MoE(10B活性),无布UD-Q4_K_XL(72GB)+ TurboQuant涡轮增压器3 KV压缩。比35B变体更好的基准测试、工具使用和推理。Unloth的最新GGUF包括用于工具调用/编码的固定聊天模板。
  • 万物皆可LLM --具有工作空间、RBAC和代理技能的RAG知识库
  • Mistral OCR MCP -通过Mistral API提取PDF文本,作为AnythingLLM代理的MCP工具
  • 摘录API --PDF→ OCR → LLM提取→ 干净的结构化JSON管道

工具:

  • 开源代码 --使用文件编辑、bash、grep和MCP工具进行代理编码
  • 克劳德代码 -Anthropic的CLI(通过Ollama API与本地模型配合使用)
  • 开爪 --Telegram机器人桥到您的本地模型
  • 打开WebUI --浏览器中的聊天界面
  • 万物皆可LLM --企业RAG平台(云服务器)

______________________________________________________________________

快速开始

# One-command setup (WSL Kali, WSL Ubuntu, or native Linux)
bash scripts/setup.sh

这将安装CUDA,构建llama.cpp(主线+TurboQuant),安装OpenCode,并生成配置文件。看 scripts/setup.sh 了解详情。

手动快速启动:

# Start the server (pick your model)
./scripts/start-server.sh qwen  YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf
./scripts/start-server.sh gemma YOUR_MODEL_PATH/gemma-4-31b-it-UD-Q4_K_XL.gguf
./scripts/start-server.sh turbo YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf

# Start coding
cd your-project && opencode

______________________________________________________________________

硬件和型号

组件详细信息
GPUNVIDIA RTX 5090(32GB GDDR7,Blackwell)
操作系统Windows 11+WSL2 Kali Linux
运行时llama.cpp(使用CUDA在WSL上本机编译)

模型比较

Qwen3.5-35B-A3B杰玛4 31B
建筑教育部(256名专家,8名活跃)密集(所有参数均活跃)
活动参数~3B 每个令牌31B 每个令牌
量化不穿衣服的UD-Q4_K_XL(20.7 GB)不穿衣服UD-Q4\_ K_XL(~18.4 GB)
生成188吨/秒61吨/秒
快速处理4291吨/秒1954吨/秒
KV缓存(131K)2.5 GB11.4 GB
总VRAM(131K)~24 GB~29.8 GB
培训背景262K131K
涡轮量子是(涡轮3)未测试
最佳快速代理编码、迭代质量关键任务、推理
第一枪质量很好(可能需要修复)很好(小行星:零错误)

______________________________________________________________________

性能基准

速度比较(RTX 5090)

┌─────────────────────────────────────────────────────┐
│   Prompt Processing (tokens/s)                      │
│                                                     │
│   Qwen3.5 TurboQuant ██████████████   5,623         │
│   Qwen3.5 Mainline   ███████████     4,291          │
│   Gemma 4 Mainline   ████████        1,954          │
│                                                     │
│   Token Generation (tokens/s)                       │
│                                                     │
│   Qwen3.5 Mainline   ██████████████████████  188    │
│   Qwen3.5 TurboQuant ██████████████          131    │
│   Gemma 4 Mainline   ███████                  61    │
└─────────────────────────────────────────────────────┘

VRAM使用情况(131K上下文)

┌──────────────────────────────────────────────────────────┐
│                    VRAM Breakdown (GB)                     │
│                                                          │
│   Qwen3.5 (f16 KV):                                     │
│   ├─ Model      ████████████████████░░░░░░  20.7 GB     │
│   ├─ KV Cache   ██░░░░░░░░░░░░░░░░░░░░░░░   2.5 GB     │
│   ├─ Compute    █░░░░░░░░░░░░░░░░░░░░░░░░░   0.8 GB     │
│   └─ Free       ██████░░░░░░░░░░░░░░░░░░░░   6.0 GB     │
│                                                          │
│   Qwen3.5 (turbo3 KV):                                  │
│   ├─ Model      ████████████████████░░░░░░  20.7 GB     │
│   ├─ KV Cache   █░░░░░░░░░░░░░░░░░░░░░░░░░  0.7 GB     │
│   ├─ Compute    █░░░░░░░░░░░░░░░░░░░░░░░░░   0.8 GB     │
│   └─ Free       ████████░░░░░░░░░░░░░░░░░░   8.4 GB     │
│                                                          │
│   Gemma 4 (f16 KV):                                     │
│   ├─ Model      ██████████████████░░░░░░░░  18.4 GB     │
│   ├─ KV Cache   ██████████░░░░░░░░░░░░░░░░  11.4 GB     │
│   ├─ Compute    █░░░░░░░░░░░░░░░░░░░░░░░░░   0.8 GB     │
│   └─ Free       ██░░░░░░░░░░░░░░░░░░░░░░░░   2.8 GB     │
│                                                          │
│   KV Cache Comparison:                                   │
│   Qwen3.5 f16:    2.5 GB  (MoE — only 1/4 layers)      │
│   Qwen3.5 turbo3: 0.7 GB  (3.5x compression)           │
│   Gemma 4 f16:   11.4 GB  (dense — all layers)          │
└──────────────────────────────────────────────────────────┘

TurboQuant与标准KV缓存质量

基于 TurboQuant CUDA叉子 Qwen3.5-27B的基准测试:

┌────────────────────────────────────────────────────┐
│         Perplexity (Lower = Better)                │
│                                                    │
│   q8_0 baseline  ████████████████████  5.8375      │
│   turbo3 uniform █████████████████████ 5.8323 ~    │
│   turbo3 LA-1    ████████████████████  5.7690 ++   │
│                                                    │
│   ~  = matches baseline                            │
│   ++ = BEATS baseline (-1.17%)                     │
│                                                    │
│   FWHT rotation: essential (+6.8% PPL without)     │
│   Norm correction: critical (+12% PPL without)     │
└────────────────────────────────────────────────────┘

______________________________________________________________________

建筑

┌─────────────────────────────────────────────────────────────────┐
│                        WINDOWS 11                                │
│  ┌─────────────────┐  ┌──────────────┐  ┌────────────────────┐  │
│  │  Desktop        │  │  Open WebUI  │  │  Brave Browser     │  │
│  │  Shortcuts      │  │  :5762       │  │  (Dashboard/Chat)  │  │
│  │  Start/Stop/    │  │  Docker      │  │                    │  │
│  │  Update         │  └──────┬───────┘  └────────────────────┘  │
│  └────────┬────────┘         │                                   │
│           │            host.docker.internal:10500                 │
│           ▼                  │                                   │
│  ┌───────────────────────────┴──────────────────────────────┐   │
│  │                    WSL2 KALI LINUX                        │   │
│  │                                                           │   │
│  │  ┌─────────────────────────────────────────────────────┐  │   │
│  │  │  llama-server (port 10500, 0.0.0.0)                 │  │   │
│  │  │  ├─ Model A: Qwen3.5-35B-A3B (MoE, 188 t/s)       │  │   │
│  │  │  ├─ Model B: Gemma 4 31B (Dense, 61 t/s)           │  │   │
│  │  │  ├─ Mode 1: f16 KV cache (mainline build)          │  │   │
│  │  │  └─ Mode 2: turbo3 KV cache (TurboQuant, Qwen only)│  │   │
│  │  └──────────────────────┬──────────────────────────────┘  │   │
│  │                         │ localhost:10500                  │   │
│  │  ┌──────────┐  ┌───────┴────┐  ┌───────────┐             │   │
│  │  │ OpenCode │  │ Claude Code│  │ OpenClaw   │             │   │
│  │  │ +Context7│  │ (claude-   │  │ (Telegram  │             │   │
│  │  │ +Chrome  │  │  qwen)     │  │  bot)      │             │   │
│  │  │  DevTools│  │            │  │            │             │   │
│  │  └──────────┘  └────────────┘  └───────────┘             │   │
│  │                                                           │   │
│  │  GPU: RTX 5090 (32GB) via CUDA passthrough                │   │
│  └───────────────────────────────────────────────────────────┘   │
└─────────────────────────────────────────────────────────────────┘

选型流程

What's your priority?
  │
  ├─ Best local coding (recommended) ──────> Qwen3.6-35B-A3B + TheTom TurboQuant turbo3
  │                                           (177 t/s, 262K ctx, native tool calls)
  │
  ├─ Legacy fast agentic coding ────────────> Qwen3.5-35B-A3B (188 t/s)
  │   └─ Save VRAM? ────────────────────────> Qwen3.5 + TurboQuant (131 t/s, 3.5x KV savings)
  │
  └─ Quality / Reasoning ───────────────────> Gemma 4 31B (61 t/s)
      └─ 24GB GPU? ─────────────────────────> Gemma 4 at 32-64K context

Qwen3.6设置(本地RTX 5090)

  1. 下载 unsloth/Qwen3.6-35B-A3B-GGUFQwen3.6-35B-A3B-UD-Q4_K_XL.gguf (21GB)
  2. 构建TheTom的TurboQuant分叉(Gated DeltaNet arch所需):
   git clone --depth 1 -b feature/turboquant-kv-cache \
     https://github.com/TheTom/llama-cpp-turboquant.git ~/llama-cpp-turboquant
   cd ~/llama-cpp-turboquant
   cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON \
     -DGGML_CUDA_FA_ALL_QUANTS=ON -DCMAKE_CUDA_ARCHITECTURES=120
   cmake --build build -j$(nproc)
  1. 发射(单槽,全262K上下文,涡轮3KV):
   TURBO_LAYER_ADAPTIVE=2 ~/llama-cpp-turboquant/build/bin/llama-server \
     -m /path/to/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf \
     -ngl 99 -fa on -c 262144 -np 1 -ctk turbo3 -ctv turbo3 \
     --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
     --host 0.0.0.0 --port 10500
  1. VRAM使用量:32GB的~25GB(包括262K turbo3-KV——由于混合拱,只有10层有完整的KV)

______________________________________________________________________

GPU兼容性

GPUVRAMQwen3.5最大上下文Gemma 4最大上下文备注
RTX 509032 GB131K(f16)/262K(涡轮增压3)131K全性能
RTX 409024 GB~96K(f16)/~192K(涡轮增压3)~32-64K减少Gemma 4的上下文
RTX 309024 GB~96K(f16)/~192K(涡轮增压3)~32-64K比4090稍慢
RTX 4080 Super16 GB~32K(f16)不推荐使用较小的量化
M4最大值64 GB262K131K+使用MLX获得最佳速度

对于16GB GPU,考虑使用较小的量子(Q3_K_M)或Qwen3.5-27B变体。

______________________________________________________________________

安装指南

先决条件

  • Windows 11与WSL2(或本机Linux)
  • 支持CUDA的NVIDIA GPU(在RTX 5090上测试)
  • WSL2与Kali Linux或Ubuntu

自动设置(推荐)

git clone https://github.com/jamesarslan/local-ai-coding-setup.git
cd local-ai-coding-setup
bash scripts/setup.sh

安装脚本处理一切:CUDA工具包、llama.cpp构建、Node.js、OpenCode和配置生成。

手动设置

1.安装CUDA工具包(WSL)

sudo apt install -y cmake g++ git

# Ubuntu WSL:
wget -qO - https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/3bf863cc.pub \
    | sudo gpg --dearmor -o /usr/share/keyrings/cuda-archive-keyring.gpg
echo "deb [signed-by=/usr/share/keyrings/cuda-archive-keyring.gpg] https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/ /" \
    | sudo tee /etc/apt/sources.list.d/cuda-wsl.list

# Kali WSL (GPG workaround — Kali lacks NVIDIA's GPG key):
echo "deb [trusted=yes] https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/ /" \
    | sudo tee /etc/apt/sources.list.d/cuda-wsl.list

sudo apt update && sudo apt install -y cuda-toolkit

2.构建llama.cpp

# Auto-detect your GPU architecture
CUDA_ARCH=$(nvidia-smi --query-gpu=compute_cap --format=csv,noheader | head -1 | tr -d '.')
echo "GPU architecture: sm_${CUDA_ARCH}"

# Build mainline
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git ~/llama-cpp-mainline
cd ~/llama-cpp-mainline
cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON \
    -DCMAKE_CUDA_ARCHITECTURES="$CUDA_ARCH"
cmake --build build -j$(nproc)

# Build TurboQuant fork (optional, for Qwen3.5 turbo3 mode)
# Madreag's fork: +13-69% faster at 32K vs base, SM86/89/120 optimized
git clone --depth 1 \
    https://github.com/Madreag/turbo3-cuda.git ~/llama-cpp-turboquant
cd ~/llama-cpp-turboquant
cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON \
    -DGGML_CUDA_FA_ALL_QUANTS=ON -DCMAKE_CUDA_ARCHITECTURES="$CUDA_ARCH"
cmake --build build -j$(nproc)

3.下载模型

型号链接大小
Qwen3.5-35B-A3B脱衣服GGUF --得到 UD-Q4_K_XL20.7 GB
杰玛4 31B IT脱衣服GGUF --得到 UD-Q4_K_XL约18.4 GB

4.启动服务器

# Qwen3.5 (fast, agentic coding)
./scripts/start-server.sh qwen YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf

# Gemma 4 (quality, reasoning)
./scripts/start-server.sh gemma YOUR_MODEL_PATH/gemma-4-31b-it-UD-Q4_K_XL.gguf

# Qwen3.5 + TurboQuant (3.5x KV compression)
./scripts/start-server.sh turbo YOUR_MODEL_PATH/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf

5.配置OpenCode

复制 configs/opencode.json~/.config/opencode/opencode.json.更换 YOUR_PORT 随着 10500 (默认)。

这两种型号都是预先配置的——通过更改 "model" 字段:

  • "llama.cpp/qwen3.5-coding" 对于速度
  • "llama.cpp/gemma-4-31B" 为了质量

6.开始编码

cd your-project && opencode

Linux安装程序(无WSL)

与上述步骤2-6相同。跳过WSL特定的CUDA仓库设置——使用您发行版的仓库。

仅Windows安装程序(无WSL)

  1. 下载预构建的llama.cpp --得到 llama-b{version}-bin-win-cuda-{ver}-x64.zip
  2. 下载匹配 cudart-llama-bin-win-cuda-{ver}-x64.zip
  3. 提取两者,复制旁边的DLL llama-server.exe
  4. 运行: llama-server.exe -m model.gguf -ngl 99 -fa on -c 131072 --host 0.0.0.0 --port 10500
  5. 注意:TurboQuant分叉需要从源代码构建(需要Visual Studio+CUDA工具包)

Mac(苹果硅)

______________________________________________________________________

最优模型参数

Qwen3.5(编码)

Qwen3.5官方文档:

模式温度top_ptop_kmin_p存在_惩罚
编码(思考)0.60.95200.00.0
一般(思考)1.00.95200.01.5
指导(无思考)0.70.8200.01.5

杰玛4 31B

参数注释
温度1.0训练温度=1.0(与Qwen3.5的0.6不同)
top_k64高于Qwen3.5的20
top_p0.95标准
min_p0.0标准
关键发现: Ollama的Qwen3.5默认参数为 temperature=1.0presence_penalty=1.5 --两者都不适合编码任务。仅这一点就导致了输出质量明显下降。Gemma 4在temp=1.0时运行良好,因为它是这样训练的。

______________________________________________________________________

什么是TurboQuant?

涡轮量子 (Google Research,ICLR 2026)是一种KV缓存压缩算法,实现了 3.5倍压缩,零精度损失。目前可用于 仅限Qwen3.5 (未用Gemma 4进行测试)。

它是如何工作的:

  1. PolarQuant --使用FWHT随机旋转数据向量,然后在极坐标系中量化。这消除了传统量化所需的每块归一化开销。
  1. QJL(量化Johnson Lindenstrauss) --每个残差使用1位来纠正步骤1中的错误。充当零内存开销的数学错误检查器。
  1. 结果:3.25位KV缓存(turbo3)事实上 beats 8位 质量,因为旋转+校正方法比原始的逐块缩放更好地保留了向量关系。

为什么这对局部推理很重要:

Qwen3.5 without TurboQuant (f16 KV):
  32GB VRAM = 20.7GB model + 2.5GB KV cache + overhead
  -> 131K context max, 6.0GB free

Qwen3.5 with TurboQuant (turbo3 KV):
  32GB VRAM = 20.7GB model + 0.7GB KV cache + overhead
  -> 131K context with 8.4GB free
  -> Or 262K context (full training length) possible

Gemma 4 without TurboQuant (f16 KV):
  32GB VRAM = 18.4GB model + 11.4GB KV cache + overhead
  -> 131K context, only 2.8GB free (tight!)
  -> turbo3 would save ~8GB if compatible (untested)

CUDA实施

我们使用 社区CUDA港口 这增加了:

  • 用于turbo3 K/V操作的自定义Flash Attention内核
  • 张量核心预填充路径(MMA加速)
  • 层自适应模式在q8_0处保留关键层
  • 已在RTX 3090和RTX 5090上测试

______________________________________________________________________

工具生态系统

OpenCode(初级-代理编码)

本地模型的最佳工具。精益工具集(读、写、编辑、bash、grep、glob)不会像Claude Code的几十个MCP工具那样使上下文膨胀。

MCP服务器:

  • 背景7 --文件搜索。添加 use context7 以提示查找API文档。
  • Chrome工具 --浏览器验证。自动启动Chromium,检查页面,运行控制台JS,截图。

OpenCode中的模型选择: Qwen3.5和Gemma 4都已配置。改变 "model" 在opencode.json中:

  • "llama.cpp/qwen3.5-coding" 速度(代理工作流)
  • "llama.cpp/gemma-4-31B" 质量(单镜头生成)

克劳德代码(人类API+本地模型回退)

通过以下方式与本地模型合作 claude-qwen bash函数,但发送所有连接的MCP工具模式(Notion、Slack、Atlassian等),这对本地模型造成了沉重的负担。最好与Anthropic的云API一起使用。

OpenClaw(电报机器人)

通过本地Ollama API将Telegram连接到您的本地模型。配置为 api: "openai-completions" 对于llama服务器。

打开WebUI(聊天界面)

端口5762上的Docker容器,通过以下方式连接到llama服务器 host.docker.internal:10500 (WSL)或 172.17.0.1:10500 (原生Linux)。

______________________________________________________________________

主要发现和经验教训

1.型号选择很重要:MoE与Dense

Qwen3.5(MoE,3B活性)比Gemma 4(致密,31B活性)快3倍,但Gemma 4产生了更高质量的首次射击输出。小行星测试清楚地表明了这一点:Gemma 4在第一次尝试时就产生了一个没有错误的游戏,而Qwen3.5需要一些小修复。对于多次迭代的代理编码,Qwen3.5的速度优势获胜。对于质量关键的单镜头生成,Gemma 4更好。

2.工具数量比你想象的更重要

*“从11种工具换成了5种。同样的型号,同样的硬件。响应时间从约5分钟缩短到约1分钟。”* --Reddit用户

Claude Code发送了数十个MCP工具模式。OpenCode发送~10。对于本地模型,请使用OpenCode。这同样适用于Qwen3.5和Gemma 4。

3.Qwen3.5编码的Ollama默认参数错误

Ollama搭载Qwen3.5 temperature=1.0presence_penalty=1.5.编码的官方建议是 temp=0.6, presence_penalty=0.0Gemma 4在temp=1.0时正常工作——每个模型需要不同的参数。

4.不穿衣服的UD GGUF不适合Ollama

Windows上的Olama 0.18.2无法加载Uncloth的HuggingFace GGUF。llama服务器加载良好。如果使用Ollama,请坚持使用注册表模型。

5.KV缓存量化灵敏度因型号而异

标准q8_0KV缓存量化在20-40K+上下文中会降低Qwen3.5的质量。TurboQuant的方法(FWHT旋转+范数校正)没有这个问题——它实际上提高了质量。

6.密集型占用VRAM用于KV缓存

Gemma 4的11.4GB KV缓存为131K(而Qwen3.5的2.5GB)是32GB GPU的主要限制。它的SWA层还破坏了提示缓存,这会损害代理工作负载,因为系统提示在许多请求中重复出现。

7.对于llama.cpp,WSL2比Windows更好

  • 原生Linux构建编译速度更快
  • 直接GPU直通无缝工作
  • 没有Windows PATH问题破坏bash脚本
  • 与仅支持Linux版本的研究分支兼容

8.Chrome DevTools MCP需要正确的标志

--executablePath /usr/bin/chromium --chromeArg --no-sandbox 用于自动启动。这 --cdp-url--browserUrl 标志用于连接到现有实例。

______________________________________________________________________

桌面快捷方式(Windows)

快捷方式它的作用
启动Qwen AI服务器使用Qwen3.5、f16KV缓存的WSL骆驼服务器
启动Qwen AI TurboQuantWSL骆驼服务器,配备Qwen3.5、turbo3KV缓存
停止Qwen AI服务器杀死WSL中的骆驼服务器
更新Qwen AI服务器下载最新的llama.cpp Windows预构建

______________________________________________________________________

仓库内容

local-ai-coding-setup/
├── README.md                              # This file
├── scripts/
│   ├── setup.sh                           # One-command setup (CUDA, llama.cpp, OpenCode)
│   └── start-server.sh                    # Start llama-server (qwen|gemma|turbo modes)
├── configs/
│   ├── opencode.json                      # OpenCode config (Qwen3.5 + Gemma 4)
│   ├── openclaw.json                      # OpenClaw/Telegram bot config
│   ├── claude-code-bashrc.sh              # Claude Code bash function
│   ├── open-webui-docker.sh               # Open WebUI Docker run command
│   └── ollama-modelfile                   # Ollama Modelfile with correct params
└── research/
    ├── gemma4-findings.md                 # Gemma 4 31B benchmarks & analysis
    ├── turboquant-findings.md             # TurboQuant benchmarks & analysis
    ├── qwen35-parameter-tuning.md         # Optimal parameters for both models
    ├── tool-ecosystem-comparison.md       # OpenCode vs Claude Code vs OpenClaw
    └── test-prompts.md                    # Ready-to-use test prompts with results

______________________________________________________________________

云服务器设置(可选——RTX PRO 6000 96GB)

对于较重的模型和企业用例,请部署在云GPU服务器上。

组件

服务端口描述
llama服务器8000承载身份验证保护的推理端点
摘录API8001结构化数据提取(文本或PDF→ JSON)
Mistral OCR MCP8002PDF→ 通过Mistral API提取markdown文本,作为AnythingLLM的MCP工具
万物皆可LLM3001RAG工作空间,内嵌LanceDB、Docker

推荐云型号:Gemma 4 26B-A4B

  • 架构: 教育部(总计26B,每个代币4B活跃,256名专家,8名路由+1名共享)
  • 量化: Uncloth Q8_0(26.9GB,2026年4月用固定工具调用标记器重新上传)
  • 背景: 262K本地
  • VRAM: 约30.5GB,4个并行插槽,262K ctx,剩余65GB+余量
  • 为什么Gemma 4在云端: 在.Qwen3.5-122B中训练的本机函数调用是一个令人印象深刻的聊天模型,但其10B活动MoE无法在AnythingLLM的代理循环中可靠地发出工具调用JSON。Gemma 4 26B-A4B的训练 ` 分隔符使其成为可靠的选择 @agent` 模式。

替代方案:Qwen3.5-122B-A10B用于聊天/推理

如果你想在同一硬件上使用最大的推理机:

  • 量化: Uncloth UD-Q4_K_XL(72GB)--最新版本,带固定聊天模板
  • VRAM: ~ 73GB型号+~ 4GB KV(涡轮3,131K ctx×2插槽)=~ 77GB的96GB
  • 对于代理/工具工作负载,跳过此步骤——它在AnythingLLM的代理模式下循环或拒绝
  • 巴托夫斯基Q4_K_M是 破碎的 --由于旧的聊天模板,即使是简单的提示也会产生无限的思维循环。始终使用Uncloth UD-Q4_K_XL或更高版本。

云盒子上的TurboQuant

马德雷格CUDA叉子 对于经典变压器/MoE架构:

  • turbo3KV(5.12x压缩,3.125比特/值)
  • TURBO_LAYER_ADAPTIVE=2(关闭涡轮机3-q8_0 PPL间隙的40%)
  • SM120优化(Blackwell服务器级卡)
  • 启用稀疏V跳跃(零质量成本,32K时速度提高4.6%)
# Example: Qwen3.5-122B with Madreag TurboQuant
TURBO_LAYER_ADAPTIVE=2 llama-server \
    -m Qwen3.5-122B-A10B-UD-Q4_K_XL.gguf \
    -ngl 99 -fa on -c 131072 -np 2 \
    -ctk turbo3 -ctv turbo3 \
    --temp 0.6 --top-k 20 --min-p 0.0 \
    --host 0.0.0.0 --port 8000 \
    --api-key $YOUR_BEARER_TOKEN

对于 Qwen3.6-35B-A3B (门控DeltaNet混合)使用 汤姆的叉子 相反,这是唯一一把叉子 LLM_ARCH_QWEN3NEXT 支持SSM状态张量。

systemd+JSON参数获取

ExecStart=... --chat-template-kwargs '{"enable_thinking":false}' fails-systemd会剥离 " 在llama服务器看到这些字符之前。用shell脚本包裹:

# /home/user/start-llama.sh
#!/bin/bash
export TURBO_LAYER_ADAPTIVE=2
exec /home/user/llama-cpp-turboquant/build/bin/llama-server \
    -m /path/to/model.gguf \
    -ngl 99 -fa on -c 131072 -np 2 -ctk turbo3 -ctv turbo3 \
    --host 0.0.0.0 --port 8000 \
    --api-key $TOKEN

然后 ExecStart=/home/user/start-llama.sh 在systemd单元中,shell引用保留了所有内容。

思维模式控制

保留服务器的 默认 思维模式开启(这是正确的主体编码所必需的)。仅在摘录API中禁用per-request:

{
  "model": "...",
  "messages": [...],
  "temperature": 0,
  "chat_template_kwargs": {"enable_thinking": false}
}

Qwen3.5-122B在默认设置下只想着“你好”就浪费了3000多个代币——始终设置 enable_thinking: false 用于提取端点。

Mistral OCR MCP服务器

一个轻量级MCP服务器,将Mistral的OCR API公开为AnythingLLM工具:

PDF upload → Mistral OCR API → markdown text → Agent applies custom prompts

在AnythingLLM中配置 anythingllm_mcp_servers.json:

{
  "mcpServers": {
    "mistral-ocr": {
      "type": "sse",
      "url": "http://host.docker.internal:8002/sse"
    }
  }
}

configs/mistral-ocr-mcp.py 用于插入FastMCP服务器模板。

提取API管道

PDF → Mistral OCR (markdown text) → LLM (schema-driven extraction) → Clean JSON

API公开的摘录 /extract 对于纯文本和 /extract-pdf 对于PDF字节。系统提示定义了目标JSON模式——交换它以匹配您的域(合同、发票、医疗表格或其他任何东西)。看 configs/extract-api.py 对于模板。

______________________________________________________________________

链接和资源

模型

资源链接
Qwen3.5-35B-A3B(底座)https://huggingface.co/Qwen/Qwen3.5-35B-A3B
Qwen3.5-122B-A10B(底座)https://huggingface.co/Qwen/Qwen3.5-122B-A10B
Qwen3.5-122B bartowski GGUF(推荐用于TurboQuant)https://huggingface.co/bartowski/Qwen_Qwen3.5-122B-A10B-GGUF
Qwen3.5-35B无服GGUF定量https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF
Gemma 4 31B IT(基础)https://huggingface.co/google/gemma-4-31b-it
Gemma 4不穿衣服的GGUF定量https://huggingface.co/unsloth/gemma-4-31b-it-GGUF
Qwen3.5博客文章https://qwen.ai/blog?id=qwen3.5
取消布料(量化工具)https://github.com/unslothai/unsloth

推理引擎

资源链接
llama.cpp(主线)https://github.com/ggml-org/llama.cpp
llama.cpp发布(预构建)https://github.com/ggml-org/llama.cpp/releases
TurboQuant CUDA分叉(TheTom——有Qwen3NEXT用于Qwen3.6门控DeltaNet)https://github.com/TheTom/llama-cpp-turboquant
TurboQuant CUDA分叉(Madreag——SM120上32K的最快解码速度)https://github.com/Madreag/turbo3-cuda
TurboQuant CUDA叉子(spiritbuun,原版)https://github.com/spiritbuun/llama-cpp-turboquant-cuda

研究

资源链接
TurboQuant论文(谷歌,ICLR 2026)https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/
TurboQuant MLX实现https://github.com/Blaizzy/mlx-vlm/pull/858
QJL论文https://arxiv.org/abs/2402.09078
PolarQuant论文(AISTATS 2026)在TurboQuant博客中引用

工具

工具链接它的作用
OpenCodehttps://opencode.ai / https://github.com/opencode-ai/opencode代理编码(建议用于本地模型)
克劳德代码https://claude.ai/code / https://github.com/anthropics/claude-codeAnthropic的编码命令行界面
OpenClawhttps://docs.ollama.com电报/消息机器人桥
打开WebUIhttps://github.com/open-webui/open-webui浏览器聊天界面
上下文7 MCPhttps://context7.com文档搜索
Chrome DevTools MCPhttps://github.com/anthropics/anthropic-cookbook浏览器自动化
奥拉玛https://ollama.com本地模型运行器(替代llama服务器)
任何事情LLMhttps://anythingllm.comRAG知识库平台
错误OCR APIhttps://docs.mistral.ai/capabilities/document_aiPDF文本提取

社区

资源链接
r/LocalLLaMA(Reddit)https://reddit.com/r/LocalLLaMA

______________________________________________________________________

许可证

麻省理工学院——随心所欲地使用。如果你以此为基础,分享你的发现!

______________________________________________________________________

作者

由以下人员建造和维护 詹姆斯·阿斯兰在RTX 5090(本地)和RTX PRO 6000 96GB(云)上进行了测试,采用Qwen3.5/3.6、Gemma 4 26B/31B和TurboQuant KV压缩。

目录标签

目录标签

代码生成ShellClaude本地部署AI编程本地推理GPU加速企业RAG

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

token

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明token部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP