Token导航 LogoToken导航TokenDH.com
Llama4 Maverick MCP logo
AI代理未说明官方级别未说明来源级核验

Llama4 Maverick MCP

MCP Server

一个将本地Llama模型与Claude Desktop等MCP兼容客户端无缝集成的服务器,提供强大的工具使用、函数调用和增强功能。

工具数

10

提示词数

0

GitHub Stars

0

资源数

0
本地AITypeScriptClaude隐私保护Claude DesktopClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

YobieBen

提供方

YobieBen

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

🦙 呼叫4 Maverick MCP服务器

作者:约比·本杰明\ 版本: 0.9\ 日期:2025年8月1日

一个全面的模型上下文协议(MCP)服务器,可实现Llama模型与Claude Desktop和其他MCP兼容客户端的无缝集成。该服务器在本地Llama模型和AI助手之间提供了一座桥梁,实现了强大的工具使用、函数调用和增强的功能。

📚 目录

🎯 你会用这个Llama MCP服务器做什么?

本地AI+克劳德桌面的力量

这款MCP服务器通过结合两方面的优点,开启了一种革命性的人工智能工作方式: 克劳德的高级推理能力 随着 您自己本地托管的Llama模特。这可以实现以下功能:

1. 隐私优先的人工智能工作流程 🔒

  • 敏感文档处理:处理机密文件、医疗记录、法律合同或专有代码,而不将数据发送到云端
  • 公司合规:满足严格的数据驻留要求,同时仍利用人工智能
  • 个人数据分析:分析个人财务、健康数据或本地私人通信
  • 知识产权保护:处理商业秘密、专利或未发布的产品

示例用例律师事务所可以使用Claude Desktop使用本地Llama模型分析机密客户文件,确保完全的数据隐私,同时保持强大的人工智能功能。

2. 专业模型实验 🧪

  • 微调模型:为特定领域部署自己的微调Llama模型
  • 定制培训:使用根据组织数据训练的模型
  • 模型比较:根据任务要求在不同的Llama变体(7B、13B、70B)之间切换
  • 参数调整:实时实验温度、top-p和其他发电参数

示例用例医学研究团队可以通过Claude Desktop使用他们微调的医学Llama模型来分析研究论文并生成假设。

3. 混合AI架构 🔄

  • 两全其美:用克劳德进行推理和规划,用拉玛进行生成
  • 负载平衡:将某些任务卸载到本地模型,以降低API成本
  • 后备系统:在云服务不可用时使用本地模型
  • 互补优势:利用每个模型的独特功能

示例用例:使用Claude规划一个复杂的软件架构,然后使用代码专用的Llama模型生成实现细节。

4. 开发和测试环境 💻

  • 快速原型制作:在没有API费率限制或成本的情况下测试AI功能
  • 线下开发:在没有互联网连接的情况下开发人工智能应用程序
  • 调试AI行为:在完全控制下检查和调试模型响应
  • CI/CD集成:在您的开发管道中包括本地模型测试

示例用例:软件团队可以在部署到生产环境之前在本地开发和测试人工智能功能,确保行为一致。

5. 教育和研究应用 📚

  • 教授人工智能概念:演示语言模型如何在没有云依赖的情况下工作
  • 研究实验:进行可重复的人工智能研究,完全控制模型
  • 学生项目:使学生能够在有限的预算内使用强大的模型
  • 学术论文:为出版物生成一致、可重复的结果

示例用例大学教授可以在讲座中实时向学生演示不同的模型行为和参数。

6. 创意和内容生成 🎨

  • 一致的角色声音:保持创意写作中的字符一致性
  • 专业内容:生成技术文档、营销副本或代码
  • 批处理:在没有API限制的情况下处理大量内容
  • 风格迁移:使用微调的模型应用特定的写作风格

示例用例:内容代理可以使用针对每个客户品牌声音的专门模型为多个客户生成初稿。

7. 实时和边缘应用程序

  • 低延迟要求:消除时间关键型应用程序的网络延迟
  • 离线功能:构建无需互联网即可运行的应用程序
  • 边缘部署:在边缘设备或本地服务器上运行AI
  • 系统性能:一致的响应时间,没有云变化

示例用例:制造工厂可以使用本地人工智能进行实时质量控制,而不依赖于互联网连接。

8. 成本优化 💰

  • 无API成本:消除大容量应用程序的每代币定价
  • 可预测费用:固定的硬件成本,而不是可变的API费用
  • 无限制使用:没有费率限制或配额
  • 资源控制:根据您的需求进行放大或缩小

示例用例:初创公司可以对人工智能功能进行原型化和验证,而无需在开发过程中承担大量API成本。

9. 自定义工具集成 🛠️

  • 数据库查询:直接连接到本地数据库
  • 文件系统访问:处理本地文件和目录
  • 系统集成:与本地应用程序和服务交互
  • 硬件控制:与物联网设备或专用硬件的接口

示例用例自动化工程师可以使用Claude Desktop和本地Llama通过定制工具控制和监控工业设备。

10. 合规和审计要求 📋

  • 完成审计跟踪:记录每次交互和模型响应
  • 版本控制:引脚特定型号版本,可重复使用
  • 数据治理:保持对数据流的完全控制
  • 合规:满足GDPR、HIPAA或其他监管要求

示例用例:医疗保健提供者可以在使用人工智能进行患者数据分析的同时保持HIPAA合规性。

🎯 概述

Llama 4 Maverick MCP服务器将您的本地Llama安装转换为强大的后端服务,可以通过MCP兼容客户端访问。这使您能够充分利用本地AI的全部功能,同时保持Claude Desktop的复杂界面和功能。

架构概述

graph TB
    subgraph "Your Local Environment"
        A[Claude Desktop] -->|MCP Protocol| B[MCP Server]
        B --> C[Llama Service]
        C --> D[Ollama Runtime]
        D --> E[Llama Models]
        B --> F[Tool System]
        F --> G[File System]
        F --> H[Code Executor]
        F --> I[Web Search]
        F --> J[Database]
        B --> K[Prompt Manager]
        B --> L[Resource Manager]
    end
    
    subgraph "Benefits"
        M[Privacy: Data Never Leaves Your Machine]
        N[Control: Full Model Configuration]
        O[Cost: No API Fees]
        P[Speed: No Network Latency]
    end

🚀 主要特点

核心能力

  • 多模型支持:在Calma 3、Calma 2、CodeCalma等之间切换
  • 流媒体响应:实时生成令牌以获得更好的用户体验
  • 函数调用:使用带有自动参数验证的本机工具
  • 丰富的工具生态系统:10多种内置工具,易于扩展
  • 及时管理:用于一致交互的模板系统
  • 资源访问:提供文件、示例和数据
  • 综合录井:调试和监控所有操作
  • 错误恢复:巧妙地处理故障

高级功能

  • 🚀 热重新加载:更改配置而不重新启动
  • 🚀 模型缓存:预热后响应时间更快
  • 🚀 并行处理:同时处理多个请求
  • 🚀 内存管理:优化上下文窗口的使用
  • 🚀 自定义中间件:添加自己的处理层
  • 🚀 指标收集:监控性能和使用情况

💻 系统要求

最低要求

组件最小推荐最佳
中央处理器4芯8芯16+芯
随机存取存储器8GB16GB32GB+
存储10GB SSD50GB SSD100GB+NVMe
图形处理器不需要4GB VRAM8GB+VRAM
操作系统macOS 10.15+、Windows 10+、Ubuntu 20.04+最新稳定最新稳定性
Node.jsv18.0.0v20.0.0最新LTS

按尺寸列出的型号要求

型号参数所需RAM存储用例
TinyLlama1.1B2GB2GB快速响应,测试
Calma 3 8b8b8GB4.5GB通用
Llama 3 13B13B16GB7.5GB高级任务
Calma 3 70b70b48GB40GB专业使用
CodeLlama7B-34B8-32GB4-20GB代码生成

📦 完整安装指南

快速入门(5分钟)

# Clone the repository
git clone https://github.com/yobieben/llama4-maverick-mcp.git
cd llama4-maverick-mcp

# Run the automated setup
./quickstart.sh

# Start the server
./start.sh

详细安装

步骤1:安装先决条件

Node.js安装:

macOS:

# Using Homebrew
brew install node

# Or using MacPorts
sudo port install nodejs18

窗户:

# Using Chocolatey
choco install nodejs

# Or download from https://nodejs.org

Linux:

# Ubuntu/Debian
curl -fsSL https://deb.nodesource.com/setup_lts.x | sudo -E bash -
sudo apt-get install -y nodejs

# Fedora/RHEL
sudo dnf install nodejs

# Arch
sudo pacman -S nodejs npm

第二步:安装Olama

自动安装:

# macOS and Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows - Download from:
# https://ollama.com/download/windows

手动安装:

macOS:

brew install ollama

Linux:

# Download binary
wget https://github.com/ollama/ollama/releases/latest/download/ollama-linux-amd64
chmod +x ollama-linux-amd64
sudo mv ollama-linux-amd64 /usr/local/bin/ollama

步骤3:设置MCP服务器

# Clone repository
git clone https://github.com/yobieben/llama4-maverick-mcp.git
cd llama4-maverick-mcp

# Install dependencies
npm install

# Build the project
npm run build

# Configure environment
cp .env.example .env
# Edit .env with your preferences

步骤4:下载火焰模型

# Start Ollama service
ollama serve

# In a new terminal, pull models
ollama pull llama3:latest        # 8B model, recommended
ollama pull codellama:latest     # For code generation
ollama pull llama3:70b           # Large model (requires 48GB+ RAM)
ollama pull tinyllama:latest     # Tiny model for testing

# List available models
ollama list

步骤5:配置Claude桌面

添加到Claude桌面配置:

macOS: ~/Library/Application Support/Claude/claude_desktop_config.json

{
  "mcpServers": {
    "llama4-maverick": {
      "command": "node",
      "args": ["/absolute/path/to/llama4-maverick-mcp/dist/index.js"],
      "env": {
        "NODE_ENV": "production",
        "LLAMA_MODEL_NAME": "llama3:latest"
      }
    }
  }
}

视窗: %APPDATA%\Claude\claude_desktop_config.json

{
  "mcpServers": {
    "llama4-maverick": {
      "command": "node",
      "args": ["C:\\path\\to\\llama4-maverick-mcp\\dist\\index.js"],
      "env": {
        "NODE_ENV": "production",
        "LLAMA_MODEL_NAME": "llama3:latest"
      }
    }
  }
}

⚙️ 配置深度学习

环境变量

创建一个 .env 使用您的配置文件:

# ============================================
# OLLAMA CONFIGURATION
# ============================================
# Ollama API endpoint
LLAMA_API_URL=http://localhost:11434

# Model selection (examples below)
LLAMA_MODEL_NAME=llama3:latest
# LLAMA_MODEL_NAME=llama3:70b
# LLAMA_MODEL_NAME=codellama:latest
# LLAMA_MODEL_NAME=your-custom-model:latest

# Optional API key for secured Ollama instances
LLAMA_API_KEY=

# ============================================
# MCP SERVER CONFIGURATION
# ============================================
# Server settings
MCP_SERVER_PORT=3000
MCP_SERVER_HOST=localhost
MCP_LOG_LEVEL=info  # debug, info, warn, error

# Security
MCP_ENABLE_AUTH=false
MCP_API_KEY=your_secret_key_here

# ============================================
# PERFORMANCE TUNING
# ============================================
# Maximum context window (tokens)
MAX_CONTEXT_LENGTH=128000

# Concurrent request handling
MAX_CONCURRENT_REQUESTS=10

# Request timeout (milliseconds)
REQUEST_TIMEOUT_MS=30000

# ============================================
# FEATURE FLAGS
# ============================================
# Enable/disable features
ENABLE_STREAMING=true
ENABLE_FUNCTION_CALLING=true
ENABLE_VISION=false  # For future Llama vision models
ENABLE_CODE_EXECUTION=false  # Security risk - enable with caution

# ============================================
# MODEL PARAMETERS
# ============================================
# Generation parameters
TEMPERATURE=0.7      # 0.0 (deterministic) to 2.0 (creative)
TOP_P=0.9           # Nucleus sampling threshold
TOP_K=40            # Top-k sampling
REPEAT_PENALTY=1.1  # Penalize repetitions
SEED=42             # For reproducible outputs

# ============================================
# FILE SYSTEM
# ============================================
# Base path for file operations
FILE_SYSTEM_BASE_PATH=/Users/yourusername/Documents

# ============================================
# DATABASE (Optional)
# ============================================
DATABASE_URL=postgresql://localhost/mydb
DATABASE_POOL_SIZE=10

选型指南

型号最适合速度质量RAM
tinyllama:latest测试,快速响应⚡⚡⚡⚡⚡⭐⭐2GB
llama3:7b一般聊天,简单任务⚡⚡⚡⚡⭐⭐⭐8GB
llama3:latest平衡性能⚡⚡⚡⭐⭐⭐⭐8GB
llama3:13b复杂推理⚡⚡⭐⭐⭐⭐16GB
llama3:70b专业用途⭐⭐⭐⭐⭐48GB
codellama:latest代码生成⚡⚡⚡⭐⭐⭐⭐⭐8GB
codellama:34b高级编码⚡⚡⭐⭐⭐⭐⭐32GB

🛠️ 可用工具

内置工具参考

工具说明参数示例使用
网络搜索搜索网页query, maxResults“搜索最新的AI新闻”
execute_code安全运行代码language, code, timeout“运行此Python脚本”
read_file读取文件内容path, encoding“读取config.json”
write_file写入文件path, content“将此保存到notes.txt”
列表文件列表目录path, recursive“显示/projects中的文件”
数据库查询执行SQLquery, parameters“从用户中选择\*”
计算数学运算expression“计算234\*567”
日期时间日期/时间操作operation, format“现在几点了?”
jsonparse解析JSONdata, path从JSON中提取“name”
http_request进行HTTP调用url, method, headers“得到https://api.example.com"

创建自定义工具

通过在中创建新文件来添加自己的工具 src/tools/:

// src/tools/my-custom-tool.ts
import { z } from 'zod';

export class MyCustomTool {
  name = 'my_custom_tool';
  description = 'Does something custom';
  
  inputSchema = z.object({
    param1: z.string().describe('First parameter'),
    param2: z.number().optional().describe('Optional number'),
  });
  
  async execute(args: any) {
    // Your tool logic here
    return {
      success: true,
      result: `Processed ${args.param1}`,
    };
  }
}

🧪 使用与实验指南

基本使用示例

1.简单聊天:

User: "Hello, can you help me understand recursion?"
Llama (via MCP): "I'd be happy to explain recursion! Recursion is..."

2.工具使用:

User: "Calculate the compound interest on $10,000 at 5% for 10 years"
Llama (via MCP): "I'll calculate that for you using the calculator tool..."
[Executes calculator tool]
Result: $16,288.95

3.文件操作:

User: "Read the package.json file and tell me the version"
Llama (via MCP): "I'll read that file for you..."
[Executes read_file tool]
"The version is 1.0.0"

高级实验

1.型号比较:

// Compare responses from different models
const models = ['llama3:7b', 'llama3:13b', 'codellama:latest'];
for (const model of models) {
  process.env.LLAMA_MODEL_NAME = model;
  // Test same prompt with each model
}

2.参数调整:

// Experiment with generation parameters
const configs = [
  { temperature: 0.1, top_p: 0.9 },  // Focused
  { temperature: 0.7, top_p: 0.9 },  // Balanced
  { temperature: 1.5, top_p: 0.95 }, // Creative
];

3.自定义提示:

// Add to src/prompts/prompt-manager.ts
{
  name: 'code_reviewer',
  description: 'Review code for best practices',
  template: `Review this code for:
    1. Security issues
    2. Performance problems
    3. Best practices
    Code: {{code}}`,
}

📊 真实世界的例子

示例1:本地文档分析系统

// Analyze confidential documents without cloud exposure
const analyzer = {
  async analyzeDocument(filepath: string) {
    // Read document locally
    const content = await toolManager.execute('read_file', { path: filepath });
    
    // Analyze with Llama
    const analysis = await llamaService.complete({
      prompt: `Analyze this document for key insights: ${content}`,
      temperature: 0.3, // Low temperature for factual analysis
    });
    
    // Save results locally
    await toolManager.execute('write_file', {
      path: 'analysis_results.json',
      content: JSON.stringify(analysis),
    });
  }
};

示例2:代码生成管道

// Generate and test code locally
const codeGenerator = {
  async generateAndTest(requirements: string) {
    // Generate code with CodeLlama
    process.env.LLAMA_MODEL_NAME = 'codellama:latest';
    const code = await llamaService.complete({
      prompt: `Generate Python code for: ${requirements}`,
    });
    
    // Test the generated code
    const result = await toolManager.execute('execute_code', {
      language: 'python',
      code: code,
      timeout: 5000,
    });
    
    return { code, testResult: result };
  }
};

示例3:自定义知识库

// Build a local RAG system
const knowledgeBase = {
  async queryKnowledge(question: string) {
    // Search local documents
    const files = await toolManager.execute('list_files', {
      path: './knowledge_base',
      recursive: true,
    });
    
    // Read relevant files
    const contents = await Promise.all(
      files.map(f => toolManager.execute('read_file', { path: f }))
    );
    
    // Generate answer with context
    return await llamaService.complete({
      prompt: `Context: ${contents.join('\n')}\nQuestion: ${question}`,
      temperature: 0.3,
    });
  }
};

🚀 性能优化

速度优化提示

  1. 型号选择:

- 使用较小的模型执行简单任务 - 为复杂推理保留大型模型 - 考虑量化模型以实现更好的速度/质量权衡

  1. 缓存策略:
   // Enable response caching
   const cache = new Map();

   async function cachedComplete(prompt: string) {
     const key = hash(prompt);
     if (cache.has(key)) return cache.get(key);
     
     const result = await llamaService.complete({ prompt });
     cache.set(key, result);
     return result;
   }
  1. 批量处理:
   // Process multiple requests in parallel
   const results = await Promise.all(
     prompts.map(p => llamaService.complete({ prompt: p }))
   );
  1. 上下文管理:
   // Optimize context window usage
   function truncateContext(text: string, maxTokens: number = 4096) {
     // Smart truncation preserving important information
     return text.slice(-maxTokens * 4); // Approximate
   }

内存优化

  1. 模型加载:
   # Load models on demand
   ollama run llama3:latest --keep-alive 0  # Unload when idle
  1. 垃圾收集:
   // Force garbage collection (if --expose-gc flag is set)
   if (global.gc) {
     setInterval(() => {
       global.gc();
     }, 60000); // Every minute
   }
  1. 流处理:
   // Use streaming to reduce memory footprint
   const stream = await llamaService.complete({
     prompt: "Large prompt...",
     stream: true,
   });

   for await (const chunk of stream) {
     process.stdout.write(chunk);
   }

🔧 故障排除

常见问题及解决方法

问题原因解决方案
“找不到Ollama”Ollama未安装运行 `curl -fsSL https://ollama.com/install.sh \sh`
“找不到模型”模型未拉取运行 ollama pull llama3:latest
“内存不足”型号太大使用较小的型号或添加更多RAM
“连接被拒绝”Ollama没有跑步 ollama serve
“超时错误”缓慢生成增加 REQUEST_TIMEOUT_MS
“权限被拒绝”文件访问受限检查 FILE_SYSTEM_BASE_PATH
“找不到工具”工具未注册检查工具管理器中的工具注册。ts

调试模式

启用全面调试:

# In .env file
MCP_LOG_LEVEL=debug
NODE_ENV=development

# Run with debug output
DEBUG=* npm run dev

# Check logs
tail -f logs/combined.log
tail -f logs/error.log

健康检查

// Add health check endpoint
async function healthCheck() {
  const checks = {
    ollama: await checkOllama(),
    model: await checkModel(),
    tools: toolManager.getTools().length > 0,
    memory: process.memoryUsage(),
  };
  
  return {
    status: Object.values(checks).every(v => v) ? 'healthy' : 'degraded',
    checks,
  };
}

🔒 安全最佳实践

1.安全配置

# Use environment variables for sensitive data
MCP_API_KEY=$(openssl rand -hex 32)
MCP_ENABLE_AUTH=true

# Restrict file access
FILE_SYSTEM_BASE_PATH=/safe/directory
ENABLE_CODE_EXECUTION=false  # Unless absolutely needed

2.网络安全

// Implement rate limiting
const rateLimit = new Map();

function checkRateLimit(clientId: string): boolean {
  const requests = rateLimit.get(clientId) || 0;
  if (requests > 100) return false; // 100 requests per minute
  rateLimit.set(clientId, requests + 1);
  return true;
}

3.输入验证

// Validate all inputs
const SafePathSchema = z.string().refine(
  path => !path.includes('..') && path.startsWith(BASE_PATH),
  'Invalid path'
);

4.审计日志

// Log all operations for audit
function auditLog(operation: string, user: string, details: any) {
  logger.info('AUDIT', {
    timestamp: new Date().toISOString(),
    operation,
    user,
    details,
  });
}

🤝 贡献

我们欢迎捐款!以下是如何开始:

开发设置

# Fork and clone
git clone https://github.com/YOUR_USERNAME/llama4-maverick-mcp.git
cd llama4-maverick-mcp

# Install dev dependencies
npm install

# Run in development mode
npm run dev

# Run tests
npm test

# Lint and format
npm run lint
npm run format

贡献指南

  1. 代码的风格:遵循TypeScript最佳实践
  2. 文档:更新README以获取新功能
  3. 测试:添加新功能的测试
  4. 承诺:使用常规提交
  5. 拉取请求:清楚地描述变化

贡献领域

  • 🛠️ 新工具和集成
  • 📝 文档改进
  • 🐛 错误修正
  • 🚀 性能优化
  • 🧪 测试覆盖率
  • 🌐 国际化

📄 许可证

MIT许可证-请参阅 许可证 文件

👨‍💻 作者

约比·本杰明\ 版本0.9\ 2025年8月1日

🙏 致谢

  • MCP协议规范的拟人化
  • Ollama团队负责本地模特主持
  • 火焰模型的目标
  • 开源社区的宝贵贡献

📞 支持

______________________________________________________________________

准备好彻底改变你的人工智能工作流程了吗? 今天开始用Calma 4 Maverick MCP进行实验!🦙🚀

目录标签

目录标签

本地AITypeScriptClaude隐私保护本地部署模型集成工具调用函数调用

支持客户端

Claude DesktopClaude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

api-key

工具数量(toolCount,工具数)

10

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明api-key部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP