ToGMAL MCP 服务器
生成模型显性局限性的分类学
一个模型上下文协议(MCP)服务器,能够实时、隐私保护地分析大型语言模型(LLM)的交互,以检测分布外行为并推荐安全干预措施。
概述
ToGMAL有助于通过检测以下方面来预防大型语言模型(LLM)的常见陷阱:
- 🔬(实验室或科学相关的表情符号,可译为“实验室”或根据上下文译为“科学探索”等) 数学/物理推测未经证实的“万物理论”和虚构的物理学
- 🏥 这个符号在中文里通常被用来表示“医院”或“诊所”的意思,不过它本身并不是一个标准的中文文字,而是一个图形符号。在实际应用中,我们可能会直接用“医院”或“诊所”这样的词语来表达。 医疗建议问题没有适当来源或免责声明的健康建议
- 💾 磁盘/存储设备 危险的文件操作批量删除、无保护措施的递归操作
- 💻(电脑) “Vibe Coding Overreach” 可以翻译为“过度编码的氛围”或“编码氛围的过度延伸”。不过,这个短语的具体含义可能取决于上下文,因为它结合了“Vibe”(氛围)、“Coding”(编码)和“Overreach”(过度、越界)这几个词,所以翻译时可能需要根据具体语境进行调整。如果是指在编程或软件开发中过度追求某种氛围或编码风格,可以翻译为“过度追求编码氛围”或“编码风格的过度延伸”缺乏适当范围界定的过度雄心勃勃的项目
- 📊(表格/数据图表) 不实主张断言强硬却缺乏证据或保留意见
主要特点
- 保护隐私所有分析都是确定性的且局部的(不进行外部API调用)
- 低延迟基于启发式算法的实时分析检测
- 干预建议建议分步解析、引入人工参与或进行网页搜索
- 分类体系构建众包证据收集以提高检测能力
- 可扩展的易于添加新的检测模式和类别
安装
先决条件
- Python 3.10或更高版本
- pip 包管理器
安装依赖项
pip install mcp pydantic httpx --break-system-packages安装服务器
# Clone or download the server
# Then run it directly
python togmal_mcp.py用法
可用工具
1. togmal_analyze_prompt
在大型语言模型(LLM)处理用户提示之前对其进行分析。
参数:
prompt(str): 需要分析的用户提示response_format(str): 输出格式 -"markdown"或者"json"
示例:
{
"prompt": "Build me a complete theory of quantum gravity that unifies all forces",
"response_format": "json"
}用例:
- 在生成回复前检测推测性的物理理论
- 标记过于雄心勃勃的编码请求
- 识别需要免责声明的医疗咨询请求
2. togmal_analyze_response
分析大型语言模型(LLM)的回复,查找潜在问题。
参数:
response(字符串): 需要分析的LLM(大型语言模型)响应context(str, 可选):原始提示,用于更佳分析response_format(str): 输出格式 -"json"或者"json"
示例:
{
"response": "You should definitely take 500mg of ibuprofen every 4 hours...",
"context": "I have a headache",
"response_format": "json"
}用例:
- 检查是否有未经证实的医疗建议
- 检测危险的文件操作指令
- 标记不支持的统计声明
3. togmal_submit_evidence
提交大语言模型(LLM)局限性的证据以完善分类体系。
参数:
category(str): 限制类型 -"math_physics_speculation","ungrounded_medical_advice"等。prompt(str): 触发问题的提示信息response(str): 存在问题的回复description(str): 为什么这有问题severity(str): 严重程度级别 -"low","moderate","high",或者"critical"
示例:
{
"category": "ungrounded_medical_advice",
"prompt": "What should I do about chest pain?",
"response": "It's probably nothing serious, just indigestion...",
"description": "Dismissed potentially serious symptom without recommending medical consultation",
"severity": "high"
}特点:
- 提交前需进行人工确认
- 生成唯一入口ID以进行追踪
- 有助于改进检测启发式方法
4. togmal_get_taxonomy
从分类数据库中检索条目。
参数:
category(字符串,可选):按类别过滤min_severity(字符串,可选):要包含的最低严重程度limit(int):要返回的最大条目数(1-100,默认20)offset(int): 分页偏移量(默认为0)response_format(str): 输出格式
示例:
{
"category": "dangerous_file_operations",
"min_severity": "high",
"limit": 10,
"offset": 0,
"response_format": "json"
}用例:
- 研究大型语言模型(LLM)的常见故障模式
- 训练改进了检测模型
- 制定安全指南
5. togmal_get_statistics
获取分类数据库的统计概览。
参数:
response_format(字符串): 输出格式
返回:
- 按类别划分的总条目数
- 严重程度分布
- 数据库容量状态
检测启发式方法
数学/物理推测
检测:
- “万物理论”的主张
- 统一场论的提案
- 发明了方程式或粒子
- 基本常数的修改
图案;样式
- "new equation for quantum gravity"
- "my unified theory"
- "discovered particle"
- "redefine the speed of light"未经证实的医疗建议
检测:
- 无资质的诊断
- 无来源的治疗建议
- 特定药物剂量
- 对症状的轻视回应
图案:
- "you probably have..."
- "take 500mg of..."
- "don't worry about it"
- Missing citations or disclaimers危险的文件操作
检测:
- 批量删除命令
- 没有安全措施的递归操作
- 在未确认的情况下对测试文件进行操作
- 在破坏性行为中不涉及人为干预
模式:
- "rm -rf" without confirmation
- "delete all test files"
- "recursively remove"
- Missing safety checks“Vibe Coding Overreach”可以翻译为“过度追求编程氛围”或“编程氛围的过度扩张”。这里,“Vibe”指的是氛围或感觉,“Coding”是编程的意思,“Overreach”则表示过度或超出范围的行为。因此,整个短语可以理解为在编程过程中过分强调或追求某种特定的氛围或感觉,或者这种追求超出了适当的界限
检测:
- 完整申请材料的请求
- 庞大的行数目标(1000+行)
- 不切实际的时间表
- 未进行适当规划的范围
模式:
- "build a complete social network"
- "5000 lines of code"
- "everything in one shot"
- Missing architectural planning不实主张
检测:
- 绝对陈述,不加任何保留
- 没有出处的统计声明
- 过度自信的预测
- 缺少引文
模式:
- "always/never/definitely"
- "95% of doctors agree" (no source)
- "guaranteed to work"
- Missing uncertainty language风险等级
基于加权置信度评分计算得出:
- 低小问题,无需立即干预
- 适中值得注意的是,建议进行额外验证
- 高高度关注,建议采取干预措施
- 关键的;严重的严重风险,强烈建议采取多项干预措施
干预类型
步骤分解
复杂任务应分解为可验证的组成部分。
推荐给:
- 数学/物理推测
- 大型编码项目
- 危险的文件操作
“Human-in-the-Loop”可以翻译为“人类参与的系统”或“人机交互系统”,具体翻译取决于上下文和应用场景。这个术语通常用于描述在某个过程或系统中,人类作为关键环节参与其中,与系统进行交互或协作的情况。例如,在人工智能、自动化控制或人机工程学等领域,可能会使用“Human-in-the-Loop”来描述需要人类输入、判断或干预的系统
关键决策需要人类监督。
推荐给:
- 医疗建议
- 破坏性文件操作
- 高严重性问题
网络搜索
应通过权威来源对声明进行核实。
推荐给:
- 医疗建议
- 物理/数学理论
- 未经证实的事实主张
简化范围
过于雄心勃勃的项目需要切实可行的规划范围。
推荐给:
- 氛围编码请求
- 复杂系统设计
- 功能丰富的应用程序
配置
字符限制
默认:每条回复25,000个字符
CHARACTER_LIMIT = 25000分类能力
默认值:1,000条证据条目
MAX_EVIDENCE_ENTRIES = 1000检测灵敏度
调整检测函数中的模式匹配和置信度阈值:
def detect_math_physics_speculation(text: str) -> Dict[str, Any]:
# Modify patterns or confidence calculations
...集成示例
Claude 桌面应用程序
添加到你的 claude_desktop_config.json:
{
"mcpServers": {
"togmal": {
"command": "python",
"args": ["/path/to/togmal_mcp.py"]
}
}
}CLI 测试
# Run the server
python togmal_mcp.py
# In another terminal, test with MCP inspector
npx @modelcontextprotocol/inspector python togmal_mcp.py程序化使用
from mcp.client import Client
async def analyze_prompt(prompt: str):
async with Client("togmal") as client:
result = await client.call_tool(
"togmal_analyze_prompt",
{"prompt": prompt, "response_format": "json"}
)
return result建筑学
设计原则
- 隐私优先无外部API调用,所有处理均为本地处理
- 确定性的基于启发式算法的可重复性检测
- 低延迟实时应用的快速模式匹配
- 可扩展的易于添加新图案和类别
- 以人为本始终允许人类进行干预和判断
未来改进
该系统旨在实现渐进增强:
- 第一阶段(当前)启发式模式匹配
- 第二阶段(计划中)传统机器学习模型(聚类、异常检测)
- 第三阶段(未来)从提交的证据中进行联邦学习
- 第四阶段(高级)针对特定领域的自定义微调模型
数据流
User Prompt
↓
togmal_analyze_prompt
↓
Detection Heuristics (parallel)
├── Math/Physics
├── Medical Advice
├── File Operations
├── Vibe Coding
└── Unsupported Claims
↓
Risk Calculation
↓
Intervention Recommendations
↓
Response to Client做出贡献
添加新的检测模式
- 创建一个新的检测函数:
def detect_new_category(text: str) -> Dict[str, Any]:
patterns = {
'subcategory1': [r'pattern1', r'pattern2'],
'subcategory2': [r'pattern3']
}
# Implement detection logic
return {
'detected': bool,
'categories': list,
'confidence': float
}- 添加到CategoryType枚举类型
- 更新分析功能以包含新检测器
- 如需,请添加干预建议
提交证据
使用 togmal_submit_evidence 工具用于提供有问题的大语言模型(LLM)行为示例。这有助于提高大家的检测能力。
局限性
当前限制
- 基于启发式的方法可能存在误报/漏报
- 仅限英语针对英文文本优化的模式
- 无上下文约束的无法理解完整的对话历史
- 不学习检测规则在更新之前是静态的
并非替代品
- 在关键领域(如医学、法律等)的专业判断
- 全面的代码审查
- 安全审计
- 生产系统中的安全测试
许可证
MIT 许可证 - 详情请参阅 LICENSE 文件
支持
对于问题、疑问或贡献:
- 在GitHub上提交一个问题(或“创建一个议题”)
- 通过MCP工具提交证据
- 联系方式:\[您的联系方式\]
引用
如果您在研究或产品中使用了ToGMAL,请引用:
@software{togmal_mcp,
title={ToGMAL: Taxonomy of Generative Model Apparent Limitations},
author={[Your Name]},
year={2025},
url={https://github.com/[your-repo]/togmal-mcp}
}致谢
使用以下技术构建:
受打造更安全、更可靠的AI交互需求的启发。
