迪斯科
在表格数据中找到新颖的、经过统计验证的模式 --特征交互、亚组效应和人类和代理错过的条件关系。
 
由...制作 Leap实验室.
______________________________________________________________________
它实际上做了什么
大多数数据分析都是从一个问题开始的。Disco从数据开始。
在没有偏见或假设的情况下,它发现了显著改变目标列的特征条件组合,比如“45-65岁低HDL患者” *和* 高CRP的再入院率是3倍”——你不需要先假设这种相互作用。
每种模式都是:
- 在搁置集上验证 --增加了泛化的机会
- FDR已纠正 --包括p值,针对多次测试进行了调整
- 与学术文献对照 --帮助你理解你的发现,并确定它是否新颖。
输出是结构化的:条件、效果大小、p值、引用以及每个发现的模式的新颖性分类。
在以下情况下使用它: “相对于X,哪些变量最重要”,“我们缺少哪些模式?”,“我不知道从哪里开始处理这些数据”,“需要了解A和B是如何影响C的”。
不适用于: 摘要统计、可视化、过滤、SQL查询——使用pandas
______________________________________________________________________
快速入门
pip install discovery-engine-api获取API密钥:
# Step 1: request verification code (no password, no card)
curl -X POST https://disco.leap-labs.com/api/signup \
-H "Content-Type: application/json" \
-d '{"email": "you@example.com"}'
# Step 2: submit code from email → get key
curl -X POST https://disco.leap-labs.com/api/signup/verify \
-H "Content-Type: application/json" \
-d '{"email": "you@example.com", "code": "123456"}'
# → {"key": "disco_...", "credits": 10, "tier": "free_tier"}或者在以下位置创建密钥 disco.leap-labs.com/开发者.
进行第一次分析:
from discovery import Engine
engine = Engine(api_key="disco_...")
result = await engine.discover(
file="data.csv",
target_column="outcome",
)
for pattern in result.patterns:
if pattern.p_value 完整的指导和示例: [技能.md](SKILL.md#preparing-your-data)
______________________________________________________________________
## 参数
await engine.discover( file="data.csv", # path, Path, or pd.DataFrame target_column="outcome", # column to predict/explain analysis_depth=2, # 2=default, higher=deeper analysis, lower = faster and cheaper visibility="public", # "public" (always free, data and report is published) or "private" (costs credits) column_descriptions={ # improves pattern explanations and literature context "bmi": "Body mass index", "hdl": "HDL cholesterol in mg/dL", }, excluded_columns=["id", "timestamp"], # see "Preparing your data" above use_llms=False, # Defaults to False. If True, runs are slower and more expensive, but you get smarter pre-processing, summary page, literature context and novelty assessment. Public runs always use LLMs. title="My dataset", description="...", # improves pattern explanations and literature context )
> 公开跑步是免费的,但结果会公布。集 `visibility="private"` 对于私人数据,这需要信用额度。
______________________________________________________________________
## 异步运行
跑步需要几分钟。对于并行执行其他工作的代理工作流或脚本:
Submit without waiting
run = await engine.run_async(file="data.csv", target_column="outcome", wait=False) print(f"Submitted {run.run_id}, continuing...")
... do other things ...
result = await engine.wait_for_completion(run.run_id, timeout=1800)
对于同步脚本和Jupyter笔记本:
result = engine.run(file="data.csv", target_column="outcome", wait=True)
or: pip install discovery-engine-api[jupyter] for notebook compatibility
______________________________________________________________________
## MCP服务器
Disco可作为MCP服务器使用,无需本地安装。
{ "mcpServers": { "discovery-engine": { "url": "https://disco.leap-labs.com/mcp", "env": { "DISCOVERY_API_KEY": "disco_..." } } } }
工具: `discovery_list_plans`, `discovery_estimate`, `discovery_upload`, `discovery_analyze`, `discovery_status`, `discovery_get_results`, `discovery_account`, `discovery_signup`, `discovery_signup_verify`, `discovery_login`, `discovery_login_verify`, `discovery_add_payment_method`, `discovery_subscribe`, `discovery_purchase_credits`.
→ [完整的代理技能档案](SKILL.md)
______________________________________________________________________
## 定价
||成本|
|---|---|
|公开运行|免费-结果和数据已发布|
|私人跑步|积分因文件大小和配置而异——使用 `engine.estimate()` |
|免费等级| 10学分/月,无需卡|
|研究员| 49美元/月——500学分|
|团队| 199美元/月——2000学分|
|学分|每学分0.10美元|
运行前估计:
estimate = await engine.estimate(file_size_mb=10.5, num_columns=25, analysis_depth=2, visibility="private")
estimate["cost"]["credits"] → 55
estimate["account"]["sufficient"] → True/False
账户管理完全是程序化的-通过SDK或REST API附加付款方式、订阅计划和购买信用。看 [Python SDK参考](docs/python-sdk.md#account-management) 或 [技能.md](SKILL.md#paying-for-credits-programmatic).
______________________________________________________________________
## 预期数据格式
迪斯科期待 **扁平表** --列代表特征,行代表样本。
| patient_id | age | bmi | smoker | outcome |
|---|---|---|---|---|
| 001 | 52 | 28.3 | yes | 1 |
| 002 | 34 | 22.1 | no | 0 |
| ... | ... | ... | ... | ... |
- **每次观察一行** --病人、样本、交易、测量等。
- **每个特征一列** --数字、分类、日期时间或自由文本都可以
- **一个目标列** --你想了解的结果。必须至少有两个不同的值。
- **缺失值正常** --Disco会自动处理它们。不要事先掉线或妄下结论。
- **无需旋转** --如果你的数据已经在一个平面表中,那么它就可以使用了
**支持的格式:** CSV、TSV、Excel(.xlsx)、JSON、拼花游戏、ARFF、羽毛游戏。最大5 GB。
**不支持:** 图像、原始文本文档、嵌套/分层JSON、多页Excel(使用第一页或导出为CSV)
______________________________________________________________________
## 与其他工具相比
|目标|工具|
|---|---|
|汇总统计、数据质量|ydata分析、sweetviz|
|预测模型|AutoML(自动sklearn、TPOT、H2O)|
|快速相关性|大熊猫、海兔|
|回答一个关于数据的具体问题|ChatGPT,克劳德|
| **找到你不知道要找的东西** | **迪斯科** |
Disco并不是EDA或AutoML的替代品——它能找到这些工具错过的模式 [测试了18个数据分析工具](https://www.leap-labs.com/research/the-patterns-that-agents-miss) 在具有已知地面真实模式的数据集上。大多数人自信地报告了错误的结果。迪斯科是唯一找到所有模式的。
______________________________________________________________________
## 链接
- [仪表板](https://disco.leap-labs.com)
- [API密钥](https://disco.leap-labs.com/developers)
- [PyPI上的Python SDK](https://pypi.org/project/discovery-engine-api/)
- [Python SDK参考](docs/python-sdk.md)
- [OpenAPI规范](https://disco.leap-labs.com/.well-known/openapi.json)
- [代理人/MCP文件](SKILL.md)
- [LLM友好参考](llms.txt)
- [OpenAPI规范](https://disco.leap-labs.com/.well-known/openapi.json)
- [OpenAPI规范(在仓库中)](docs/openapi.json)
- [公众报告库](https://disco.leap-labs.com/discover)
______________________________________________________________________