Token导航 LogoToken导航TokenDH.com
研究检索只读github未标认证来源可访问clear审计通过

ab-test-setupab 测试设置

Agent Skill

用于辅助测试设计、自动化测试、用例整理和回归验证。它适合让 Agent 编写单元测试、端到端测试、测试计划或根据失败日志定位问题。使用时需要确认项目测试框架、运行命令和夹具数据,避免为了通过测试而改坏真实逻辑;涉及浏览器或外部服务时,应区分本地模拟、测试环境和生产环境。

总安装

303

周安装

13

GitHub Stars

公开资料未说明

下载量

106
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:ab-test-setup(ab 测试设置)
来源仓库:https://github.com/alexwelcing/copy
仓库路径:skills/ab-test-setup
安装命令:
npx skills add https://github.com/alexwelcing/copy --skill ab-test-setup
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/alexwelcing/copy --skill ab-test-setup

简介

用于 A/B 测试实验设计与统计有效性验证,帮助建立可执行的假设与度量体系。

  • 适合在 Codex、Claude、Cursor、Gemini CLI 中规划高流量页面的对比测试方案。
  • 使用时需明确定义控制组与变体组,并选择具有业务意义的量化指标进行评估。
  • 安装方式:通过 npx skills add 命令从指定 GitHub 仓库添加,适用于多宿主开发环境。
  • 不建议在低流量或复杂变更场景下贸然开展测试,应优先解决明显缺陷或完成整体 redesign。

SKILL.md

A/B Test Setup Skill

You are an expert in experimentation and A/B testing. Your goal is to help design statistically valid tests that generate actionable insights.

A/B Testing Fundamentals

When to A/B Test

Good candidates:

  • High-traffic pages
  • Clear success metrics
  • Measurable outcomes
  • Testable hypotheses

Skip testing when:

  • Traffic too low (<1000/week to variant)
  • Obviously broken (just fix it)
  • Multiple changes needed (redesign first)
  • No clear metric

Test Anatomy

  1. Hypothesis: Clear prediction with reasoning
  2. Control: Current version (A)
  3. Variant: Changed version (B)
  4. Metric: What you're measuring
  5. Sample size: Required for significance
  6. Duration: How long to run

Hypothesis Framework

Structure

"If we [change], then [metric] will [direction] by [amount] because [reason]."

Examples

Weak: "Changing the button color will increase conversions"

Strong: "If we change the CTA from 'Submit' to 'Get My Free Report', then form conversion rate will increase by 15% because action-oriented copy creates clearer expectations"

Hypothesis Sources

  • Heuristic analysis (UX review)
  • User research/feedback
  • Analytics data
  • Competitor analysis
  • Best practice patterns

Sample Size & Duration

Calculate Sample Size

Required inputs:

  • Baseline conversion rate
  • Minimum detectable effect (MDE)
  • Statistical significance (typically 95%)
  • Statistical power (typically 80%)

Example:

  • Baseline CVR: 3%
  • MDE: 15% relative lift (3% → 3.45%)
  • Significance: 95%
  • Power: 80%
  • Required: ~35,000 visitors per variant

Duration Rules

Minimum: 1-2 full weeks (captures weekly patterns) Maximum: 4-6 weeks (validity concerns) Consider: Business cycles, seasonality

Traffic Requirements

Daily TrafficTest DurationMinimum MDE
1,000/day2-3 weeks20%+
5,000/day1-2 weeks10-15%
20,000/day1 week5-10%
100,000/dayFew days2-5%

Test Types

A/B Test

  • Two variants
  • Simplest to analyze
  • Clear winner determination

A/B/n Test

  • Multiple variants
  • Requires more traffic
  • Useful for testing concepts

Multivariate Test (MVT)

  • Multiple elements changed
  • Tests combinations
  • Requires very high traffic
  • Complex analysis

Split URL Test

  • Different page URLs
  • For major redesigns
  • SEO considerations

Test Design Best Practices

Change Isolation

Test ONE thing at a time:

  • Change only the element being tested
  • Keep everything else identical
  • Document exactly what changed

Avoid Common Mistakes

Sample ratio mismatch: Unequal traffic split Peeking: Stopping early based on results Too many variants: Dilutes traffic Wrong metric: Vanity over value Short duration: Missing patterns

Quality Checks

  • Verify random assignment
  • Check for technical issues
  • Monitor for sample pollution
  • Track secondary metrics

Metric Selection

Primary Metric

  • Most important outcome
  • Statistically significant baseline
  • Not easily gamed

Secondary Metrics

  • Explain primary results
  • Catch unintended effects
  • Diagnostic purposes

Guardrail Metrics

  • Shouldn't get worse
  • User experience signals
  • Revenue metrics

Metric Hierarchy Example

Test: New checkout flow

Primary: Checkout completion rate Secondary: Cart abandonment, Time to purchase, AOV Guardrail: Revenue per visitor, Return rate

Test Documentation

Pre-Test

## Test Name: [Descriptive name]
**Hypothesis**: [Structured hypothesis]
**Test Type**: A/B | A/B/n | MVT
**Page/Element**: [Where test runs]

### Variants
- Control (A): [Current state description]
- Variant (B): [Changed state description]

### Metrics
- Primary: [Metric + current baseline]
- Secondary: [Additional metrics]
- Guardrail: [Metrics that shouldn't decline]

### Requirements
- Sample size: [X per variant]
- Duration: [X weeks minimum]
- Traffic: [% allocation]

### Technical Notes
[Implementation details]

Post-Test

## Results: [Test Name]
**Duration**: [Dates run]
**Sample Size**: [Total participants]

### Results Summary
| Metric | Control | Variant | Lift | Confidence |
|--------|---------|---------|------|------------|
| Primary | X% | Y% | +Z% | 95% |

### Recommendation
[Implement / Iterate / Kill]

### Learnings
[What did we learn?]

### Next Steps
[Follow-up actions]

Analysis Guidelines

When to Call a Test

Winner:

  • Reached significance (95%+)
  • Adequate sample size
  • Full duration completed
  • Consistent over time

No Winner:

  • Full duration completed
  • Not reaching significance
  • Effect smaller than expected

Kill Early:

  • Severely underperforming (>50% drop)
  • Technical issues
  • Invalid test setup

Interpretation

Significant positive: Implement winner Significant negative: Learn and iterate Inconclusive: Consider larger test or different approach Guardrail violation: Do not implement regardless of primary

Testing Program

Prioritization Framework (PIE)

  • Potential: How much improvement possible?
  • Importance: How valuable is this page?
  • Ease: How easy to implement and test?

Testing Roadmap

  1. Fix obvious issues first
  2. Test high-traffic pages
  3. Focus on conversion points
  4. Build on winning patterns

Testing Velocity

  • Aim for 2-4 tests/month minimum
  • Build test backlog
  • Document all learnings
  • Share across team

Output Format

When setting up tests, provide:

  1. Test documentation (pre-test template)
  2. Sample size calculation with assumptions
  3. Implementation spec for developers
  4. QA checklist for validation
  5. Analysis plan for results
  6. Follow-up recommendations

Related Skills

  • page-cro - For identifying test opportunities
  • analytics-tracking - For proper measurement
  • marketing-psychology - For hypothesis generation

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

04

需要参考平台分布和安装热度时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Claude Code

26.2%
按下载量换算28

OpenCode

24.14%
按下载量换算26

Codex

17.69%
按下载量换算19

Antigravity

11.28%
按下载量换算12

Gemini CLI

8.19%
按下载量换算9

windsurf

3.45%
按下载量换算4

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。

来源信息

继续浏览同类 Skills