ahel is live on Product Hunt today. Upvote

试验展开概述 Skill

SkillAI & models

'AI Native 产品方法论, , 试验展开概述的实操 Skill。

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the 试验展开概述 Skill skill

What this skill tells your AI

The instructions your AI receives, as published by gmaxxxie/ai-native-product-agent-skills in skills/p2a-experiment-overview/SKILL.md and read by ahel’s review.

使用场景

  • 方向定界已完成,需要进入试验展开阶段
  • 需要设计一套可验证、可比较、可放弃、可继承的实验体系
  • 需要理解能力实验、产品实验、商业实验三层关系

核心概念

  • 能力实验:验证某项 AI 能力在真实任务中是否成立
  • 产品实验:验证用户是否愿意以某种交互或流程使用这项能力
  • 商业实验:验证客户是否愿意为这类能力投入预算或试点资源
  • 评估(Evaluation):用样本、对照和失败案例判断能力是否成立

三层实验关系

能力实验(技术上限)
  → 产品实验(用户接受度)
    → 商业实验(价值密度)
      → 实验结论报告

能力实验是基础:先确认 AI 能力能否做到,再验证用户是否愿意用,最后验证客户是否愿意付费。

第一步:资料准备评估

试验前必须确认四类资料:

资料类型内容评估标准
外部资料行业知识、公开规则、产品文档覆盖度 > 80%
内部业务资料SOP、历史工单、对话记录代表性样本 > 200条
样本集正例、负例、边界案例、长尾问题边界案例 > 20%
评估标准(Rubric)什么算对、什么算错、什么算可接受已明确定义

资料不足时,应先补充资料,而非直接开始实验。

第二步:能力实验设计

原则:先用最强模型看能力上限,再压缩成本

  1. 用最强模型(GPT-4o/Claude Opus)测试能力天花板
  2. 确定能力上限足够高后,再用更便宜模型测试能否保住目标效果
  3. 如果最强模型也无法达到可接受水平,应放弃或重新定义问题

能力实验要验证的问题

  • AI 到底能做到什么深度
  • 哪些场景能够稳定成立
  • 哪些场景只能做到辅助,不能做到自动化
  • 哪些场景即使技术可行,也没有足够高的价值密度

第三步:产品实验设计

验证用户是否愿意以某种交互或流程使用这项能力:

  • 用户如何表达目标
  • 系统如何展示状态和建议
  • 用户如何纠偏或确认
  • 任务完成率和满意度

第四步:商业实验设计

验证价值密度:

  • 客户是否愿意付费试点
  • 续期意愿如何
  • 场景扩展可能性
  • 与现有解决方案的成本对比

第五步:建立评估 Rubric

评估不是看主观感觉,必须量化:

  • 准确率:正确输出 / 总输出
  • 边界案例通过率:长尾问题中正确处理的比例
  • 采纳率:用户接受 AI 建议的比例
  • 效率提升:相比纯人工的时长缩短比例

输出物:试验展开总体方案

  1. 资料准备清单:四类资料的覆盖度和缺口
  2. 能力实验方案:实验批次、模型选择、成功标准
  3. 产品实验方案:交互形式、验证指标
  4. 商业实验方案:定价假设、试点设计
  5. 评估 Rubric:定义明确的量化指标
  6. 实验节奏:各层实验的时间安排

与其他 Skill 的关系

  • 前置:@ai-native-direction-framing(提供 Direction Brief)
  • 后置:@p2b-product-form-exploration、@p2c-process-redesign、@p2d-convergence-decision、@p2e-shadow-validation(覆盖5个子阶段)
  • 协同:@ai-native-experiment-engine(整体包覆版,仍可独立使用)

示例

用户输入

"我们已完成方向定界,Direction Brief 是 AI 客服协同系统,需要设计试验展开方案"

Skill 执行

资料准备评估:
  已有: FAQ(500条)、工单样本(1000条)、物流规则文档
  缺口: 边界案例(仅8%)、情绪问题样本(缺失)
  建议: 补充100条边界案例和50条情绪问题样本后再开始实验

能力实验方案:
  第1批: GPT-4o 测试订单查询/物流解释/售后政策(目标>85%准确率)
  第2批: 边界案例测试(目标>70%通过率)
  第3批: 压缩成本测试(GPT-4o-mini,目标保住85%效果)

产品实验方案:
  形式: Copilot 影子模式(建议+人工确认)
  指标: 采纳率>60%、满意度>80分

商业实验方案:
  试点设计: 2个部门3个月试点
  定价锚: 首响时间缩短X分钟,培训周期缩短Y天

实验节奏:
  第1-2周: 补充资料
  第3-4周: 能力实验
  第5-6周: 产品实验
  第7周: 商业验证
  第8周: 汇总实验结论报告

Signals

GitHub stars
46
Last commit
Sep 2026
Advanced
Catalog kind
skill
Gateway key
p2a-experiment-overview
Source
github.com/gmaxxxie/ai-native-product-agent-skills