ahel is live on Product Hunt today. Upvote

影子验证 Skill

SkillAI & models

'AI Native 产品方法论, , 影子验证的实操 Skill。

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the 影子验证 Skill skill

What this skill tells your AI

The instructions your AI receives, as published by gmaxxxie/ai-native-product-agent-skills in skills/p2e-shadow-validation/SKILL.md and read by ahel’s review.

使用场景

  • 收敛决策已完成,需要在真实环境中验证系统是否具备进入工程化的条件
  • 离线实验效果良好,但不确定真实流量下表现是否一致
  • 需要为审计放行准备真实的、可量化的证据

核心概念

  • 影子验证(Shadow Validation):让 AI 在真实场景中并行运行,但暂不直接接管业务结果
  • 影子系统(Shadow System):承载这种验证方式的系统形态,与人工流程并行存在
  • 离线评估:在样本集上检验能力边界
  • 灰度上线:让系统在有限真实范围内直接影响业务结果

影子验证 vs 其他验证方式

验证方式真实性风险证据质量适用阶段
离线评估最低中(样本偏差)能力实验
影子验证高(真实流量)放行前验证
灰度上线最高生产运行

影子验证流程

收敛决策通过
  → 影子系统设计
    → 并行运行方案
      → 人工对比机制
        → 失败模式沉淀
          → 审计放行证据
            → 灰度上线 / 继续影子验证

第一步:影子系统设计

影子系统的核心设计原则:

  1. 输出可见但不执行:AI 给出建议,但业务动作仍由人工执行
  2. 完整记录:每次 AI 输出都记录,包括输入、上下文、置信度、人工对比结果
  3. 可开关:发现重大问题时能快速切换到纯人工模式

影子系统架构

真实工单进入
  → 人工流程(正常执行)
    → 影子系统(并行生成建议)
      → 建议存储(不外发)
        → 周度人工对比
          → 失败模式沉淀
            → 系统优化

第二步:并行运行方案

运行参数设计:

参数设计理由
并行比例从5%开始,逐步扩到50%控制初期风险
场景筛选先从低风险场景开始避免高风险场景先行暴雷
扩量节奏采纳率连续2周>60%再扩确保质量稳定后再放量
熔断机制连续3次高风险误判自动暂停防止持续出错

第三步:人工对比机制

每周人工对比:

  • 随机抽取影子系统建议(≥50条)
  • 人工标注:正确 / 可接受 / 错误 / 风险误判
  • 计算采纳率、错误率、风险漏过率

第四步:失败模式沉淀

每次对比后沉淀失败案例:

失败类型数量占比根因改进方向
上下文丢失1224%会话状态未保留补充记忆系统
风险漏过510%边界规则不完善收紧风险规则
知识缺失816%知识库覆盖不足补充知识库

第五步:审计放行证据准备

影子验证报告需包含:

  1. 运行概况:并行时长、工单量、场景分布
  2. 质量指标:采纳率、错误率、风险漏过率
  3. 失败模式分析:Top失败类型及根因
  4. 与离线评估对比:是否出现离线未发现的问题
  5. 放行建议:是否具备进入工程化/灰度上线条件

输出物:影子验证报告

  1. 影子系统配置:并行比例、场景选择、熔断规则
  2. 质量趋势图:采纳率、错误率随时间的变化
  3. 失败模式报告:Top问题、根因和改进建议
  4. 审计放行证据包:符合 @ai-native-audit-release 输入要求的完整证据

与其他 Skill 的关系

  • 前置:@p2d-convergence-decision(收敛决策通过)
  • 后置:@ai-native-audit-release(审计放行输入)、@ai-native-system-building(通过后进入工程化)
  • 协同:@ai-native-production-ops(生产环境准备)

示例

用户输入

"客服 Copilot 收敛决策通过,准备进入影子验证"

Skill 执行

影子系统设计:
  架构: 侧边栏建议面板(不外发)
  记录: 每次建议+人工对比+采纳标记
  熔断: 连续3次赔付类误判自动暂停

并行运行方案:
  第1周: 5%工单(低风险场景:订单查询)
  第2周: 20%工单(+物流解释)
  第3周: 50%工单(全场景)
  扩量条件: 采纳率连续2周>65%

人工对比(第1周结果):
  样本: 60条
  采纳率: 68%
  错误率: 12%(主要:上下文丢失)
  风险漏过率: 5%(主要:退款承诺)

失败模式:
  Top1: 多轮上下文丢失(35%)→ 补充会话状态设计
  Top2: 退款承诺误判(25%)→ 增加规则拦截
  Top3: 知识库缺失(20%)→ 补充200条FAQ

审计放行证据:
  ✅ 采纳率68% > 60%阈值
  ⚠️ 风险漏过率5%(需强化规则后再放行高风险场景)
  建议: 低风险场景先行灰度,高风险场景继续影子

Signals

GitHub stars
46
Last commit
Sep 2026
Advanced
Catalog kind
skill
Gateway key
p2e-shadow-validation
Source
github.com/gmaxxxie/ai-native-product-agent-skills