GrowthLab

基于 LangGraph 编排的多智能体增长实验平台 — 自动运行「策略→执行→A/B测试→复盘」闭环,3 轮实验迭代优化 AARRR 漏斗

LangGraph Multi-Agent DeepSeek API A/B Testing z-test + 95% CI Python
系统架构
🧠 策略师
分析漏斗 + 提假设
✅ 门控
lift < 50%?
📋 执行官
A/B 方案 + 埋点
✅ 门控
字段完整?
📊 分析师
统计检验 + 解读
✅ 门控
p值合理?
📝 复盘官
学习 + 下一步
✅ 门控
结论有效?
🎲 ab_test.py
伯努利采样 + z检验 + CI
📋 funnel.json
AARRR 漏斗基线
📚 experiments.json
历史实验记录
🔄 复盘结论回传策略师 → 开启下一轮(共 3 轮迭代)| RETRY → 重试当前 Agent | STOP → 终止流程
AARRR 增长漏斗
广告曝光 → App下载 6%
▼ -48%
下载 → 注册完成 52%
▼ -17%
注册 → 首周活跃 ⚠ 35%
▼ -27%
活跃 → 付费订阅 8%
▼ +64%
付费 → 次月续费 72%
Acquisition
广告曝光 → 下载
6%
Activation
下载 → 注册
52%
Activation
注册 → 首周活跃
痛点
35%
Revenue
活跃 → 付费
8%
Retention
付费 → 续费
72%
3 轮 A/B 实验结果
Round 1 推全量
新用户引导流程优化
简化引导流程,3步内完成个性化歌单推荐 → 提升注册→首周活跃转化率
Lift
+17.0%
P-Value
< 0.001
95% CI: [13.9%, 20.1%] ✓ 显著
0%25%50%
简化引导 + 前置个性化价值展示有效。实际提升低于预期25%,引导优化非唯一瓶颈因素。
Round 2 继续迭代
个性化歌单推荐优化
基于用户首次听歌行为实时生成推荐歌单 → 进一步提升激活转化
Lift
+6.9%
P-Value
< 0.001
95% CI: [3.9%, 10.0%] ✓ 显著
0%25%50%
叠加个性化推荐边际收益递减。瓶颈从“快速呈现价值”转向“推荐质量与精准度”。
Round 3 推全量
沉默用户 Push 唤醒
7日未登录用户推送个性化歌单 + 限时VIP福利 → 召回沉默用户提升激活率
Lift
+12.1%
P-Value
< 0.001
95% CI: [9.0%, 15.2%] ✓ 显著
0%25%50%
外部触达(Push)是有效的激活补充策略。单次Push效果有上限,需分层多次触达。
📈 数据可视化

Lift 对比 + 置信区间

预期 vs 实际提升

📍 埋点方案设计

每轮实验由执行官 Agent 自动生成埋点清单,覆盖实验关键路径的核心事件。

Round 1 · 引导优化
onboarding_start
onboarding_step_complete
onboarding_complete
personalized_playlist_gen
first_song_play
Round 2 · 个性化推荐
playlist_exposed
playlist_click
first_song_in_playlist
playlist_completion_rate
weekly_active_check
Round 3 · Push 唤醒
push_sent
push_click
vip_trial_claimed
reactivation_session
7d_retention_check
🛡 三级门控机制
Agent 校验规则 PASS 条件 RETRY 触发 STOP 触发
策略师 lift 合理性 + 字段完整 + 策略不重复 expected_lift ≤ 50% lift > 50% 疑似幻觉 重试 ≥ 2 次
执行官 埋点数量 + 样本量 + 必需字段 tracking ≥ 2 & sample ≥ 1000 埋点不足 / 字段缺失 重试 ≥ 2 次
分析师 p值范围 + lift方向一致性 + 字段完整 0 ≤ p ≤ 1 & 方向一致 p值异常 / lift矛盾 重试 ≥ 2 次
复盘官 结论四选一 + 学习实质 + 下一步方向 verdict ∈ 4 个有效值 结论无效 / 字段缺失 重试 ≥ 2 次