昊梵体育网

A/B测试明明赢了,产品为什么还会错?

2025 年 4 月,OpenAI 上线了一版新的 GPT 4o。上线前 offline eval 整体不错,A/B Test 里提前试用的一小部分用户也更喜欢它,但内部一些 expert testers 已经觉得模型“felt slightly off”,主要担心它的 tone 和 style。

OpenAI 最后选择上线。几天以后,因为模型变得过度 agreeable、flattering,紧急 rollback。官方复盘后来直接承认:这个决定错了。

这件事让我重新想“data driven”到底是什么意思。

A/B Test 本身没有算错。它准确回答了一个被问出来的问题:那批实验用户当下更喜欢哪个版本。可“更喜欢这次交互”和“这个模型长期更值得信任”,不是一回事。

Microsoft 做了很多年 experimentation,也一直研究 OEC 和长期价值之间的关系。一个很经典的例子是,搜索结果变差以后,用户可能被迫搜更多次。如果 KPI 是 query 数,指标甚至会告诉你产品进步了。

所以很多时候不是 data 错,也不是实验错,而是我们选择的 metric 没有完整代表真正的 goal。

更有意思的是,连以实验文化出名的字节,自己的公开材料都明确写“不唯数据论”。Booking.com 和 Netflix 也没有因为大量做 A/B Test 就只剩按钮颜色优化,他们同样会测试 radical redesign 和长期产品假设。

我现在更愿意把产品决策理解成一个循环:judgment 帮你提出值得测试的问题,experiment 帮你发现 judgment 哪里错了,qualitative signal 帮你发现 metric 没看到的东西,然后再把它变成下一轮可以验证的新 hypothesis。

所以“Show me the data”当然没错。我现在只是会多问一句:你到底让数据回答了什么问题?

#产品经理 #数据分析 #AB测试 #产品设计 #人工智能
#数据驱动 #产品决策 #实验文化 #指标设计 #AI产品