A/B测试的理解和常见问题

在互联网公司,A/B测试是验证新模、新功能新产品是否有效,新算法、新模型是否有提升,新设计是否受用户欢迎,新更改是否改善用户体验的主要测试方法

1.在对模型进行离线评估之后,为什么需要进行在线A/B测试?

(1)离线评估无法完全消除模型过拟合的影响。因此,得出的离线结果无法完全代替线上评估结果。
(2)离线评估无法完全还原线上的工程环境。
(3)线上系统的某些商业指标在离线评估中无法计算。离线评估是针对模型本身,而与模型相关的其他指标,特别是商业指标,往往无法直接获得。例如,新开发的推荐算法,离线评估往往关注的是ROC曲线,P-R曲线等改进,而线上评估可以全面了解该推荐算法带来的用户点击率、留存时长、PV访问量等变化。

2.如何进行A/B测试?

简单的来说,对用户/样本/数据等进行分组,即分成实验组和对照组,对实验组施以新模型/新方法/新产品/新功能等,对照组施以旧模型/旧方法/旧产品/旧功能/。在分组的时候要注意样本的独立性和采样的无偏性。
样本的独立性和采样的无偏性是指,同一个数据或者样本、用户每次只能被分到同一个组中,且两个组之间无统计意义上的差别。例如,我们测试用户对某新改进的产品如游戏是否更兴趣,那么划分的试验组和对照组里面用户的群体应该是无偏的,两组中用户的年龄,职业,兴趣,爱好等应该尽量相同,极端点如果实验组中全是热爱游戏的年轻人,对照组是不玩游戏的老人,那么这样测试就毫无意义。

3.背后的统计学原理

A/B测试中最重要的一步其实是如何让我们划分实验组和对照组具有无偏性,如果数据不是无偏,则结论就无法确认是否成立。
大多是产品部门进行A/B测试主要目的是为了新的方法或者产品是否在统计上显著改变了其需要的指标,例如用户的转换率,留存时长。而指标是否发生了显著性改变是通过统计推断的方法两个总体或多个总体间的假设检验进行的。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值