PageRank简单实现中的一个错误

在我的一篇博客PageRank中,在5.1 算法实现中简单实现部分原本是有一个错误的。这个错误也体现出我当时对PageRank算法有理解上的偏差。


这是个什么样的错误呢?是这样的:

简单实现中计算每个网页的PR值时使用的是最原始的方法,即下面的这个公式:

PR(pi)=αpjMpiPR(pj)L(pj)+(1α)N

这个公式要求所有网页的PR值之和为1。而我原本的代码中给每个网页赋予的初始PR值的代码为:

page_rank = dict.fromkeys(nodes, 1.0)  # 给每个节点赋予初始的PR值

也就是说,我给出的初始PR值之和为5(例子中共有5个网页)。

犯这个错误的原因是我理解错了“ P0 的选取无关”这句话。正确的理解应该是:“ P0 的初始概率分布无关”。


然而,我理解错了也还有另一个原因,那就是我原来的程序中不管给出的初始PR值是多少,最终的PR值都是一样的。现分析如下:

按照我原本的程序逻辑,我使用的公式应该是这样的,其中 G 为所有网页:

PR(pi)=αpjMpiPR(pj)L(pj)+(1α)NpkGPR(pk)

而我却使用了最原始的公式,造成了:

PR(1α)N(PR1)PR(1α)(PR1)

现假设初始PR值总和为 A0 ,则有:

PRA0PRA1=A0(1α)(A01)=αA0+1αAn=αAn1+1αAn1=α(An11)An1=αn(A01)An=αn(A01)+1α<1limnAn=1

即不管初始PR值为多少,最终其和都将趋于1(若初始值之和小于1,用相似的方法可以证明)。也就是说,最终结果是一样的(因为最终趋于1之后就相当于以“PR值总和为1”的情况又开始了计算)。这一点在代码中也有体现:当PR值设置得很大的时候,需要迭代的次数也相应增大。


总结:应该使用最上面的公式,同时初始PR值总和应该设置为1。

  • 3
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值