Hadoop学习——(5) MapReduce实现PageRank

1. PageRank原理

PageRank是一种计算网页重要程度的算法,算法根据网页之间的链接,为每个网页计算一个PageRank值,值越大表明网页越重要,在搜索结果中排在更前面的位置。

1.1 简单例子

假设有4个网页,链接关系如下,A网页有到B和C网页的链接,B有到D网页的链接,其余类似。

  1. 初始化每个网页的PageRank为1/N = 1/4

  2. 每个网页根据出链数均分自己的权值,更新所有网页的PageRank,即

    • A的PageRank为0.25,则分给B和C各0.125,而A得到D分得的0.125,所以A的PageRank更新为0.125
    • 同理,B更新为0.375,C更新为0.125,D更新为0.375,四个网页和仍为1
  3. 重复第二步直到收敛

上述迭代过程是一个马尔科夫过程,要满足收敛性,需要具备一个条件:图是强连通的,即从任意网页可以到达其他任意网页

1.2 终止点与陷阱

现实中的网页不一定是强连通的,即上述过程不一定收敛,因为存在终止点陷阱

终止点:指不指向任何网页的网页,即没有出链,则其前面累计的PageRank值无法分配出去,容易导致最后的结果出现很多0

陷阱:指只有指向自身的网页,即只有自环,则所有的PageRank最终会聚集到这些网页

为了避免这两种情况的影响,算法提出这样的思路——

假设上网者不是只点击网页上的链接,而是每次点完链接后,以一定概率在地址栏随机选择一个url进入,这样相当于所有网页都有可能到达任意网页,即强连通,算法即可收敛。

即更新公式为(可以理解为,多了一个网页,其权值始终为 1 − α 1-\alpha 1α,且有到所有网页的出链)——
(1) P t + 1 ( A ) = α ∑ s ∈ S P t ( s ) N ( s ) + ( 1 − α ) 1 N S 为 所 有 网 页 的 集 合 , N ( s ) 表 示 网 页 s 的 出 链 数 , N 表 示 网 页 总 数 P_{t+1}(A)=\alpha\sum_{s \in S}\frac{P_{t}(s)}{N(s)}+(1-\alpha)\frac{1}{N}\tag{1}\\ S为所有网页的集合,N(s)表示网页s的出链数,N表示网页总数 Pt+1(A)=αsS<

  • 2
    点赞
  • 16
    收藏
    觉得还不错? 一键收藏
  • 2
    评论
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值