文章目录
1. PageRank原理
PageRank是一种计算网页重要程度的算法,算法根据网页之间的链接,为每个网页计算一个PageRank值,值越大表明网页越重要,在搜索结果中排在更前面的位置。
1.1 简单例子
假设有4个网页,链接关系如下,A网页有到B和C网页的链接,B有到D网页的链接,其余类似。
-
初始化每个网页的PageRank为
1/N = 1/4
-
每个网页根据出链数均分自己的权值,更新所有网页的PageRank,即
- A的PageRank为0.25,则分给B和C各0.125,而A得到D分得的0.125,所以A的PageRank更新为0.125
- 同理,B更新为0.375,C更新为0.125,D更新为0.375,四个网页和仍为1
-
重复第二步直到收敛
上述迭代过程是一个马尔科夫过程,要满足收敛性,需要具备一个条件:图是强连通的,即从任意网页可以到达其他任意网页
1.2 终止点与陷阱
现实中的网页不一定是强连通的,即上述过程不一定收敛,因为存在终止点和陷阱。
终止点:指不指向任何网页的网页,即没有出链,则其前面累计的PageRank值无法分配出去,容易导致最后的结果出现很多0
陷阱:指只有指向自身的网页,即只有自环,则所有的PageRank最终会聚集到这些网页
为了避免这两种情况的影响,算法提出这样的思路——
假设上网者不是只点击网页上的链接,而是每次点完链接后,以一定概率在地址栏随机选择一个url进入,这样相当于所有网页都有可能到达任意网页,即强连通,算法即可收敛。
即更新公式为(可以理解为,多了一个网页,其权值始终为 1 − α 1-\alpha 1−α,且有到所有网页的出链)——
(1) P t + 1 ( A ) = α ∑ s ∈ S P t ( s ) N ( s ) + ( 1 − α ) 1 N S 为 所 有 网 页 的 集 合 , N ( s ) 表 示 网 页 s 的 出 链 数 , N 表 示 网 页 总 数 P_{t+1}(A)=\alpha\sum_{s \in S}\frac{P_{t}(s)}{N(s)}+(1-\alpha)\frac{1}{N}\tag{1}\\ S为所有网页的集合,N(s)表示网页s的出链数,N表示网页总数 Pt+1(A)=αs∈S<