网页几秒刷新一次_设计网页爬虫(web crawler)

本文参考自:https://github.com/donnemartin/system-design-primer/blob/master/solutions/system_design/web_crawler/README.md

作者也有添加自己想法。

第一步:为用户需求和约束列出大纲

用户需求

  1. 服务: 爬一系列URL
    1. 生成页面的反向索引(https://en.wikipedia.org/wiki/Reverse_index)与关键词
    2. 生成页面标题与缩略图,这些内容是静态的,不会随着搜索而变化
    3. 具有高可用性high availability
  2. 用户: 输入一个搜索关键词,然后可以看到所有相关页面的列表

约束和假设

状态假设

  1. 流量不是均匀分布。有些搜索很热门,有些就不是。
  2. 只支持匿名用户,换言之,不会存储用户登录信息以及个性化内容。
  3. 生成搜索结果应该很快。
  4. 网页爬虫不应该死循环。通常,如果URL 链接graph有一个cycle,就会陷入死循环。
  5. 1 billion 个URL等待爬取
    1. 每个页面应该有规律的被爬取,这样可以保证页面的新鲜。
    2. 平均起来,每个页面每周应该被刷新一次,更加流行的网页会刷新的更频繁。每个月会爬取4 million页面。
    3. 平均每个页面占据500KB。
  6. 每个月会有100million次搜索。

计算使用

  1. 每个月需要2PB存储空间
    1. 500KB x 4 billion
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值