爬虫基本样式

from urllib import request
from  urllib import parse

#拼接URL地址函数
def get_url(word):
    baseurl="https://www.baidu.com/s?"
    #编码+拼接
    parasm=parse.urlencode({"wd":word})#编码
    url=baseurl+parasm+"&usm=3&rsv_idx=2&rsv_page=1"#&usm=3&rsv_idx=2&rsv_page=1 PY百度请求百度安全验证的问题
    return url

#请求+保存
def write_html(url,word):
    headers={"User-Agent":"Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Win64; x64; Trident/5.0; .NET CLR 2.0.50727; SLCC2; .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; InfoPath.3; .NET4.0C; Tablet PC 2.0; .NET4.0E)"}
    req=request.Request(url=url,headers=headers)#创建请求对象
    res=request.urlopen(req)#获取响应对象
    html=res.read().decode()

    filename=word+".html"
    with open(filename,"w",encoding="utf-8") as f:
        f.write(html)

if __name__ == '__main__':
    word=input("请输入你要查询的内容:")
    url=get_url(word)
    write_html(url,word)
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值