Python爬虫爬取网站新闻

本文介绍了一个Python爬虫项目,用于抓取网易新闻手机版的新闻内容。通过分析网址,爬取新闻链接,并利用requests和BeautifulSoup解析页面,提取新闻标题、时间、类别和内容。程序简单易懂,适合爬虫初学者。
摘要由CSDN通过智能技术生成

网站分析

为了方便爬取,所以选择了手机版的简版网易新闻网址。
获取新闻链接列表的网址为http://3g.163.com/touch/article/list/BA8J7DG9wangning/1-40.html
其中1-40表示获取列表的当前页数,爬取列表时只需修改页数即可。

爬取过程

获取新闻链接地址

使用requests包读取新闻列表页面,然后使用正则表达式提取出其中的新闻页面链接,返回urls列表

def getList(url):
    li = requests.get(url)
    res = r'url":"http:.*?.html'
    urls = re.findall(res,li.text)
    for i in range(len(urls)):
        urls[i] = urls[i][6:]
    return urls

获取新闻内容

使用requests获取到新闻页面的内容,然后使用BeautifulSoup包解析web内容。

def getNews(url):
    url = url[:-5]+"_0.html"
    ss = requests.get(url)
    soup = BeautifulSoup(ss.text,"html.parser")
    title = soup.title.string[:-6].encode('utf-8')
    time = soup.find("div","about").contents[0][
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值