爬虫入门学习

最新推荐文章于 2021-02-04 05:51:43 发布

qq_40287924

最新推荐文章于 2021-02-04 05:51:43 发布

阅读量324

点赞数

分类专栏：爬虫 python

爬虫同时被 2 个专栏收录

2 篇文章 0 订阅

订阅专栏

python

2 篇文章 0 订阅

订阅专栏

环境：
Python 3.6
PyCharm 2017 3.3

参考博文：
Python爬虫实战入门
http://zmister.com/archives/81.html

*先通过PyCharm的setting装点三方库

HTTP请求：requests
解析HTML响应：BeautifulSoup
pymongo
selenuim
Pillow
pytesseract
tesseract
lxml （原博文漏了）

新手-爬取腾讯新闻
1 寻找数据特征
右键标题–>审查元素（检查）
这里写图片描述

特征：div text –>em f14 –>a linkto

2 编写爬取代码

# coding:utf-8

# 引入相关模块
import requests
from bs4 import BeautifulSoup

url = "http://news.qq.com/"
# 请求腾讯新闻的URL，获取其text文本
wbdata = requests.get(url).text
# 对获取到的文本进行解析
#也可以用自带的html.parser进行：soup = BeautifulSoup(wbdata,'html.parser') 
soup = BeautifulSoup(wbdata,'lxml') 
# 从解析文件中通过select选择器定位指定的元素，返回一个列表
news_titles = soup.select("div.text > em.f14 > a.linkto")

# 对返回的列表进行遍历
for n in news_titles:
    # 提取出标题和链接信息
    title = n.get_text()
    link = n.get("href")
    data = {
        '标题':title,
        '链接':link
    }
    print(data)