爬虫:页面内容提取,HTML直接输出为Markdown格式,傻瓜式获取作者、发布等等信息

该博客介绍了如何从HTML页面中提取作者、发布日期和内容,并将其转换为Markdown格式。通过使用Python的`requests`、`gne`和`html2text`库,可以简单地获取并转化网页信息。示例代码展示了从CSDN博客中抓取数据并转化为Markdown的过程。
摘要由CSDN通过智能技术生成

爬虫:页面内容提取,HTML直接输出为Markdown格式,傻瓜式获取作者、发布等等信息

1. 提取HTML中的作者、发布日期与内容信息

pip install gne
# 1. 获取页面文本
import requests
import kuser_agent #pip install kuser_agent

url = 'https://blog.csdn.net/kzl_knight/category_9649204.html'
html = requests.get(url=url,headers={'User-Agent':kuser_agent.get()}).text


# 2.提取关键内容
import gne
extractor = gne.GeneralNewsExtractor()
result = extractor.extract(html)

for key in result.keys():
    print(key,':',result[key])

输出结果:

title kzl_knight的博客
author kzl
publish_time 2020-06-08 10:22:48
content 原创 …

2. 把HTML转成Markdown的文本

# 1. 获取整个页面数据
import requests
import kuser_agent
url = 'https://blog.csdn.net/kzl_knight/article/details/103187223'
html = requests.get(url=url,headers={'User-Agent':kuser_agent.get()}).content

# 2. 提取正文中的HTML文本
from bs4 import BeautifulSoup
bs = BeautifulSoup(html)
text = bs.find(attrs={'id':'article_content'}).prettify()

# 3. 将HTML文本转成Markdown格式
import html2text

ht = html2text.HTML2Text()
# 一般的参数设置
ht.bypass_tables = False
ht.mark_code = True
ht.code = True
# --------------
result = ht.handle(text)
print(result)

以下为输出结果————————————

【selenium】无界面浏览器使用代理IP

  • * 1. 代理IP的选择 
    
      1. 代码实现

1. 代理IP的选择

无界面浏览器使用的代理IP相对于urllib,requests,scrapy使用的代理要更严格
原因在于:

  1. 无界面浏览器更换代理IP没有普通模块更换那么方便,所以代理IP的生命周期尽可能要长些
  2. 无界面浏览器会加载更多的静态资源,对代理IP的并发量有压力,所以应该选择支持并发量高的代理

所以:SOCK5是无界面浏览器的首选

2. 代码实现

[code]

from selenium import webdriver
from selenium.webdriver.chrome.options import Options

设置代理

chrome_options = Options()
chrome_options.add_argument(’–proxy-server=http://119.114.77.174:24122’) # 注意这里不能有空格

driver = webdriver.Chrome(
executable_path=‘C:\Program Files (x86)\Google\Chrome\Application\chromedriver.exe’,
options=chrome_options
)

driver.get(‘http://www.baidu.com’)

[/code]

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

PYTED量化交易研究所

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值