Python爬取知乎日报,推送到kindle

最近刷知乎上瘾,刚好手头有一台kindle,搞一波事情。

1.分析页面

知乎日报 的网页端结果比较清晰,每篇的文章的链接都在 link-button  这个 a 标签中。用requests + BeautifulSoup 库可以比较轻松的解析。

import requests
import re
from bs4 import BeautifulSoup
import os
import os.path
import pdfkit
from  save_as_pdf import  save_pdf
from os_test import send_email

    def __init__(self):
        self.home_url = 'http://daily.zhihu.com'
        self.headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/60.0.3112.101 Safari/537.36'}

    def home_html(self):
        content = requests.get(self.home_url,headers = self.headers)
        all_href = BeautifulSoup(content.text,'html5lib').find_all('a',class_ = 'link-button')
        for href in all_href:
            url = self.home_url + href['href']
            self.story_html(url)

2.保存页面到本地

很多答案都有图片,所以保存为txt文件答案会不完整,这里选择直接保存为pdf文件,关于pdf有很多第三方库,这里主要用了 pdfkit 这个库,关于这个库的使用可以参考官方文档.可以直接通过网址制作pdf文件。

import pdfkit
import os

def save_pdf(url,path):
    os.chdir(r'G:\python\zhihu\ribao\content')
    file_name = str(path) + '.pdf'
    if os.path.exists(file_name):
        pass
    else:
        print(file_name)
        pdfkit.from_url(url,file_name)

3.推送文件至kindle

  • kindle可以由邮件推送或usb传输,这里模拟通过邮件推送。
  • 通过邮件推送时,将邮件标题设置为‘convert’ ,amazon云端就会自动将pdf格式转换,但是文件大小不能超过50mb
  • kindle的邮件推送就是由绑定的邮箱发送相应的附件。
  • 关于kindel邮箱的绑定可以参考amazon的帮助页面
  • Python 内置了对SMTP的支持,可以发送纯文本邮件、HTML邮件以及带附件的邮件。可以参考廖雪峰的博客
  • 不同邮箱的smtp设置不同,这里以qq邮箱为例
import os.path
import smtplib
from email.mime.multipart import MIMEMultipart
from email.mime.text import MIMEText
from email.mime.application import MIMEApplication
from email import encoders

_user = "123123@qq.com"
_pwd  = "********"
_to   = "******@kindle.cn"

def send_email():
    path = r'G:\python\zhihu\ribao\content'
    for file in os.listdir(path):
        file_path = os.path.join(path,file)
        msg = MIMEMultipart()
        msg['Subject'] = 'convert'  #邮件标题
        msg['From'] = _user #显示发件人
        msg['To'] = _to #接收邮箱
        attfile = file_path
        basename = os.path.basename(file_path) 
        print(basename)
        fp = open(attfile,'rb')
        att = MIMEText(fp.read(),'base64','gbk')
        att['Content-Type'] = 'application/octer-stream'
        att.add_header('Content-Disposition', 'attachment',filename=('gbk', '', basename))
        encoders.encode_base64(att)
        msg.attach(att)
        s = smtplib.SMTP_SSL("smtp.qq.com", 465,timeout = 30)#连接smtp邮件服务器,qq邮箱端口为465
        s.login(_user, _pwd)#登陆服务器
        s.sendmail(_user, _to, msg.as_string())#发送邮件
        s.close()

记得关掉飞行模式,连接上网络(逃 ..
之后就可以在kindle上看日报啦~~

  • 0
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 2
    评论
笨办法”学Python(第3版).mobi带目录、书签、超清文字版 本书是一本Python入门书籍,适合对计算机了解不多,没有学过编程,但对编程感兴趣的读者学习使用。这本书以习题的方式引导读者一步一步学习编程,从简单的打印一直讲到完整项目的实现,让初学者从基础的编程技术入手,最终体验到软件开发的基本过程。 本书结构非常简单,共包括52个习题,其中26个覆盖了输入/输出、变量和函数三个主题,另外26个覆盖了一些比较高级的话题,如条件判断、循环、类和对象、代码测试及项目的实现等。每一章的格式基本相同,以代码习题开始,按照说明编写代码,运行并检查结果,然后再做附加练习。 Zed Shaw完善了这个堪称世上最好的Python学习系统。只要跟着学习,你就会和迄今为止数十万Zed教过的初学者一样获得成功。 在这本书中,你将通过完成52个精心设计的习题来学会Python。阅读这些习题,把习题的代码精确地写出来(禁止复制和粘贴!),修正你的错误,观察程序的运行。在这个过程中,你将了解软件是如何工作的,好的程序看起来是什么样子,怎样阅读、编写、思考代码,以及如何用专业程序员的技巧来找出并修正错误。最重要的是,你将学到下面这些编写优秀的Python软件必需的初始技能。 这本书会让你的每一分钟投入都有回报。Python是世界上最强大、最受欢迎的编程语言之一,很快你就会成为一名Python程序员。 你还可以看Zed的视频!随书附赠的DVD中包含5个多小时激情挥洒的教学内容:一部完整的Python视频教程!

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值