抽取python 标准库页面生成 mobi 离线文件

前段时间买了个 kindle ,所以就不想老是开电脑 看 书了。而在学习python 时,看到python 主要的还是熟悉一些库的功能。
所以就想着把标准库给捉下来看。

python 标准库https://docs.python.org/2/library/

下面是一段用来练手的 python 捉取html 内容的代码:


    import urllib2
    import os
    import re



    #打开并保存hmtl
    def save_html(urlname):
      main_url=r'https://docs.python.org/2/library/'
      main_dir=r'E:BOOKpythonpython_library'
      
      url=main_url+urlname+'.html'
      file_name=main_dir+'\' +urlname+'.html'
      try:   
        req=urllib2.urlopen(url)
       
        urlfile=open(file_name,'w')
        urlfile.write(req.read())
      except:
        print url
       
      finally:
        urlfile.close()
       
      

    #保存主页
    save_html('index')


    #正则表达式查找链接并保存对应文件
    req=urllib2.urlopen(r'https://docs.python.org/2/library/index.html')
    p=re.compile(r'''<li class="toctree-.+?"><a class="reference internal" href="(.+?).html">.+?</a></li>''')
    matchs=p.findall(req.read())


    for row in matchs:
      save_html(row)


捉完后,使用了 [ calibre - E-book management ] 把html 转换成mobi 格式的文件。


mobi 下载链接:

http://f.dataguru.cn/forum.php?mod=attachment&aid=MTQ5OTQzfDc1Y2MyMDk5fDE0MDgxNzEzNTB8NDQxMTd8MzM3NjMy

  • 1
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值