python脚本爬取字体文件的实现方法

最新推荐文章于 2024-01-30 20:30:45 发布

qihao02

最新推荐文章于 2024-01-30 20:30:45 发布

阅读量568

点赞数

分类专栏： python 文章标签： python

本文链接：https://blog.csdn.net/qihao02/article/details/103602687

版权

本文介绍如何使用Python脚本从fontsquirrel.com和dafont.com网站爬取字体文件，提供验证码识别所需的多样字模。通过示例代码详细阐述了爬取过程，包括处理外链下载和文件名编码问题。

摘要由CSDN通过智能技术生成

这篇文章主要给大家介绍了利用python脚本爬取字体文件的实现方法，文中分享了爬取两个不同网站的示例代码，相信对大家具有一定的参考价值，需要的朋友们下面来一起看看吧。
前言

大家应该都有所体会，为了提高验证码的识别准确率，我们当然要首先得到足够多的测试数据。验证码下载下来容易，但是需要人脑手工识别着实让人受不了，于是我就想了个折衷的办法——自己造验证码。

为了保证多样性，首先当然需要不同的字模了，直接用类似ttf格式的字体文件即可，网上有很多ttf格式的字体包供我们下载。当然，我不会傻到手动下载解压缩，果断要写个爬虫了。

实现方法

网站一：fontsquirrel.com

这个网站的字体可以免费下载，但是有很多下载点都是外链连接到其他网站的，这部分得忽略掉。

#coding:utf-8
import urllib2,cookielib,sys,re,os,zipfile
import numpy as np
#网站登陆
cj=cookielib.CookieJar()
opener=urllib2.build_opener(urllib2.HTTPCookieProcessor(cj))
opener.addheaders=[('User-agent','Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.106 Safari/537.36))')]
urllib2.install_opener(opener)
#搜索可下载连接
def search(path):
 request=urllib2.Request(path)
 response=urllib2.urlopen(request)
 html=response.read