爬取飞卢小说网的小说

爬取飞卢小说网的任意小说

需要的库就三个

import requests
import re
import os

在这里插入图片描述
在这里插入图片描述
飞卢小说网的url关系很简单,主要的小说内容就是原来小说界面后面加了一个_1

爬虫函数,id在主函数会输入

def bug(id):
    sum = 1
    url1 = "https://b.faloo.com/"+id+".html"
    html1 = requests.get(url1)
    length_ml = len(re.findall(r'<a href=.+? target="_self" title=.+?',html1.text))
    title = re.search(r'<title>.+?</title>',html1.text)
    title = title.group(0).strip("<title></title>")

    print(title+":共"+str(length_ml)+'章')

    try:
        os.mkdir(os.getcwd()+'\\'+title)
    except FileExistsError:
        return title
        return 0

    while sum < length_ml:
        url2 = "https://b.faloo.com/"+id+"_"+str(sum)+".html"
        html2 = requests.get(url2)
        titles = re.search(r"<title>.+?</title>",html2.text)
        titles = titles.group(0).strip("<title></title>")
        print("正在爬取第"+str(sum)+"章:"+titles)
        tt = os.getcwd()+'\\'+title+'\\'+titles+".txt"
        with open(tt,'w',encoding="utf-8") as fp:
            txt = re.findall(r'<p>.+?</p>',html2.text)
            if txt == "[]":
                print('第'+str(sum)+"章:"+titles+"爬取失败")
                break
            else:
                for i in txt:
                    fp.write(i.strip("<p></p>")+'\n')
                print('第'+str(sum)+"章:"+titles+"爬取成功")
        sum += 1

    return title

在这里插入图片描述
而每行小说都在一个<p></p>标签里,所以可以直接用正则表达式的findall函数,匹配出每行小说的内容,但是怕取下来发现一个问题,多出了许多大小2kb的无效文件,这样我们可以定义一个清理无效文件的函数

def GL(title):
    path = os.getcwd() + '\\' + title
    names = os.listdir(path)
    length = len(names)
    sum = 0
    while sum < length:
        if ".txt" in names[sum]:
            with open(path+'\\'+names[sum],'r',encoding="utf-8") as fp:
                size = os.path.getsize(path+'\\'+names[sum])
                if size < 1000:
                    flag = True
                    debug = False
                else:
                    flag = False
            if flag == True:
                os.remove(path+'\\'+names[sum])
                print("无效文件"+names[sum]+"已删除")
            else:
                debug = True
            sum += 1
    if debug == True:
        print("无效文件已全部删除")
    else:
        print("无效文件还没删除")

然后接上主函数

def main():
    id = input("请输入漫画id>>>")
    title = bug(id)
    GL(title)

最后主函数入口

if __name__ == '__main__':
    main()

ok,完事儿了,如果喜欢本文章请麻烦点一个爱心留言加收藏

爱你你么么哒(づ ̄ 3 ̄)づ

  • 9
    点赞
  • 47
    收藏
    觉得还不错? 一键收藏
  • 6
    评论
结构化写作是指按照一定的规则和框架来进行写作的一种方法。在写作过程中,作者需要根据主题和内容确定文章的结构,将观点和论据有机地组织起来,使文章逻辑清晰、层次分明。 卢卓元老师所编写的《结构化写作》PDF文档是一本介绍结构化写作方法和技巧的教材。这本教材首先介绍了结构化写作的基本概念和原则,例如主题句、段落结构、过渡等。然后,通过实例和练习,向读者展示如何运用这些方法来撰写具有逻辑性和条理性的文章。 《结构化写作》一书的好处在于它能帮助读者更好地组织自己的思维并表达观点。通过学习这本书,读者可以提高自己的写作能力,写出精简、流畅、连贯的文章。这对于学生来说尤为重要,因为在考试和写作任务中,结构清晰的作文会印象更深,得到更好的评分。 除了学生,其他需要进行写作的人也可以从这本书中受益。不论是写作个人文集、职业报告还是商务邮件,都需要有条理地组织和表达观点。结构化写作的技巧可以帮助读者更好地传达自己的意思,提高沟通的效果。 总而言之,卢卓元老师的《结构化写作》PDF文档是一本非常有用的写作教材。通过学习这本书,读者可以学会如何按照一定的框架和规则组织自己的写作,提高写作的效果和质量。无论是学生还是其他需要写作的人,都可以从这本书中受益,提升自己的写作能力。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 6
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值