#!!!!需要先在python安装lxml import requests from lxml import etree # 获取电影网站信息---选用xpath解析页面 html=requests.get('http://theater.mtime.com/China_Beijing/') html2=html.content.decode('utf-8') doc=etree.HTML(html2) # 获取正在热映(分析页面可以看出需要分三部分获取) print("正在热映:") sss1=doc.xpath('//div[@class="moviebox clearfix"]//div/ul/li/dl/dt/a/text()') sss2=doc.xpath('//div[@class="moviebox clearfix"]//div/dl/dd/h2/a/text()') sss3=doc.xpath('//div[@id="hotplayMoreDiv"]/div/ul/li/dl/dt/a/text()') print(sss1) print(sss2) print(sss3) # # 获取即将上映 sss4=doc.xpath('//dl[@id="upcomingSlide"]/dd/ul/li/div/h3/a/text()') print('即将上映:') print(sss4)
python爬虫---获取电影网站信息(xpath解析)
最新推荐文章于 2024-04-24 13:35:29 发布