python实现12306余票

最新推荐文章于 2024-03-21 17:27:43 发布

weixin_BeefpasteC

最新推荐文章于 2024-03-21 17:27:43 发布

阅读量298

点赞数

本文链接：https://blog.csdn.net/weixin_51463905/article/details/117821678

版权

本文介绍了如何使用Python进行12306余票查询的实践，包括理解请求URL参数，解析站名编码，以及处理请求后的JSON数据。通过PyCharm和Python3.7，我们可以实现简单的爬虫程序，提取并展示火车票的详细信息。

摘要由CSDN通过智能技术生成

今天就和大家一起来讨论一下python实现12306余票查询（pycharm+python3.7），一起来感受一下python爬虫的简单实践

我们说先在浏览器中打开开发者工具(F12)，尝试一次余票的查询，通过开发者工具查看发出请求的包

余票查询界面

可以看到红框框中的URL就是我们向12306服务器发出的请求，那么具体是什么呢？我们来看看
[
https://kyfw.12306.cn/otn/leftTicket/queryZ?leftTicketDTO.train_date=2019-01-21&leftTicketDTO.from_station=CDW&leftTicketDTO.to_station=SZQ&purpose_codes=ADULT

](https://kyfw.12306.cn/otn/leftTicket/queryZ?leftTicketDTO.train_date=2019-01-21&leftTicketDTO.from_station=CDW&leftTicketDTO.to_station=SZQ&purpose_codes=ADULT)
可以看到发出请求的几个字段：

leftTicketDTO.train_date：查询的日期
leftTicketDTO.from_station：查询的出发地
leftTicketDTO.to_station：查询的目的地
purpose_codes：不太清楚这个字段是用来做什么的，就默认吧

可以从我们递交的URL请求看出，我们输入的成都，深圳都变成了对应的编号，比如，成都（CDW）、深圳（SZQ），所以当我们程序进行输入的时候要进行一下处理，12306的一个地方存储着这些城市名与编码对应的文档：

[
https://kyfw.12306.cn/otn/resources/js/framework/station_name.js?station_version=1.8971

](https://kyfw.12306.cn/otn/resources/js/framework/station_name.js?station_version=1.8971)

站点编码对应

下面我们就编写一个小程序，将这些城市名与编号提取出来：

    import re,requests
    url = "https://kyfw.12306.cn/otn/resources/js/framework/station_name.js?station_version=1.8971"
    response = requests.get(url,verify=False)
    #将车站的名字和编码进行提取
    chezhan = re.findall(r'([\u4e00-\u9fa5]+)\|([A-Z]+)', response.text)
    chezhan_code = dict(chezhan)
    #进行交换
    chezhan_names = dict(zip(chezhan_code.values(),chezhan_code.keys()))
    #打印出得到的车站字典
    print(chezhan_names)

得到的打印结果如下（只截取部分显示）：

{‘VAP’: ‘北京北’, ‘BOP’: ‘北京东’, ‘BJP’: ‘北京’, ‘VNP’: ‘北京南’, ‘BXP’: ‘北京西’, ‘IZQ’:
‘广州南’, ‘CUW’: ‘重庆北’, ‘CQW’: ‘重庆’, ‘CRW’: ‘重庆南’, ‘CXW’: ‘重庆西’, ‘GGQ’: ‘广州东’,
‘SHH’: ‘上海’, ‘SNH’: ‘上海南’, ‘AOH’: ‘上海虹桥’, ‘SXH’: ‘上海西’, ‘TBP’: ‘天津北’, ‘TJP’:
‘天津’, ‘TIP’: ‘天津南’, ‘TXP’: ‘天津西’, ‘XJA’: ‘香港西九龙’, ‘CCT’: ‘长春’, ‘CET’: ‘长春南’,
‘CRT’: ‘长春西’, ‘ICW’: ‘成都东’, ‘CNW’: ‘成都南’, ‘CDW’: ‘成都’, ‘CSQ’: ‘长沙’, ‘CWQ’:
‘长沙南’,}

接下来我们就动手开始程序的主要代码编写：

    def main():
      date     = input("请输入时间(如2019-01-22)：\n")
      from_station = chezhan_code[input("请输入起始站点：\n")]
      to_station  = chezhan_code[input("请输入目的站点：\n")]
      url     = "https://kyfw.12306.cn/otn/leftTicket/queryZ?"
      headers = {
   
        "User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.26 Safari/537.36 Core/1.63.5702.400 QQBrowser/10.2.1893.400"
      }
      url=url+"leftTicketDTO.train_date="+date+"&leftTicketDTO.from_station="+from_station+"&leftTicketDTO.to_station="+to_station+"&purpose_codes=ADULT"
      #print(url) 已经检查过生成的URL是正确的
      #request请求获取主页
      r = requests.get(url,headers=headers)
      r.raise_for_status()  #如果发送了一个错误的请求，会抛出异常
      r.encoding = r.apparent_encoding
      showTicket(r.text)

用户输入时间、起始站点、目的站点，然后通过get来请求，然后我们对返回的网页信息进行解析。我们现将上面代码的r.text进行打印，看看我们请求之后，返回了什么样的信息，然后决定我们应该如何解析

运行结果

这样看着不方便，我们粘贴到记事本中，进行详细的分析：

请求返回的结果信息

可以与12306显示的信息进行对比，K829是车次，CDW与BJQ是出发地和目的地，10:10是出发时间，06:13是到达时间，44:21是历时时间，20190123为查询的日期，剩下的就是一系列票的各种信息。

下面就是对这些返回的信息进行解析，其实这也是python爬虫的关键，就是解析！！！

我们先把信息转化为json格式，可以看到都是用“|”隔开的，那么我们就用split函数分割出来，下面是主要功能代码：

    def showTicket(html):
      html = json.loads(html)
      table = PrettyTable([" 车次 ","出发车站","到达车站","出发时间","到达时间"," 历时 ","商务座"," 一等座","二等座","高级软卧","软卧","动卧","硬卧","软座","硬座","无座","其他","备注"])
      for i in html['data']['result']:
        name = [
              "station_train_code",
              "from_station_name",
              "to_station_name",
              "start_time",
              "arrive_time",
              "lishi",
              "swz_num",
              "zy_num",
              "ze_num",
              "dw_num",
              "gr_num",
              "rw_num",