Python网络爬虫（1）--url访问及参数设置

最新推荐文章于 2024-07-14 03:17:54 发布

淅沥加油

最新推荐文章于 2024-07-14 03:17:54 发布

阅读量7k

点赞数

分类专栏： Python

Python 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

标签：

环境：Python2.7.9 / Sublime Text 2 / Chrome

1.url访问，直接调用urllib库函数即可

import urllib2

url=‘http://www.baidu.com/‘
response = urllib2.urlopen(url)
html=response.read()

print html

2.带参数的访问，以baidu搜索功能为例

使用Chrome浏览器访问效果，Chrome搜索引擎设置为baidu，地址栏中输入test，效果如下：

可以看到baidu搜索的url为 https://www.baidu.com/s?ie=UTF-8&wd=test

修改代码，增加访问参数

# coding=utf-8
import urllib
import urllib2

#url地址
url=‘https://www.baidu.com/s‘
#参数
values={
        ‘ie‘:‘UTF-8‘,
        ‘wd‘:‘test‘   
        }
#进行参数封装
data=urllib.urlencode(values)
#组装完整url
req=urllib2.Request(url,data)

#访问完整url
response = urllib2.urlopen(req)
html=response.read()

print html

运行代码，得到结果为

提示访问页面不存在，这个时候需要考虑一下访问方式的问题。urllib2.Request(url,data) 访问方式为POST方式，需要改用GET方式进行尝试，更改代码为

# coding=utf-8
import urllib
import urllib2

#url地址
url=‘https://www.baidu.com/s‘
#参数
values={
        ‘ie‘:‘UTF-8‘,
        ‘wd‘:‘test‘   
        }
#进行参数封装
data=urllib.urlencode(values)
#组装完整url
#req=urllib2.Request(url,data)
url=url+‘?‘+data

#访问完整url
#response = urllib2.urlopen(req)
response = urllib2.urlopen(url)
html=response.read()

print html

再次运行，获得结果为

https发生了重定向，需要改用http

# coding=utf-8
import urllib
import urllib2

#url地址
#url=‘https://www.baidu.com/s‘
url=‘http://www.baidu.com/s‘
#参数
values={
        ‘ie‘:‘UTF-8‘,
        ‘wd‘:‘test‘   
        }
#进行参数封装
data=urllib.urlencode(values)
#组装完整url
#req=urllib2.Request(url,data)
url=url+‘?‘+data

#访问完整url
#response = urllib2.urlopen(req)
response = urllib2.urlopen(url)
html=response.read()

print html

再次运行，可实现正常访问

Python网络爬虫（1）--url访问及参数设置

标签：

转载来源：http://www.mamicode.com/info-detail-477628.html

淅沥加油

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
Python网络爬虫（1）--url访问及参数设置

标签：环境：Python2.7.9 / Sublime Text 2 / Chrome1.url访问，直接调用urllib库函数即可import urllib2url=‘http://www.baidu.com/‘response = urllib2.urlopen(url)html=response.read()print html2.带参数的访问，以baid
复制链接

扫一扫

专栏目录