编程 Python

Python3网络爬虫之使用User Agent和代理IP隐藏身份

Posted in Python onNovember 23, 2017

本文介绍了Python3网络爬虫之使用User Agent和代理IP隐藏身份，分享给大家，具体如下：

运行平台：Windows
Python版本：Python3.x
IDE：Sublime text3

一、为何要设置User Agent

有一些网站不喜欢被爬虫程序访问，所以会检测连接对象，如果是爬虫程序，也就是非人点击访问，它就会不让你继续访问，所以为了要让程序可以正常运行，需要隐藏自己的爬虫程序的身份。此时，我们就可以通过设置User Agent的来达到隐藏身份的目的，User Agent的中文名为用户代理，简称UA。

User Agent存放于Headers中，服务器就是通过查看Headers中的User Agent来判断是谁在访问。在Python中，如果不设置User Agent，程序将使用默认的参数，那么这个User Agent就会有Python的字样，如果服务器检查User Agent，那么没有设置User Agent的Python程序将无法正常访问网站。

Python允许我们修改这个User Agent来模拟浏览器访问，它的强大毋庸置疑。

二、常见的User Agent

1.Android

Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166 Safari/535.19
Mozilla/5.0 (Linux; U; Android 4.0.4; en-gb; GT-I9300 Build/IMM76D) AppleWebKit/534.30 (KHTML, like Gecko) Version/4.0 Mobile Safari/534.30
Mozilla/5.0 (Linux; U; Android 2.2; en-gb; GT-P1000 Build/FROYO) AppleWebKit/533.1 (KHTML, like Gecko) Version/4.0 Mobile Safari/533.1

2.Firefox

Mozilla/5.0 (Windows NT 6.2; WOW64; rv:21.0) Gecko/20100101 Firefox/21.0
Mozilla/5.0 (Android; Mobile; rv:14.0) Gecko/14.0 Firefox/14.0

3.Google Chrome

Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.94 Safari/537.36
Mozilla/5.0 (Linux; Android 4.0.4; Galaxy Nexus Build/IMM76B) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.133 Mobile Safari/535.19

4.iOS

Mozilla/5.0 (iPad; CPU OS 5_0 like Mac OS X) AppleWebKit/534.46 (KHTML, like Gecko) Version/5.1 Mobile/9A334 Safari/7534.48.3
Mozilla/5.0 (iPod; U; CPU like Mac OS X; en) AppleWebKit/420.1 (KHTML, like Gecko) Version/3.0 Mobile/3A101a Safari/419.3

上面列举了Andriod、Firefox、Google Chrome、iOS的一些User Agent，直接copy就能用。

三、设置User Agent的方法

先看下urllib.request.Request()

Python3网络爬虫之使用User Agent和代理IP隐藏身份

从上图可以看出，在创建Request对象的时候，可以传入headers参数。

因此，想要设置User Agent，有两种方法：

1.在创建Request对象的时候，填入headers参数(包含User Agent信息)，这个Headers参数要求为字典；

2.在创建Request对象的时候不添加headers参数，在创建完成之后，使用add_header()的方法，添加headers。

方法一：

创建文件urllib_test09.py，使用上面提到的Android的第一个User Agent，在创建Request对象的时候传入headers参数，编写代码如下：

# -*- coding: UTF-8 -*-
from urllib import request

if __name__ == "__main__":
  #以CSDN为例，CSDN不更改User Agent是无法访问的
  url = 'http://www.csdn.net/'
  head = {}
  #写入User Agent信息
  head['User-Agent'] = 'Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166 Safari/535.19'
 #创建Request对象
  req = request.Request(url, headers=head)
  #传入创建好的Request对象
  response = request.urlopen(req)
  #读取响应信息并解码
  html = response.read().decode('utf-8')
  #打印信息
  print(html)

运行结果如下：

Python3网络爬虫之使用User Agent和代理IP隐藏身份

方法二：

创建文件urllib_test10.py，使用上面提到的Android的第一个User Agent，在创建Request对象时不传入headers参数，创建之后使用add_header()方法，添加headers，编写代码如下：

# -*- coding: UTF-8 -*-
from urllib import request

if __name__ == "__main__":
  #以CSDN为例，CSDN不更改User Agent是无法访问的
  url = 'http://www.csdn.net/'
  #创建Request对象
  req = request.Request(url)
  #传入headers
  req.add_header('User-Agent', 'Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166 Safari/535.19')
  #传入创建好的Request对象
  response = request.urlopen(req)
  #读取响应信息并解码
  html = response.read().decode('utf-8')
  #打印信息
  print(html)

运行结果和上一个方法是一样的。

四、IP代理的使用

1.为何使用IP代理

User Agent已经设置好了，但是还应该考虑一个问题，程序的运行速度是很快的，如果我们利用一个爬虫程序在网站爬取东西，一个固定IP的访问频率就会很高，这不符合人为操作的标准，因为人操作不可能在几ms内，进行如此频繁的访问。所以一些网站会设置一个IP访问频率的阈值，如果一个IP访问频率超过这个阈值，说明这个不是人在访问，而是一个爬虫程序。

2.一般步骤说明

一个很简单的解决办法就是设置延时，但是这显然不符合爬虫快速爬取信息的目的，所以另一种更好的方法就是使用IP代理。使用代理的步骤：

(1)调用urlib.request.ProxyHandler()，proxies参数为一个字典。

Python3网络爬虫之使用User Agent和代理IP隐藏身份

(2)创建Opener(类似于urlopen，这个代开方式是我们自己定制的)

Python3网络爬虫之使用User Agent和代理IP隐藏身份

(3)安装Opener

Python3网络爬虫之使用User Agent和代理IP隐藏身份

使用install_opener方法之后，会将程序默认的urlopen方法替换掉。也就是说，如果使用install_opener之后，在该文件中，再次调用urlopen会使用自己创建好的opener。如果不想替换掉，只是想临时使用一下，可以使用opener.open(url)，这样就不会对程序默认的urlopen有影响。

3.代理IP选取

在写代码之前，先在代理IP网站选好一个IP地址，推荐西刺代理IP。

URL：http://www.xicidaili.com/

注意：当然也可以写个正则表达式从网站直接爬取IP，但是要记住不要太频繁爬取，加个延时什么的，太频繁给服务器带来压力了，服务器会直接把你block，不让你访问的，我就被封了两天。

从西刺网站选出信号好的IP，我的选择如下：(106.46.136.112:808)

Python3网络爬虫之使用User Agent和代理IP隐藏身份

编写代码访问http://www.whatismyip.com.tw/，该网站是测试自己IP为多少的网址，服务器会返回访问者的IP。

4.代码实例

创建文件urllib_test11.py，编写代码如下：

# -*- coding: UTF-8 -*-
from urllib import request

if __name__ == "__main__":
  #访问网址
  url = 'http://www.whatismyip.com.tw/'
  #这是代理IP
  proxy = {'http':'106.46.136.112:808'}
  #创建ProxyHandler
  proxy_support = request.ProxyHandler(proxy)
  #创建Opener
  opener = request.build_opener(proxy_support)
  #添加User Angent
  opener.addheaders = [('User-Agent','Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/56.0.2924.87 Safari/537.36')]
  #安装OPener
  request.install_opener(opener)
  #使用自己安装好的Opener
  response = request.urlopen(url)
  #读取相应信息并解码
  html = response.read().decode("utf-8")
  #打印信息
  print(html)

运行结果如下：

Python3网络爬虫之使用User Agent和代理IP隐藏身份

从上图可以看出，访问的IP已经伪装成了106.46.136.112。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持三水点靠木。

Python3网络爬虫之使用User Agent和代理IP隐藏身份

- Author -

Jack-Cui

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

跟老齐学Python之玩转字符串(1)

Sep 14 Python

10款最好的Web开发的 Python 框架

Mar 18 Python

对python requests发送json格式数据的实例详解

Dec 19 Python

Python设计模式之职责链模式原理与用法实例分析

Jan 11 Python

Python 安装第三方库 pip install 安装慢安装不上的解决办法

Jun 18 Python

pycharm new project变成灰色的解决方法

Jun 27 Python

Flask框架路由和视图用法实例分析

Nov 07 Python

python 实现简单的FTP程序

Dec 27 Python

Python如何通过Flask-Mail发送电子邮件

Jan 29 Python

安装完Python包然后找不到模块的解决步骤

Feb 13 Python

python logging 日志的级别调整方式

Feb 21 Python

python绘图pyecharts+pandas的使用详解

Dec 13 Python

python网络爬虫之如何伪装逃过反爬虫程序的方法

Nov 23 #Python

Python实现的基数排序算法原理与用法实例分析

Nov 23 #Python

Scrapy抓取京东商品、豆瓣电影及代码分享

Nov 23 #Python

python简单图片操作：打开\显示\保存图像方法介绍

Nov 23 #Python

python分析作业提交情况

Nov 22 #Python

Python分析学校四六级过关情况

Nov 22 #Python

linux环境下的python安装过程图解(含setuptools)

Nov 22 #Python

You might like

一段防盗连的PHP代码

2006/12/06 PHP

php之Smarty模板使用方法示例详解

2014/07/08 PHP

Yii2框架数据库简单的增删改查语法小结

2016/08/31 PHP

Zend Framework入门教程之Zend_View组件用法示例

2016/12/09 PHP

解决laravel session失效的问题

2019/10/14 PHP

PHP中关于php.ini参数优化详解

2020/02/28 PHP

在JavaScript中实现命名空间

2006/11/23 Javascript

csdn 博客的css样式 v3

2009/02/24 Javascript

ASP.NET jQuery 实例13 原创jQuery文本框字符限制插件-TextArea Counter

2012/02/03 Javascript

JS中图片缓冲loading技术的实例代码

2013/08/29 Javascript

为jquery的ajaxfileupload增加附加参数的方法

2014/03/04 Javascript

jquery scroll()区分横向纵向滚动条的方法

2014/04/04 Javascript

浅析javascript中函数声明和函数表达式的区别

2015/02/15 Javascript

Javascript技术栈中的四种依赖注入小结

2016/02/27 Javascript

基于JS代码实现当鼠标悬停表格上显示这一格的全部内容

2016/06/12 Javascript

浅谈javascript的闭包

2017/01/23 Javascript

值得分享和收藏的xmlplus组件学习教程

2017/05/05 Javascript

Vue单文件组件基础模板小结

2017/08/10 Javascript

微信小程序项目实践之主页tab选项实现

2018/07/18 Javascript

vue router 跳转时打开新页面的示例方法

2019/07/28 Javascript

vue element 生成无线级左侧菜单的实现代码

2019/08/21 Javascript

vue 父组件通过v-model接收子组件的值的代码

2019/10/27 Javascript

在Vue中使用Select选择器拼接label的操作

2020/10/22 Javascript

Python json 错误xx is not JSON serializable解决办法

2017/03/15 Python

python 找出list中最大或者最小几个数的索引方法

2018/10/30 Python

Pandas DataFrame 取一行数据会得到Series的方法

2018/11/10 Python

解决Python找不到ssl模块问题 No module named _ssl的方法

2019/04/29 Python

Python使用import导入本地脚本及导入模块的技巧总结

2019/08/07 Python

Python使用uuid库生成唯一标识ID

2020/02/12 Python

使用HTML5 Canvas为图片填充颜色和纹理的教程

2016/03/21 HTML / CSS

澳大利亚宠物商店：Petbarn

2017/11/18 全球购物

项目考察欢迎辞

2014/01/17 职场文书

教师党员公开承诺事项

2014/05/28 职场文书

服务标语大全

2014/06/18 职场文书

同学联谊会邀请函

2019/06/24 职场文书

《童年》读后感（三篇）

2019/08/27 职场文书