Python 爬虫模拟登陆知乎


Posted in Python onSeptember 23, 2016

在之前写过一篇使用python爬虫爬取电影天堂资源的文章,重点是如何解析页面和提高爬虫的效率。由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验证操作,写完那篇文章后又花了些时间研究了一下python模拟登陆,网上关于这部分的资料很多,很多demo都是登陆知乎的,原因是知乎的登陆比较简单,只需要post几个参数,保存cookie。而且还没有进行加密,很适合用来做教学。我也是是新手,一点点的摸索终于成功登陆上了知乎。就通过这篇文章分享一下学习这部分的心得,希望对那些和我一样的初学者有所帮助。

先来说一下,爬虫模拟登陆的基本原理吧,我也是刚开始接触对于一些深层次的东西也不是掌握的很清楚。首先比较重要的一个概念就是cookie,我们都知道HTTP是一种无状态的协议,也就是说当一个浏览器客户端向服务器提交一个request,服务器回应一个response后,他们之间的联系就中断了。这样就导致了这个客户端在向服务器发送请求时,服务器无法判别这两个客户端是不是一个了。这样肯定是不行的。这时cookie的作用就体现出来了。当客户端向服务器发送一个请求后,服务器会给它分配一个标识(cookie),并保存到客户端本地,当下次该客户端再次发送请求时连带着cookie一并发送给服务器,服务器一看到cookie,啊原来是你呀,这是你的东西,拿走吧。所以一个爬虫模拟登陆就是要要做到模拟一个浏览器客户端的行为,首先将你的基本登录信息发送给指定的url,服务器验证成功后会返回一个cookie,我们就利用这个cookie进行后续的爬取工作就行了。

   我这里抓包用的就是chrome的开发者工具,不过你也可以使用Fiddler、Firebug等都可以,只不过作为一名前端er对chrome有一种特殊的喜爱之情。准备好工具接下来就要打开知乎的登陆页面并查看https://www.zhihu.com/#signin 我们可以很容易发现这个请求 发送的就是登录信息,当然我使用手机登陆的 用邮件登陆的是最后结尾是email

Python 爬虫模拟登陆知乎

所以我们只需要向这个地址post数据就行了

Python 爬虫模拟登陆知乎

phone_num 登录名
password 密码
captcha_type 验证码类型(这个参数着这里并没有实质作用)
rember_me 记住密码

_xsrf 一个隐藏的表单元素 知乎用来防御CSRF的(关于CSRF请打开这里) 我发现这个值是固定所以就在这里直接写死了 若果有兴趣的同学可以写一个正则表达式 把这部分的值提取出来 这样更严谨一些。

# -*- coding:utf-8 -*-
import urllib2
import urllib
import cookielib
posturl = 'https://www.zhihu.com/login/phone_num'
headers={
'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) '
'AppleWebKit/537.36 (KHTML, like Gecko) '
'Chrome/52.0.2743.116 Safari/537.36',
'Referer':'https://www.zhihu.com/'
}
value = {
'password':'*****************',
'remember_me':True,
'phone_num':'*******************',
'_xsrf':'**********************'
}
data=urllib.urlencode(value)
#初始化一个CookieJar来处理Cookie
cookieJar=cookielib.CookieJar()
cookie_support = urllib2.HTTPCookieProcessor(cookieJar)
#实例化一个全局opener
opener=urllib2.build_opener(cookie_support)
request = urllib2.Request(posturl, data, headers)
result=opener.open(request)
print result.read()

当你看到服务器返回这个信息的时候就说明你登陆成功了

{"r":0,
"msg": "\u767b\u5f55\u6210\u529f"
}#翻译过来就是 “登陆成功” 四个大字

然后你就可以用这个身份去抓取知乎上的页面了

page=opener.open("https://www.zhihu.com/people/yu-yi-56-70")
content = page.read().decode('utf-8')
print(content)

这段代码就是通过实例化一个opener对象保存成功登陆后的cookie信息,然后再通过这个opener带着这个cookie去访问服务器上关于这个身份的完整页面。更复杂的比如微博的登陆这种对请求的数据进行加密了的后面有时间再写出来,与大家分享

Python 相关文章推荐
python备份文件的脚本
Aug 11 Python
python的正则表达式re模块的常用方法
Mar 09 Python
Ruby元编程基础学习笔记整理
Jul 02 Python
Python统计一个字符串中每个字符出现了多少次的方法【字符串转换为列表再统计】
May 05 Python
Scrapy-Redis结合POST请求获取数据的方法示例
May 07 Python
python字典一键多值实例代码分享
Jun 14 Python
python中的句柄操作的方法示例
Jun 20 Python
python跳出双层for循环的解决方法
Jun 24 Python
Python实现寻找回文数字过程解析
Jun 09 Python
Python函数__new__及__init__作用及区别解析
Aug 31 Python
Python抓包并解析json爬虫的完整实例代码
Nov 03 Python
python中把元组转换为namedtuple方法
Dec 09 Python
python 自动化将markdown文件转成html文件的方法
Sep 23 #Python
Python增量循环删除MySQL表数据的方法
Sep 23 #Python
教你用Python脚本快速为iOS10生成图标和截屏
Sep 22 #Python
Python 制作糗事百科爬虫实例
Sep 22 #Python
Python 使用SMTP发送邮件的代码小结
Sep 21 #Python
Python 使用requests模块发送GET和POST请求的实现代码
Sep 21 #Python
Python中将字典转换为列表的方法
Sep 21 #Python
You might like
苏联队长,苏联超人蝙蝠侠,这些登场的“山寨”英雄真的很严肃
2020/04/09 欧美动漫
PHP代码实现爬虫记录――超管用
2015/07/31 PHP
thinkPHP中U方法加密传递参数功能示例
2018/05/29 PHP
PHP生成指定范围内的N个不重复的随机数
2019/03/18 PHP
确保Laravel网站不会被嵌入到其他站点中的方法
2019/10/18 PHP
PHP $O00OO0=urldecode & eval 解密,记一次商业源码的去后门
2020/09/13 PHP
基于jQuery的ajax功能实现web service的json转化
2009/08/29 Javascript
基于jquery的获取mouse坐标插件的实现代码
2010/04/01 Javascript
javascript确认框的三种使用方法
2013/12/17 Javascript
Node.js开源应用框架HapiJS介绍
2015/01/14 Javascript
js运动应用实例解析
2015/12/28 Javascript
JavaScript 定时器 SetTimeout之定时刷新窗口和关闭窗口(代码超简单)
2016/02/26 Javascript
去除html代码里面的script正则方法
2016/05/19 Javascript
AngularJS实现的回到顶部指令功能实例
2017/05/17 Javascript
详解Angular路由 ng-route和ui-router的区别
2017/05/22 Javascript
vue实现a标签点击高亮方法
2018/03/17 Javascript
JavaScript callback回调函数用法实例分析
2018/05/08 Javascript
详解vue页面首次加载缓慢原因及解决方案
2019/11/06 Javascript
Js Snowflake(雪花算法)生成随机ID的实现方法
2020/08/26 Javascript
nodejs中内置模块fs,path常见的用法说明
2020/11/07 NodeJs
python实现指定字符串补全空格的方法
2015/04/30 Python
python生成随机密码或随机字符串的方法
2015/07/03 Python
使用Python写CUDA程序的方法
2017/03/27 Python
通过python+selenium3实现浏览器刷简书文章阅读量
2017/12/26 Python
Django中Forms的使用代码解析
2018/02/10 Python
使用python接入微信聊天机器人
2020/03/31 Python
FFrpc python客户端lib使用解析
2019/08/24 Python
Python如何实现的二分查找算法
2020/05/27 Python
Python列表元素删除和remove()方法详解
2021/01/04 Python
CSS3教程:background-clip和background-origin
2008/10/17 HTML / CSS
宝拉珍选美国官网:Paula’s Choice美国
2018/01/07 全球购物
司机岗位职责
2013/11/15 职场文书
领导班子四风对照检查材料
2014/09/23 职场文书
酒店厨房管理制度
2015/08/06 职场文书
python flask开发的简单基金查询工具
2021/06/02 Python
Nginx反向代理配置的全过程记录
2021/06/22 Servers