编程 Python

python实现登陆知乎获得个人收藏并保存为word文件

Posted in Python onMarch 16, 2015

这个程序其实很早之前就完成了,一直没有发出了,趁着最近不是很忙就分享给大家.
使用BeautifulSoup模块和urllib2模块实现,然后保存成word是使用python docx模块的,安装方式网上一搜一大堆,我就不再赘述了.

主要实现的功能是登陆知乎,然后将个人收藏的问题和答案获取到之后保存为word文档,以便没有网络的时候可以查阅.当然,答案中如果有图片的话也是可以获取到的.不过这块还是有点问题的.等以后有时间了在修改修改吧.

还有就是正则,用的简直不要太烂…鄙视下自己…

还有,现在是问题的话所有的答案都会保存下来的.看看有时间修改成只保存第一个答案或者收藏页问题的答案吧.要不然如果收藏的太多了的话保存下来的word会吓你一跳的哦.O(∩_∩)O哈哈~

在登陆的时候可能会需要验证码,如果提示输入验证码的话在程序的文件夹下面就可以看到验证码的图片,照着输入就ok了.

# -*- coding: utf-8 -*-
#登陆知乎抓取个人收藏 然后保存为word
import sys
reload(sys) 
sys.setdefaultencoding('utf-8')
import urllib
import urllib2
import cookielib
import string
import re
from bs4 import BeautifulSoup
from docx import Document
from docx import *
from docx.shared import Inches
from sys import exit
import os
 
#这儿是因为在公司上网的话需要使用socket代理
#import socks
#import socket
#socks.setdefaultproxy(socks.PROXY_TYPE_SOCKS5,"127.0.0.1",8088)
#socket.socket =socks.socksocket
 
loginurl='http://www.zhihu.com/login'
 
headers = {'User-Agent' : 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.116 Safari/537.36',} 
 
postdata={
 '_xsrf': 'acab9d276ea217226d9cc94a84a231f7',
 'email': '',
 'password': '',
 'rememberme':'y'  
}
 
if not os.path.exists('myimg'):
  os.mkdir('myimg')
if os.path.exists('123.docx'):
  os.remove('123.docx')
if os.path.exists('checkcode.gif'):
  os.remove('checkcode.gif')
 
mydoc=Document()
questiontitle=''
#----------------------------------------------------------------------
def dealimg(imgcontent):
  soup=BeautifulSoup(imgcontent)
  try:
    for imglink in soup.findAll('img'):
      if imglink is not None :
        myimg= imglink.get('src')
        #print myimg
        if myimg.find('http')>=0:
          imgsrc=urllib2.urlopen(myimg).read()
          imgnamere=re.compile(r'http\S*/')
          imgname=imgnamere.sub('',myimg)
          #print imgname
          with open(u'myimg'+'/'+imgname,'wb') as code:
            code.write(imgsrc)
            mydoc.add_picture(u'myimg/'+imgname,width=Inches(1.25))
  except:
    pass
  strinfo=re.compile(r'<noscript>[\s\S]*</noscript>')
  imgcontent=strinfo.sub('',imgcontent)
  strinfo=re.compile(r'<img class[\s\S]*</>')
  imgcontent=strinfo.sub('',imgcontent)
  #show all
  strinfo=re.compile(r'<a class="toggle-expand[\s\S]*</a>')
  imgcontent=strinfo.sub('',imgcontent)
 
  strinfo=re.compile(r'<a class=" wrap external"[\s\S]*rel="nofollow noreferrer" target="_blank">')
  imgcontent=strinfo.sub('',imgcontent)
  imgcontent=imgcontent.replace('<i class="icon-external"></i></a>','')
 
 
  imgcontent=imgcontent.replace('</b>','').replace('</p>','').replace('<p>','').replace('<p>','').replace('<br>','')
  return imgcontent
   
 
 
 
 
def enterquestionpage(pageurl):
  html=urllib2.urlopen(pageurl).read()
  soup=BeautifulSoup(html)
  questiontitle=soup.title.string
  mydoc.add_heading(questiontitle,level=3)
  for div in soup.findAll('div',{'class':'fixed-summary zm-editable-content clearfix'}):
    #print div
    conent=str(div).replace('<div class="fixed-summary zm-editable-content clearfix">','').replace('</div>','')
     
    conent=conent.decode('utf-8')
    conent=conent.replace('<br/>','\n')
     
    conent=dealimg(conent)
    ###这一块弄得太复杂了 有时间找找看有没有处理html的模块
    conent=conent.replace('<div class="fixed-summary-mask">','').replace('<blockquote>','').replace('<b>','').replace('<strong>','').replace('</strong>','').replace('<em>','').replace('</em>','').replace('</blockquote>','')
    mydoc.add_paragraph(conent,style='BodyText3')
    """file=open('222.txt','a')
    file.write(str(conent))
    file.close()"""
     
 
def entercollectpage(pageurl):
  html=urllib2.urlopen(pageurl).read()
  soup=BeautifulSoup(html)
  for div in soup.findAll('div',{'class':'zm-item'}):
    h2content=div.find('h2',{'class':'zm-item-title'})
    #print h2content
    if h2content is not None:
      link=h2content.find('a')
      mylink=link.get('href')
      quectionlink='http://www.zhihu.com'+mylink
      enterquestionpage(quectionlink)
      print quectionlink    
 
 
 
def loginzhihu():
  postdatastr=urllib.urlencode(postdata)
  '''
  cj = cookielib.LWPCookieJar()
  cookie_support = urllib2.HTTPCookieProcessor(cj)
  opener = urllib2.build_opener(cookie_support,urllib2.HTTPHandler)
  urllib2.install_opener(opener)
  '''
  h = urllib2.urlopen(loginurl)
  request = urllib2.Request(loginurl,postdatastr,headers)
  request.get_origin_req_host
  response = urllib2.urlopen(request)
  #print response.geturl()
  text = response.read()
 
 
  collecturl='http://www.zhihu.com/collections'
  req=urllib2.urlopen(collecturl)
  if str(req.geturl())=='http://www.zhihu.com/?next=%2Fcollections':
    print 'login fail!'
    return
  txt=req.read()
 
  soup=BeautifulSoup(txt)
  count=0
  divs =soup.findAll('div',{'class':'zm-item'})
  if divs is None:
    print 'login fail!'
    return
  print 'login ok!\n'
  for div in divs:
     
    link=div.find('a')
    mylink=link.get('href')
    collectlink='http://www.zhihu.com'+mylink
    entercollectpage(collectlink)
    print collectlink
    #这儿是当时做测试用的,值获取一个收藏
    #count+=1
    #if count==1:
    #  return
     
 
def getcheckcode(thehtml):
  soup=BeautifulSoup(thehtml)
  div=soup.find('div',{'class':'js-captcha captcha-wrap'})
  if div is not None:
    #print div
    imgsrc=div.find('img')
    imglink=imgsrc.get('src')
    if imglink is not None:
      imglink='http://www.zhihu.com'+imglink
 
      imgcontent=urllib2.urlopen(imglink).read()
      with open('checkcode.gif','wb') as code:
        code.write(imgcontent)
      return True
    else:
      return False
  return False
 
 
if __name__=='__main__':
   
  import getpass
  username=raw_input('input username:')
  password=getpass.getpass('Enter password: ') 
   
  postdata['email']=username
  postdata['password']=password
  postdatastr=urllib.urlencode(postdata)
  cj = cookielib.LWPCookieJar()
  cookie_support = urllib2.HTTPCookieProcessor(cj)
  opener = urllib2.build_opener(cookie_support,urllib2.HTTPHandler)
  urllib2.install_opener(opener)
 
  h = urllib2.urlopen(loginurl)
  request = urllib2.Request(loginurl,postdatastr,headers)
  response = urllib2.urlopen(request)
  txt = response.read()
 
  if getcheckcode(txt):
    checkcode=raw_input('input checkcode:')
    postdata['captcha']=checkcode
    loginzhihu()
    mydoc.save('123.docx')
  else:
    loginzhihu()
    mydoc.save('123.docx')
 
  print 'the end'
  raw_input()

好了,大概就是这样,大家如果有什么好的建议或者什么的可以再下面留言,我会尽快回复的.或者在小站的关于页面有我的联系方式,直接联系我就ok.

python实现登陆知乎获得个人收藏并保存为word文件

- Author -

junjie

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

使用Python的web.py框架实现类似Django的ORM查询的教程

May 02 Python

Python-嵌套列表list的全面解析

Jun 08 Python

浅谈Python对内存的使用（深浅拷贝）

Jan 17 Python

pandas创建新Dataframe并添加多行的实例

Apr 08 Python

Python判断telnet通不通的实例

Jan 26 Python

python使用pymongo操作mongo的完整步骤

Apr 13 Python

python 读写excel文件操作示例【附源码下载】

Jun 19 Python

详解python实现小波变换的一个简单例子

Jul 18 Python

Python 切分数组实例解析

Nov 07 Python

python实现从ftp上下载文件的实例方法

Jul 19 Python

解决Pycharm 运行后没有输出的问题

Feb 05 Python

matplotlib之pyplot模块之标题（title()和suptitle()）

Feb 22 Python

Python标准库urllib2的一些使用细节总结

Mar 16 #Python

python实现查询苹果手机维修进度

Mar 16 #Python

python让图片按照exif信息里的创建时间进行排序的方法

Mar 16 #Python

python实现简单的计时器功能函数

Mar 14 #Python

python将图片文件转换成base64编码的方法

Mar 14 #Python

python在Windows8下获取本机ip地址的方法

Mar 14 #Python

python检测远程端口是否打开的方法

Mar 14 #Python

You might like

在Windows系统上安装PHP运行环境文字教程

2010/07/19 PHP

php对二维数组进行排序的简单实例

2013/12/19 PHP

PHP和Mysql中转UTF8编码问题汇总

2015/10/10 PHP

PHP分页初探一个最简单的PHP分页代码的简单实现

2016/06/21 PHP

如何判断图片地址是否失效

2007/02/02 Javascript

jQuery事件绑定.on()简要概述及应用

2013/02/07 Javascript

jQuery实现DIV层淡入淡出拖动特效的方法

2015/02/13 Javascript

JS折半插入排序算法实例

2015/12/02 Javascript

原生js实现图片轮播特效

2015/12/18 Javascript

js实现自动图片轮播代码

2017/03/22 Javascript

Vue-router路由判断页面未登录跳转到登录页面的实例

2017/10/26 Javascript

jQuery实现为table表格动态添加或删除tr功能示例

2019/02/19 jQuery

微信小程序wx.request拦截器使用详解

2019/07/09 Javascript

在layui下对元素进行事件绑定的实例

2019/09/06 Javascript

node后端服务保活的实现

2019/11/10 Javascript

node创建Vue项目步骤详解

2020/03/06 Javascript

[00:42]《辉夜杯》—职业组预选赛12月3日15点正式打响

2015/12/03 DOTA

Python FTP操作类代码分享

2014/05/13 Python

几个提升Python运行效率的方法之间的对比

2015/04/03 Python

PyCharm 常用快捷键和设置方法

2017/12/20 Python

Python处理命令行参数模块optpars用法实例分析

2018/05/31 Python

Django中使用CORS实现跨域请求过程解析

2019/08/05 Python

pygame实现贪吃蛇游戏（上）

2019/10/29 Python

Python3.8.2安装包及安装教程图文详解(附安装包)

2020/11/28 Python

python利用opencv实现颜色检测

2021/02/23 Python

html5声频audio和视频video等新特性详细说明

2012/12/26 HTML / CSS

HTML5 背景的显示区域实现

2020/07/09 HTML / CSS

Roxy美国官网：澳大利亚冲浪、滑雪健身品牌

2016/07/30 全球购物

如何写一封打动人心的求职信

2014/02/17 职场文书

彩色的非洲教学反思

2014/02/18 职场文书

医学生临床实习自我评价

2014/03/07 职场文书

计算机求职自荐信范文

2014/04/19 职场文书

家庭困难证明

2014/10/12 职场文书

2015年党员个人工作总结

2015/05/13 职场文书

关于SpringBoot 使用 Redis 分布式锁解决并发问题

2021/11/17 Redis

分享提高 Python 代码的可读性的技巧

2022/03/03 Python