编程 Python

python爬虫入门教程之糗百图片爬虫代码分享

Posted in Python onSeptember 02, 2014

学习python少不了写爬虫，不仅能以点带面地学习、练习使用python，爬虫本身也是有用且有趣的，大量重复性的下载、统计工作完全可以写一个爬虫程序完成。

用python写爬虫需要python的基础知识、涉及网络的几个模块、正则表达式、文件操作等知识。昨天在网上学习了一下，写了一个爬虫自动下载「糗事百科」里面的图片。源代码如下：

# -*- coding: utf-8 -*- 

# 上面那句让代码里支持中文
#---------------------------------------  

#   程序：糗百图片爬虫  

#   版本：0.1  

#   作者：赵伟  

#   日期：2013-07-25  

#   语言：Python 2.7  

#   说明：能设置下载的页数。没有做更多抽象和交互方面的优化。  

#---------------------------------------
import urllib2

import urllib

import re
#正则表达式，用来抓取图片的地址

pat = re.compile('<div class="thumb">\\n<img src=\"(ht.*?)\".*?>')
#用来合成网页的URL

nexturl1 = "http://m.qiushibaike.com/imgrank/page/"

nexturl2 = "?s=4582487&slow"
#页数计数

count = 1
#设置抓取的页数

while count < 3:
    print "Page " + str(count) + "\n"

    myurl = nexturl1 + str(count) + nexturl2

    myres = urllib2.urlopen(myurl)#抓取网页

    mypage = myres.read()#读取网页内容

    ucpage = mypage.decode("utf-8") #转码
    mat = pat.findall(ucpage)#用正则表达式抓取图片地址

        

    count += 1;

    

    if len(mat):

        for item in mat:

            print "url: " + item + "\n"

            fnp = re.compile('/(\w+\.\w+)$')#下面三行分离出图片文件的名称

            fnr = fnp.findall(item)

            fname = fnr[0]

            urllib.urlretrieve(item, fname)#下载图片

      

    else:

        print "no data"

使用方法：新建一个practice文件夹，将源代码保存为qb.py文件，并放在practice文件夹中，在命令行里执行python qb.py，即开始下载图片。可以修改源代码里面的while语句设置下载的页数。

python爬虫入门教程之糗百图片爬虫代码分享

- Author -

junjie

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

Python文件操作基本流程代码实例

Dec 11 Python

Flask框架各种常见装饰器示例

Jul 17 Python

selenium+python 对输入框的输入处理方法

Oct 11 Python

python使用Paramiko模块实现远程文件拷贝

Apr 30 Python

twilio python自动拨打电话,播放自定义mp3音频的方法

Aug 08 Python

Python多线程爬取豆瓣影评API接口

Oct 22 Python

通过实例解析Python调用json模块

Dec 11 Python

关于windows下Tensorflow和pytorch安装教程

Feb 04 Python

pytorch 实现在一个优化器中设置多个网络参数的例子

Feb 20 Python

Python读写操作csv和excle文件代码实例

Mar 16 Python

Python3实现建造者模式的示例代码

Jun 28 Python

Flask中sqlalchemy模块的实例用法

Aug 02 Python

python批量同步web服务器代码核心程序

Sep 01 #Python

寻找网站后台地址的python脚本

Sep 01 #Python

python批量修改文件名的实现代码

Sep 01 #Python

python中List的sort方法指南

Sep 01 #Python

Python抓取京东图书评论数据

Aug 31 #Python

Python深入学习之内存管理

Aug 31 #Python

Python深入学习之装饰器

Aug 31 #Python