【Python】Python的urllib模块、urllib2模块批量进行网页下载文件


Posted in Python onNovember 19, 2016

由于需要从某个网页上下载一些PDF文件,但是需要下载的PDF文件有几百个,所以不可能用人工点击来下载。正好Python有相关的模块,所以写了个程序来进行PDF文件的下载,顺便熟悉了Python的urllib模块和ulrllib2模块。

1、问题描述

需要从http://www.cvpapers.com/cvpr2014.html上下载几百个论文的PDF文件,该网页如下图所示:【Python】Python的urllib模块、urllib2模块批量进行网页下载文件

2、问题解决

通过结合Python的urllib模块和urllib2模块来实现自动下载。代码如下:

test.py

#!/usr/bin/python 
# -*- coding:utf-8 -*- 
 
import urllib              #导入urllib模块 
import urllib2             #导入urllib2模块 
import re               #导入正则表达式模块:re模块 
 
def getPDFFromNet(inputURL): 
  req = urllib2.Request(inputURL) 
  f = urllib2.urlopen(req)         #打开网页 
  localDir = 'E:\downloadPDF\\'        #下载PDF文件需要存储在本地的文件夹 
  urlList = []            #用来存储提取的PDF下载的url的列表 
  for eachLine in f:          #遍历网页的每一行 
    line = eachLine.strip()       #去除行首位的空格,习惯性写法 
    if re.match('.*PDF.*', line):      #去匹配含有“PDF”字符串的行,只有这些行才有PDF下载地址 
      wordList = line.split('\"')    #以"为分界,将该行分开,这样就将url地址单独分开了 
      for word in wordList:      #遍历每个字符串 
        if re.match('.*\.pdf$', word): #去匹配含有“.pdf”的字符串,只有url中才有 
          urlList.append(word)  #将提取的url存入列表 
  for everyURL in urlList:         #遍历列表的每一项,即每一个PDF的url 
    wordItems = everyURL.split('/')     #将url以/为界进行划分,为了提取该PDF文件名 
    for item in wordItems:       #遍历每个字符串 
      if re.match('.*\.pdf$', item):   #查找PDF的文件名 
        PDFName = item     #查找到PDF文件名 
    localPDF = localDir + PDFName      #将本地存储目录和需要提取的PDF文件名进行连接 
    try:            
      urllib.urlretrieve(everyURL, localPDF) #按照url进行下载,并以其文件名存储到本地目录 
    except Exception,e: 
      continue 
 
getPDFFromNet('http://www.cvpapers.com/cvpr2014.html')

注意:

(1)第1、6、8、23行分别多谢了一个“\”来进行转义;

(2)第27行的urlretrieve函数有3个参数:第一个参数就是目标url;第二个参数是保存的文件绝对路径(含文件名),该函数的返回值是一个tuple(filename,header),其中的filename就是第二个参数filename。如果urlretrieve仅提供1个参数,返回值的filename就是产生的临时文件名,函数执行完毕后该临时文件会被删除参数。第3个参数是一个回调函数,当连接上服务器、以及相应的数据块传输完毕的时候会触发该回调。其中回调函数名称可任意,但是参数必须为三个。一般直接使用reporthook(block_read,block_size,total_size)定义回调函数,block_size是每次读取的数据块的大小,block_read是每次读取的数据块个数,taotal_size是一一共读取的数据量,单位是byte。可以使用reporthook函数来显示读取进度。
如果想显示读取进度,则可以讲第三个参数加上,将上述程序第27行改为如下:

urllib.urlretrieve(everyURL, localPDF, reporthook=reporthook)

而reporthook回调函数的代码如下:

def reporthook(block_read,block_size,total_size): 
 if not block_read: 
 print "connection opened"; 
 return 
 if total_size<0: 
 #unknown size 
 print "read %d blocks (%dbytes)" %(block_read,block_read*block_size); 
 else: 
 amount_read=block_read*block_size; 
 print 'Read %d blocks,or %d/%d' %(block_read,block_read*block_size,total_size);

综上所述,这就是一个简单的从网页抓取数据、下载文件的小程序,希望对正在学习Python的同学有帮助。谢谢!

Python 相关文章推荐
零基础写python爬虫之爬虫编写全记录
Nov 06 Python
python时间日期函数与利用pandas进行时间序列处理详解
Mar 13 Python
Python 读取某个目录下所有的文件实例
Jun 23 Python
Python机器学习库scikit-learn安装与基本使用教程
Jun 25 Python
Python实现微信自动好友验证,自动回复,发送群聊链接方法
Feb 21 Python
Django框架基础模板标签与filter使用方法详解
Jul 23 Python
Python操作多维数组输出和矩阵运算示例
Nov 28 Python
Python二维数组实现求出3*3矩阵对角线元素的和示例
Nov 29 Python
pytorch 实现cross entropy损失函数计算方式
Jan 02 Python
使用tensorflow框架在Colab上跑通猫狗识别代码
Apr 26 Python
Python Parser的用法
May 12 Python
5行Python代码实现一键批量扣图
Jun 29 Python
Python基础中所出现的异常报错总结
Nov 19 #Python
轻松掌握python设计模式之策略模式
Nov 18 #Python
轻松掌握python设计模式之访问者模式
Nov 18 #Python
Win10下Python环境搭建与配置教程
Nov 18 #Python
Python Paramiko模块的安装与使用详解
Nov 18 #Python
Python数据分析之真实IP请求Pandas详解
Nov 18 #Python
Python切换pip安装源的方法详解
Nov 18 #Python
You might like
用PHP获取Google AJAX Search API 数据的代码
2010/03/12 PHP
PHP初学者常见问题集合 修正版(21问答)
2010/03/23 PHP
Yii2.0建立公共方法简单示例
2019/01/29 PHP
jQuery EasyUI 开源插件套装 完全替代ExtJS
2010/03/24 Javascript
30分钟就入门的正则表达式基础教程
2013/02/25 Javascript
jQuery调用RESTful WCF示例代码(GET方法/POST方法)
2014/01/26 Javascript
Jquery判断radio、selelct、checkbox是否选中及获取选中值方法总结
2015/04/15 Javascript
Angular发布1.5正式版,专注于向Angular 2的过渡
2016/02/18 Javascript
多种js图片预加载实现方式分享
2016/02/19 Javascript
jQuery ajaxForm()的应用
2016/10/14 Javascript
vue组件实例解析
2017/01/10 Javascript
JavaScript 用fetch 实现异步下载文件功能
2017/07/21 Javascript
详解操作虚拟dom模拟react视图渲染
2018/07/25 Javascript
vue指令做滚动加载和监听等
2019/05/26 Javascript
javascript实现的时间格式加8小时功能示例
2019/06/13 Javascript
LayUi数据表格自定义赋值方式
2019/10/26 Javascript
vue 中url 链接左边的小图标更改问题
2019/12/30 Javascript
vue页面加载时的进度条功能(实例代码)
2020/01/13 Javascript
jQuery弹框插件使用方法详解
2020/05/26 jQuery
Vue-cli打包后部署到子目录下的路径问题说明
2020/09/02 Javascript
Python中的数学运算操作符使用进阶
2016/06/20 Python
Python延时操作实现方法示例
2018/08/14 Python
Python实现京东秒杀功能代码
2019/05/16 Python
从numpy数组中取出满足条件的元素示例
2019/11/26 Python
python3实现elasticsearch批量更新数据
2019/12/03 Python
DjangoWeb使用Datatable进行后端分页的实现
2020/05/18 Python
使用Python项目生成所有依赖包的清单方式
2020/07/13 Python
一款纯css3实现的鼠标悬停动画按钮
2014/12/29 HTML / CSS
CSS3中Animation动画属性用法详解
2016/07/04 HTML / CSS
使用HTML5和CSS3制作一个模态框的示例
2018/03/07 HTML / CSS
百联网上商城:i百联
2017/01/28 全球购物
澳洲小众品牌的集合网站:BNKR
2018/02/23 全球购物
岗位职责的构建方法
2014/02/01 职场文书
护理中职生求职信范文
2014/02/24 职场文书
《谁的本领大》教后反思
2014/04/25 职场文书
防卫过当辩护词
2015/05/21 职场文书