python 多线程爬取壁纸网站的示例


Posted in Python onFebruary 20, 2021

基本开发环境

· Python 3.6

· Pycharm

需要导入的库

python 多线程爬取壁纸网站的示例

目标网页分析

python 多线程爬取壁纸网站的示例

网站是静态网站,没有加密,可以直接爬取

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

整体思路:

1、先在列表页面获取每张壁纸的详情页地址

2、在壁纸详情页面获取壁纸真实高清url地址

3、保存地址

代码实现

模拟浏览器请请求网页,获取网页数据

 python 多线程爬取壁纸网站的示例

这里只选择爬取前10页的数据

代码如下

import threading
import parsel
import requests

def get_html(html_url):
 '''
 获取网页源代码
 :param html_url: 网页url
 :return:
 '''
 response = requests.get(url=html_url, headers=headers)
 return response


def get_par(html_data):
 '''
 把 response.text 转换成 selector 对象 解析提取数据
 :param html_data: response.text
 :return: selector 对象
 '''
 selector = parsel.Selector(html_data)
 return selector

def download(img_url, title):
 '''
 保存数据
 :param img_url: 图片地址
 :param title: 图片标题
 :return:
 '''
 content = get_html(img_url).content
 path = '壁纸\\' + title + '.jpg'
 with open(path, mode='wb') as f:
  f.write(content)
  print('正在保存', title)

def main(url):
 '''
 主函数
 :param url: 列表页面 url
 :return:
 '''
 html_data = get_html(url).text
 selector = get_par(html_data)
 lis = selector.css('.wb_listbox div dl dd a::attr(href)').getall()
 for li in lis:
  img_data = get_html(li).text
  img_selector = get_par(img_data)
  img_url = img_selector.css('.wb_showpic_main img::attr(src)').get()
  title = img_selector.css('.wb_pictitle::text').get().strip()
  download(img_url, title)
 end_time = time.time() - s_time
 print(end_time)

if __name__ == '__main__':
 for page in range(1, 11):
  url = 'http://www.deskbizhi.com/min/list-{}.html'.format(page)
  main_thread = threading.Thread(target=main, args=(url,))
  main_thread.start()

以上就是python 多线程爬取壁纸网站的示例的详细内容,更多关于python 爬取壁纸网站的资料请关注三水点靠木其它相关文章!

Python 相关文章推荐
Python实现读取目录所有文件的文件名并保存到txt文件代码
Nov 22 Python
Python中使用HTMLParser解析html实例
Feb 08 Python
浅谈Python 字符串格式化输出(format/printf)
Jul 21 Python
根据DataFrame某一列的值来选择具体的某一行方法
Jul 03 Python
十行代码使用Python写一个USB病毒
Jun 21 Python
python字符串切割:str.split()与re.split()的对比分析
Jul 16 Python
python 实现二维字典的键值合并等函数
Dec 06 Python
关于Python中定制类的比较运算实例
Dec 19 Python
python pip安装包出现:Failed building wheel for xxx错误的解决
Dec 25 Python
python如何求数组连续最大和的示例代码
Feb 04 Python
解决python 虚拟环境删除包无法加载的问题
Jul 13 Python
Matlab求解数组中的最大值及它所在的具体位置
Apr 16 Python
python 制作网站小说下载器
Feb 20 #Python
如何用python爬取微博热搜数据并保存
Feb 20 #Python
python 统计list中各个元素出现的次数的几种方法
Feb 20 #Python
pandas统计重复值次数的方法实现
Feb 20 #Python
pandas 按日期范围筛选数据的实现
Feb 20 #Python
基于Python-Pycharm实现的猴子摘桃小游戏(源代码)
Feb 20 #Python
pandas按条件筛选数据的实现
Feb 20 #Python
You might like
php 引用(&)详解
2009/11/20 PHP
利用PHP将部分内容用星号替换
2020/04/21 PHP
PHP使用php-resque库配合Redis实现MQ消息队列的教程
2016/06/29 PHP
实例说明js脚本语言和php脚本语言的区别
2019/04/04 PHP
关于IE、Firefox、Opera页面呈现异同 写脚本很痛苦
2009/08/28 Javascript
Jquery实现无刷新DropDownList联动实现代码
2010/03/08 Javascript
javascript利用控件对windows的操作实现原理与应用
2012/12/23 Javascript
jquery获取tr中控件值并操作tr实现思路
2013/03/27 Javascript
javascript页面加载完执行事件代码
2014/02/11 Javascript
JS获取当前日期时间并定时刷新示例
2021/03/04 Javascript
document.forms用法示例介绍
2014/06/26 Javascript
javascript中通过arguments参数伪装方法重载
2014/10/08 Javascript
跨域资源共享 CORS 详解
2016/04/26 Javascript
浅析JavaScript函数的调用模式
2016/08/10 Javascript
Vue.js 父子组件通讯开发实例
2016/09/06 Javascript
javascript输出AscII码扩展集中的字符方法
2016/12/26 Javascript
Vue实现双向数据绑定
2017/05/03 Javascript
Webpack实现按需打包Lodash的几种方法详解
2017/05/08 Javascript
vue之nextTick全面解析
2017/05/17 Javascript
详谈js原型继承的一些问题
2017/09/06 Javascript
详解Vue.js和layui日期控件冲突问题解决办法
2019/07/25 Javascript
vue-cli3项目升级到vue-cli4 的方法总结
2020/03/19 Javascript
vue输入框使用模糊搜索功能的实现代码
2020/05/26 Javascript
多版本Python共存的配置方法
2017/05/22 Python
Django自定义认证方式用法示例
2017/06/23 Python
对Python捕获控制台输出流的方法详解
2019/01/07 Python
Python字符串逆序输出的实例讲解
2019/02/16 Python
Python OpenCV调用摄像头检测人脸并截图
2020/08/20 Python
Django ORM多对多查询方法(自定义第三张表&ManyToManyField)
2019/08/09 Python
html5 canvas实现圆形时钟代码分享
2013/12/25 HTML / CSS
Nili Lotan官网:Nili Lotan同名品牌
2018/01/07 全球购物
法国春天百货官网:Printemps.com
2020/06/29 全球购物
2014年师德师风自我剖析材料
2014/09/27 职场文书
学生会干部任命书
2015/09/21 职场文书
初中物理教学反思
2016/02/19 职场文书
nginx.conf配置文件结构小结
2022/04/08 Servers