python中用Scrapy实现定时爬虫的实例讲解


Posted in Python onJanuary 18, 2021

一般网站发布信息会在具体实现范围内发布,我们在进行网络爬虫的过程中,可以通过设置定时爬虫,定时的爬取网站的内容。使用python爬虫框架Scrapy框架可以实现定时爬虫,而且可以根据我们的时间需求,方便的修改定时的时间。

1、Scrapy介绍

Scrapy是python的爬虫框架,用于抓取web站点并从页面中提取结构化的数据。任何人都可以根据需求方便的修改。Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试。

2、使用Scrapy框架定时爬取

import time
from scrapy import cmdline
def doSth():
  # 把爬虫程序放在这个类里 zhilian_spider 是爬虫的name
  cmdline.execute('scrapy crawl zhilian_spider'.split())
# 想几点更新,定时到几点
def time_ti(h=17, m=54):
  while True:
    now = datetime.datetime.now()
    # print(now.hour, now.minute)
    if now.hour == h and now.minute == m:
      doSth()
    # 每隔60秒检测一次
    time.sleep(60)
time_ti()

3、更简单的写法

import time
import sys
import os
import datetime
def Dingshi():
while True:
os.system("scrapy crawl lcp")#lcp是我们爬虫的代码名字哦
time.sleep(60)
Dingshi()

知识点扩展:

直接使用Timer类实例代码

import time
import os
while True:
 os.system("scrapy crawl News")
 time.sleep(86400) #每隔一天运行一次 24*60*60=86400s或者,使用标准库的sched模块
import sched
#初始化sched模块的scheduler类
#第一个参数是一个可以返回时间戳的函数,第二个参数可以在定时未到达之前阻塞。
schedule = sched.scheduler ( time.time, time.sleep )
#被周期性调度触发的函数
def func():
 os.system("scrapy crawl News")
def perform1(inc):
 schedule.enter(inc,0,perform1,(inc,))
 func() # 需要周期执行的函数
def mymain():
 schedule.enter(0,0,perform1,(86400,))
if __name__=="__main__":
 mymain()
 schedule.run() # 开始运行,直到计划时间队列变成空为止关于cmd的实现方法,本人在单次执行爬虫程序时使用的是 
cmdline.execute("scrapy crawl News".split())但可能因为cmdline是scrapy模块中自带的,所以定时执行时只能执行一次就退出了。

到此这篇关于python中用Scrapy实现定时爬虫的实例讲解的文章就介绍到这了,更多相关python中使用Scrapy实现定时爬虫内容请搜索三水点靠木以前的文章或继续浏览下面的相关文章希望大家以后多多支持三水点靠木!

Python 相关文章推荐
进一步探究Python的装饰器的运用
May 05 Python
Python二分法搜索算法实例分析
May 11 Python
通过源码分析Python中的切片赋值
May 08 Python
python-opencv在有噪音的情况下提取图像的轮廓实例
Aug 30 Python
Python编程实现线性回归和批量梯度下降法代码实例
Jan 04 Python
Python3中关于cookie的创建与保存
Oct 21 Python
Python模拟浏览器上传文件脚本的方法(Multipart/form-data格式)
Oct 22 Python
详解python爬虫系列之初识爬虫
Apr 06 Python
利用Python库Scapy解析pcap文件的方法
Jul 23 Python
Python time库基本使用方法分析
Dec 13 Python
利用python中集合的唯一性实现去重
Feb 11 Python
pytorch判断是否cuda 判断变量类型方式
Jun 23 Python
java关于string最常出现的面试题整理
Jan 18 #Python
python爬虫实现爬取同一个网站的多页数据的实例讲解
Jan 18 #Python
python中四舍五入的正确打开方式
Jan 18 #Python
PyQt5中QSpinBox计数器的实现
Jan 18 #Python
全网最细 Python 格式化输出用法讲解(推荐)
Jan 18 #Python
PyQt实现计数器的方法示例
Jan 18 #Python
Python实现邮件发送的详细设置方法(遇到问题)
Jan 18 #Python
You might like
ThinkPHP结合ajax、Mysql实现的客户端通信功能代码示例
2014/06/23 PHP
自己写的兼容低于PHP 5.5版本的array_column()函数
2014/10/24 PHP
php类中的各种拦截器用法分析
2014/11/03 PHP
PHP关联数组实现根据元素值删除元素的方法
2015/06/26 PHP
PHP+MySQL实现无极限分类栏目的方法
2015/12/23 PHP
php5.2的curl-bug 服务器被php进程卡死问题排查
2016/09/19 PHP
PHP使用curl制作简易百度搜索
2016/11/03 PHP
PHP-FPM的配置与优化讲解
2019/03/15 PHP
jquery在IE、FF浏览器的差别详细探讨
2013/04/28 Javascript
初识Node.js
2014/09/03 Javascript
javascript精确统计网站访问量实例代码
2015/12/19 Javascript
javascript简单实现等比例缩小图片的方法
2016/07/27 Javascript
jquery实现ajax提交表单信息的简单方法(推荐)
2016/08/24 Javascript
H5图片压缩与上传实例
2017/04/21 Javascript
vue中v-cloak解决刷新或者加载出现闪烁问题(显示变量)
2018/04/20 Javascript
Angular请求防抖处理第一次请求失效问题
2019/05/17 Javascript
Django+Vue实现WebSocket连接的示例代码
2019/05/28 Javascript
javascript实现扫雷简易版
2020/08/18 Javascript
小程序实现上传视频功能
2020/08/18 Javascript
vue内置组件keep-alive事件动态缓存实例
2020/10/30 Javascript
JavaScript实现网页跨年倒计时
2020/12/02 Javascript
python opencv 实现读取、显示、写入图像的方法
2020/06/08 Python
Python运算符+与+=的方法实例
2021/02/18 Python
css3 线性渐变和径向渐变示例附图
2014/04/08 HTML / CSS
浅谈html5增强的页面元素
2016/06/14 HTML / CSS
加拿大在线旅游公司:Flighthub
2019/03/11 全球购物
统计员岗位职责
2013/11/14 职场文书
《夕阳真美》教学反思
2014/04/27 职场文书
化妆品活动策划方案
2014/05/23 职场文书
党的群众路线教育实践活动个人整改措施材料
2014/11/04 职场文书
2014年营销工作总结
2014/11/22 职场文书
感谢信的格式
2015/01/21 职场文书
幼儿园小班个人工作总结
2015/02/12 职场文书
2015年乡镇发展党员工作总结
2015/03/31 职场文书
MySQL数据库10秒内插入百万条数据的实现
2021/11/01 MySQL
mysql自增长id用完了该怎么办
2022/02/12 MySQL