编程 PHP

一个PHP实现的轻量级简单爬虫

Posted in PHP onJuly 08, 2015

最近需要收集资料，在浏览器上用另存为的方式实在是很麻烦，而且不利于存储和检索。所以自己写了一个小爬虫，在网上爬东西，迄今为止，已经爬了近百万张网页。现在正在想办法着手处理这些数据。

爬虫的结构：
爬虫的原理其实很简单，就是分析下载的页面，找出其中的连接，然后再下载这些链接，再分析再下载，周而复始。在数据存储方面，数据库是首选，便于检索，而开发语言，只要支持正则表达式就可以了，数据库我选择了mysql，所以，开发脚本我选择了php。它支持perl兼容正则表达式，连接mysql很方便，支持http下载，而且windows系统和linux系统都可以部署。

正则表达式:
正则表达式是处理文字的基本工具，要取出html中的链接和图片，使用的正则表达式如下。

   "#<a[^>]+href=(['\"])(.+)\\1#isU"   处理链接

    "#<img[^>]+src=(['\"])(.+)\\1#isU" 处理图片

其他问题:
写爬虫还需要注意的一个问题是，对于已经下载过的url，不能重复进行下载，而有些网页的链接会形成环路，所以需要处理这个问题，我的处理方法是计算已经处理的url的MD5 值，并存入数据库，这样就可以检验是否已经下载过。当然还有更好的算法，有兴趣的话，可以在网上找一下。

相关协议:
爬虫也有自己的协议，有个robots.txt文件定义了那些是网站允许遍历的，但是由于我的时间有限，没有实现这个功能。

其他说明:
php支持类编程,我写的爬虫主要的类.
1.url处理web_site_info，主要用处理url，分析域名等。
2.数据库操作mysql_insert.php,处理和数据库相关的操作。
3.历史记录处理，记录已经处理的url。
4.爬虫类。

存在的问题和不足

这个爬虫在小数据量的情况下，运行良好，但是在大数据量的情况下，历史记录处理类的效率就不是很高，通过在数据库结构中，对相关字段进行了索引，速度有了提高，但是需要不断得读取数据，可能和php本身的array实现有关系，如果一次加载10万条历史记录，速度非常慢。
不支持多线程，每次只能处理一个url。
php运行本身有内存使用量限制，有一次在抓取深度为20的页面的时候，内存用尽程序被杀。

下面的url是源码下载。

使用的时候，先在mysql中创建net_spider数据库，然后用db.sql创建相关表。再在config.php中设置mysql 的用户名口令。
最后

php -f spider.php 深度(数值) url

就可以开始工作。如

php -f spider.php 20 http://news.sina.com.cn

现在感觉下来，其实做个爬虫没那么复杂，难的是数据的存储和检索。我现在的数据库，最大一个数据表已经15G，正在想办处理这些数据，mysql进行查询已经感觉有点力不从心了。这点上还真佩服google

<?php
#加载页面
function curl_get($url){
    $ch=curl_init();
    curl_setopt($ch,CURLOPT_URL,$url);
    curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
    curl_setopt($ch,CURLOPT_HEADER,1);
    $result=curl_exec($ch);
    $code=curl_getinfo($ch,CURLINFO_HTTP_CODE);
    if($code!='404' && $result){
     return $result;
    }
    curl_close($ch);
}
#获取页面url链接
function get_page_urls($spider_page_result,$base_url){
  $get_url_result=preg_match_all("/<[a|A].*?href=[\'\"]{0,1}([^>\'\"\]*).*?>/",$spider_page_result,$out);
  if($get_url_result){
    return $out[1];
  }else{
    return;
  }
}
#相对路径转绝对路径
function xdtojd($base_url,$url_list){
 if(is_array($url_list)){
  foreach($url_list as $url_item){
    if(preg_match("/^(http:\/\/|https:\/\/|javascript:)/",$url_item)){
      $result_url_list[]=$url_item;
    }else {
     if(preg_match("/^\//",$url_item)){
      $real_url = $base_url.$url_item;
     }else{
      $real_url = $base_url."/".$url_item;
     }
     #$real_url = 'http://www.sumpay.cn/'.$url_item; 
     $result_url_list[] = $real_url; 
    }
  }
   return $result_url_list;
 }else{
   return;
 }
}
#删除其他站点url
function other_site_url_del($jd_url_list,$url_base){
 if(is_array($jd_url_list)){
  foreach($jd_url_list as $all_url){
    echo $all_url;
    if(strpos($all_url,$url_base)===0){
     $all_url_list[]=$all_url;
    }  
  }
  return $all_url_list;
 }else{
  return;
 }
}
#删除相同URL
function url_same_del($array_url){
   if(is_array($array_url)){
     $insert_url=array();
     $pizza=file_get_contents("/tmp/url.txt");
     if($pizza){
        $pizza=explode("\r\n",$pizza);
        foreach($array_url as $array_value_url){
         if(!in_array($array_value_url,$pizza)){
          $insert_url[]=$array_value_url; 
         }
        }
        if($insert_url){
           foreach($insert_url as $key => $insert_url_value){
             #这里只做了参数相同去重处理
             $update_insert_url=preg_replace('/=[^&]*/','=leesec',$insert_url_value);
             foreach($pizza as $pizza_value){
                $update_pizza_value=preg_replace('/=[^&]*/','=leesec',$pizza_value);
                if($update_insert_url==$update_pizza_value){
                   unset($insert_url[$key]);
                   continue;
                }
             }
           }
        }     
     }else{
        $insert_url=array();
        $insert_new_url=array();
        $insert_url=$array_url;
        foreach($insert_url as $insert_url_value){
         $update_insert_url=preg_replace('/=[^&]*/','=leesec',$insert_url_value);
         $insert_new_url[]=$update_insert_url;  
        }
        $insert_new_url=array_unique($insert_new_url);
        foreach($insert_new_url as $key => $insert_new_url_val){
          $insert_url_bf[]=$insert_url[$key];
        } 
        $insert_url=$insert_url_bf;
     }
     return $insert_url;
   }else{
    return; 
   }
}
 
$current_url=$argv[1];
$fp_puts = fopen("/tmp/url.txt","ab");//记录url列表 
$fp_gets = fopen("/tmp/url.txt","r");//保存url列表 
$url_base_url=parse_url($current_url);
if($url_base_url['scheme']==""){
  $url_base="http://".$url_base_url['host'];
}else{
  $url_base=$url_base_url['scheme']."://".$url_base_url['host'];
}
do{
  $spider_page_result=curl_get($current_url);
  #var_dump($spider_page_result);
  $url_list=get_page_urls($spider_page_result,$url_base);
  #var_dump($url_list);
  if(!$url_list){
   continue;
  }
  $jd_url_list=xdtojd($url_base,$url_list);
  #var_dump($jd_url_list);
  $result_url_arr=other_site_url_del($jd_url_list,$url_base);
  var_dump($result_url_arr);
  $result_url_arr=url_same_del($result_url_arr); 
  #var_dump($result_url_arr); 
  if(is_array($result_url_arr)){ 
    $result_url_arr=array_unique($result_url_arr);
       foreach($result_url_arr as $new_url) { 
         fputs($fp_puts,$new_url."\r\n"); 
       }
  }
}while ($current_url = fgets($fp_gets,1024));//不断获得url 
preg_match_all("/<a[^>]+href=[\"']([^\"']+)[\"'][^>]+>/",$spider_page_result,$out);
# echo a href
#var_dump($out[1]);
?>

一个PHP实现的轻量级简单爬虫

- Author -

junjie

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

PHP 相关文章推荐

PHP4.04简明安装

Oct 09 PHP

PHP array_push 数组函数

Dec 26 PHP

JpGraph php柱状图使用介绍

Aug 23 PHP

PHP调用MsSQL Server 2012存储过程获取多结果集(包含output参数)的详解

Jul 03 PHP

php解决抢购秒杀抽奖等大流量并发入库导致的库存负数的问题

Jun 19 PHP

利用“多说”制作留言板、评论系统

Jul 14 PHP

PHP下载文件的函数实例代码

May 18 PHP

PHP中的密码加密的解决方案总结

Oct 26 PHP

PHP获取文本框、密码域、按钮的值实例代码

Apr 19 PHP

php实现的统计字数函数定义与使用示例

Jul 26 PHP

PHP文件后缀不强制为.php方法

Mar 31 PHP

php实现微信和支付宝支付的示例代码

Aug 11 PHP

PHP设置进度条的方法

Jul 08 #PHP

smarty内部日期函数html_select_date()用法实例分析

Jul 08 #PHP

php类的定义与继承用法实例

Jul 07 #PHP

php抽象类用法实例分析

Jul 07 #PHP

PHP导入导出Excel代码

Jul 07 #PHP

一张表搞清楚php is_null、empty、isset的区别

Jul 07 #PHP

10条php编程小技巧

Jul 07 #PHP

You might like

PHP运行环境配置与开发环境的配置(图文教程)

2013/06/04 PHP

codeigniter使用技巧批量插入数据实例方法分享

2013/12/31 PHP

php判断一个数组是否为有序的方法

2015/03/27 PHP

PHP目录与文件操作技巧总结(创建,删除,遍历,读写,修改等)

2016/09/11 PHP

PHP基于方差和标准差计算学生成绩的稳定性示例

2017/07/04 PHP

jQuery select的操作实现代码

2009/05/06 Javascript

javascript 延迟加载技术(lazyload)简单实现

2011/01/17 Javascript

jquery的index方法实现tab效果

2011/02/16 Javascript

一行代码实现纯数据json对象的深度克隆实现思路

2013/01/09 Javascript

JavaScript通过RegExp实现客户端验证处理程序

2013/05/07 Javascript

jquery鼠标滑过提示title具体实现代码

2013/08/06 Javascript

indexOf 和 lastIndexOf 使用示例介绍

2014/09/02 Javascript

JavaScript定时显示广告代码分享

2015/03/02 Javascript

jquery控制表单输入框显示默认值的方法

2015/05/22 Javascript

JS实现Select的option上下移动的方法

2016/03/01 Javascript

jquery+json实现分页效果

2016/03/07 Javascript

微信小程序开发之tabbar图标和颜色的实现

2018/10/17 Javascript

JS实现选项卡效果的代码实例

2019/05/20 Javascript

express + jwt + postMan验证实现持久化登录

2019/06/05 Javascript

python获取目录下所有文件的方法

2015/06/01 Python

pygame游戏之旅添加键盘按键的方法

2018/11/20 Python

python 生成任意形状的凸包图代码

2020/04/16 Python

python爬虫基础知识点整理

2020/06/02 Python

实例教程纯CSS3打造非常炫的加载动画效果

2014/11/05 HTML / CSS

乌克兰移动电子产品和相关配件的在线商店：iTMag

2020/03/16 全球购物

PHP经典面试题

2016/09/03 面试题

毕业生优秀推荐信

2013/11/26 职场文书

愚人节活动策划方案

2014/03/11 职场文书

舞蹈专业大学生职业规划范文

2014/03/12 职场文书

放飞中国梦演讲稿

2014/04/23 职场文书

青年志愿者活动方案

2014/08/17 职场文书

2014年村计划生育工作总结

2014/11/14 职场文书

综合办公室岗位职责

2015/04/11 职场文书

运动员加油词

2015/07/18 职场文书

你有一份《诚信考试承诺书》待领取

2019/11/13 职场文书

话题作文之财富（600字）

2019/12/03 职场文书