python 全文检索引擎详解


Posted in Python onApril 25, 2017

python 全文检索引擎详解

最近一直在探索着如何用Python实现像百度那样的关键词检索功能。说起关键词检索,我们会不由自主地联想到正则表达式。正则表达式是所有检索的基础,python中有个re类,是专门用于正则匹配。然而,光光是正则表达式是不能很好实现检索功能的。

python有一个whoosh包,是专门用于全文搜索引擎。

whoosh在国内使用的比较少,而它的性能还没有sphinx/coreseek成熟,不过不同于前者,这是一个纯python库,对python的爱好者更为方便使用。具体的代码如下

安装

输入命令行 pip install whoosh

需要导入的包有:

fromwhoosh.index import create_in

fromwhoosh.fields import *

fromwhoosh.analysis import RegexAnalyzer

fromwhoosh.analysis import Tokenizer,Token

中文分词解析器

class ChineseTokenizer(Tokenizer):
  """
  中文分词解析器
  """
  def __call__(self, value, positions=False, chars=False,
         keeporiginal=True, removestops=True, start_pos=0, start_char=0,
         mode='', **kwargs):
    assert isinstance(value, text_type), "%r is not unicode "% value
    t = Token(positions, chars, removestops=removestops, mode=mode, **kwargs)
    list_seg = jieba.cut_for_search(value)
    for w in list_seg:
      t.original = t.text = w
      t.boost = 0.5
      if positions:
        t.pos = start_pos + value.find(w)
      if chars:
        t.startchar = start_char + value.find(w)
        t.endchar = start_char + value.find(w) + len(w)
      yield t


def chinese_analyzer():
  return ChineseTokenizer()

构建索引的函数

@staticmethod
  def create_index(document_dir):
    analyzer = chinese_analyzer()
    schema = Schema(titel=TEXT(stored=True, analyzer=analyzer), path=ID(stored=True),
            content=TEXT(stored=True, analyzer=analyzer))
    ix = create_in("./", schema)
    writer = ix.writer()
    for parents, dirnames, filenames in os.walk(document_dir):
      for filename in filenames:
        title = filename.replace(".txt", "").decode('utf8')
        print title
        content = open(document_dir + '/' + filename, 'r').read().decode('utf-8')
        path = u"/b"
        writer.add_document(titel=title, path=path, content=content)
    writer.commit()

检索函数

@staticmethod
  def search(search_str):
    title_list = []
    print 'here'
    ix = open_dir("./")
    searcher = ix.searcher()
    print search_str,type(search_str)
    results = searcher.find("content", search_str)
    for hit in results:
      print hit['titel']
      print hit.score
      print hit.highlights("content", top=10)
      title_list.append(hit['titel'])
    print 'tt',title_list
    return title_list

感谢阅读,希望能帮助到大家,谢谢大家对本站的支持!

Python 相关文章推荐
Python代理抓取并验证使用多线程实现
May 03 Python
Python代码调试的几种方法总结
Apr 15 Python
Django如何配置mysql数据库
May 04 Python
对python中array.sum(axis=?)的用法介绍
Jun 28 Python
pygame游戏之旅 添加游戏暂停功能
Nov 21 Python
django小技巧之html模板中调用对象属性或对象的方法
Nov 30 Python
Python中如何使用if语句处理列表实例代码
Feb 24 Python
python中的数据结构比较
May 13 Python
python中 _、__、__xx__()区别及使用场景
Jun 30 Python
python 实现定时任务的四种方式
Apr 01 Python
python文件名批量重命名脚本实例代码
Apr 22 Python
Python源码解析之List
May 21 Python
window下eclipse安装python插件教程
Apr 24 #Python
Python处理PDF及生成多层PDF实例代码
Apr 24 #Python
python爬虫框架scrapy实战之爬取京东商城进阶篇
Apr 24 #Python
python爬虫实战之爬取京东商城实例教程
Apr 24 #Python
python中urllib.unquote乱码的原因与解决方法
Apr 24 #Python
Python面向对象特殊成员
Apr 24 #Python
Python解惑之整数比较详解
Apr 24 #Python
You might like
PHP最常用的ini函数分析 针对PHP.ini配置文件
2010/04/22 PHP
编写Smarty插件在模板中直接加载数据的详细介绍
2013/06/26 PHP
php遍历文件夹下的所有文件和子文件夹示例
2014/03/20 PHP
将CMYK颜色值和RGB颜色相互转换的PHP代码
2014/07/28 PHP
PHP答题类应用接口实例
2015/02/09 PHP
PHP JWT初识及其简单示例
2018/10/10 PHP
jquery 学习之二 属性相关
2010/11/23 Javascript
js 获取和设置css3 属性值的实现方法
2013/05/06 Javascript
node.js中的fs.open方法使用说明
2014/12/17 Javascript
jQuery实现仿淘宝带有指示条的图片转动切换效果完整实例
2015/03/04 Javascript
JavaScript位置与大小(1)之正确理解和运用与尺寸大小相关的DOM属性
2015/12/26 Javascript
EasyUI的doCellTip实现鼠标放到单元格上提示单元格内容
2016/08/24 Javascript
基于Layer+jQuery的自定义弹框
2020/05/26 Javascript
vue基于Vue2.0和高德地图的地图组件实例
2017/04/28 Javascript
JS实现多张图片预览同步上传功能
2017/06/23 Javascript
vue+element-ui+ajax实现一个表格的实例
2018/03/09 Javascript
关于jquery layui弹出层的使用方法
2018/04/21 jQuery
微信小程序手动添加收货地址省市区联动
2020/05/18 Javascript
微信小程序自定义联系人弹窗
2020/05/26 Javascript
python转换字符串为摩尔斯电码的方法
2015/07/06 Python
python中星号变量的几种特殊用法
2016/09/07 Python
使用python实现个性化词云的方法
2017/06/16 Python
Python实现完整的事务操作示例
2017/06/20 Python
详解Django项目中模板标签及模板的继承与引用(网站中快速布置广告)
2019/03/27 Python
python 爬取学信网登录页面的例子
2019/08/13 Python
公认8个效率最高的爬虫框架
2020/07/28 Python
美国婴童服装市场上的领先品牌:Carter’s
2018/02/08 全球购物
荷兰和比利时时尚鞋店:Van Dalen
2018/04/23 全球购物
eDreams德国:南欧领先的在线旅游公司
2020/12/07 全球购物
市级青年文明号申报材料
2014/05/26 职场文书
运动会宣传口号
2014/06/09 职场文书
客户答谢会致辞
2015/01/20 职场文书
党员个人总结范文
2015/02/14 职场文书
python - asyncio异步编程
2021/04/06 Python
据Python爬虫不靠谱预测可知今年双十一销售额将超过6000亿元
2021/11/11 Python
Java+swing实现抖音上的表白程序详解
2022/06/25 Java/Android