PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
PHP define函数的使用说明
Aug 27 PHP
PHP无限分类代码,支持数组格式化、直接输出菜单两种方式
May 18 PHP
php抓取页面的几种方法详解
Jun 17 PHP
PHP5多态性与动态绑定介绍
Apr 03 PHP
php中使用gd库实现远程图片下载实例
May 12 PHP
PHP处理会话函数大总结
Aug 05 PHP
PHP安全下载文件的方法
Apr 07 PHP
PHP导出带样式的Excel示例代码
Aug 28 PHP
[企业公众号]升级到[企业微信]之后发送消息失败的解决方法
Jun 30 PHP
PHP异常处理定义与使用方法分析
Jul 25 PHP
php使用 readfile() 函数设置文件大小大小的方法
Aug 11 PHP
php使用fputcsv实现大数据的导出操作详解
Feb 27 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
PHP中的日期及时间
2006/11/23 PHP
asp和php下textarea提交大量数据发生丢失的解决方法
2008/01/20 PHP
smarty内置函数capture用法分析
2015/01/22 PHP
Yii框架分页实现方法详解
2017/05/20 PHP
PHP PDOStatement::errorInfo讲解
2019/01/31 PHP
js change,propertychange,input事件小议
2011/12/20 Javascript
ECMAScript6中Map/WeakMap详解
2015/06/12 Javascript
Bootstrap基本插件学习笔记之标签切换(17)
2016/12/08 Javascript
jQuery分页插件jquery.pagination.js使用方法解析
2017/02/09 Javascript
javascript 中iframe高度自适应(同域)实例详解
2017/05/16 Javascript
结合mint-ui移动端下拉加载实践方法总结
2017/11/08 Javascript
Angular实现表单验证功能
2017/11/13 Javascript
jQuery替换节点元素的操作方法
2018/03/18 jQuery
vue实现可视化可拖放的自定义表单的示例代码
2019/03/20 Javascript
js 将多个对象合并成一个对象 assign方法的实现
2020/09/24 Javascript
js前端传json后台接收‘‘被转为quot的问题解决
2020/11/12 Javascript
[01:03:51]2018DOTA2亚洲邀请赛 4.7 淘汰赛 VP vs LGD 第三场
2018/04/09 DOTA
[39:00]Optic vs VP 2018国际邀请赛淘汰赛BO3 第三场 8.24
2018/08/25 DOTA
编写同时兼容Python2.x与Python3.x版本的代码的几个示例
2015/03/30 Python
python实现本地图片转存并重命名的示例代码
2018/10/27 Python
python里 super类的工作原理详解
2019/06/19 Python
图文详解Django使用Pycharm连接MySQL数据库
2019/08/09 Python
Python装饰器的应用场景代码总结
2020/04/10 Python
python二维图制作的实例代码
2020/12/03 Python
浅谈CSS3特性查询(Feature Query: @supports)功能简介
2017/07/31 HTML / CSS
南非最大的在线时尚商店:Zando
2019/07/21 全球购物
美国轻奢时尚购物网站:REVOLVE(支持中文)
2020/07/18 全球购物
汽车销售求职自荐信
2013/10/01 职场文书
《满井游记》教学反思
2014/02/26 职场文书
竞聘书格式及范文
2014/03/31 职场文书
好的促销活动方案
2014/08/21 职场文书
2015年检验员工作总结范文
2015/04/30 职场文书
班主任开场白
2015/06/01 职场文书
OpenCV 图像梯度的实现方法
2021/07/25 Python
Redis字典实现、Hash键冲突及渐进式rehash详解
2021/09/04 Redis
Android基础入门之dataBinding的简单使用教程
2022/06/21 Java/Android