PHPAnalysis中文分词类详解


Posted in PHP onJune 13, 2014

PHPAnalysis是目前广泛使用的中文分词类,使用反向匹配模式分词,因此兼容编码更广泛,现将其变量与常用函数详解如下:

一、比较重要的成员变量

$resultType   = 1        生成的分词结果数据类型(1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文)
                                    这个变量一般用 SetResultType( $rstype ) 这方法进行设置。
$notSplitLen  = 5        切分句子最短长度
$toLower      = false    把英文单词全部转小写
$differMax    = false    使用最大切分模式对二元词进行消岐
$unitWord     = true     尝试合并单字(即是新词识别)
$differFreq   = false    使用热门词优先模式进行消岐

二、主要成员函数列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函数说明:构造函数
参数列表:
$source_charset      源字符串编码
$target_charset      目录字符串编码
$load_all            是否完全加载词典(此参数已经作废)
$source              源字符串
如果输入输出都是utf-8,实际上可以不必使用任何参数进行初始化,而是通过 SetSource 方法设置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函数说明:设置源字符串
参数列表:
$source              源字符串
$source_charset      源字符串编码
$target_charset      目录字符串编码
返回值:bool

3、public function StartAnalysis($optimize=true)
函数说明:开始执行分词操作
参数列表:
$optimize            分词后是否尝试优化结果
返回值:void
一个基本的分词过程:
//////////////////////////////////////
$pa = new PhpAnalysis();

$pa->SetSource('需要进行分词的字符串');

//设置分词属性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//获取你想要的结果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函数说明:设置返回结果的类型
实际是对成员变量$resultType的操作
参数 $rstype 值为:
1 为全部, 2为 词典词汇及单个中日韩简繁字符及英文, 3 为词典词汇及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函数说明:获取出现频率最高的指定词条数(通常用于提取文档关键字)
参数列表:
$num = 10  返回词条个数
返回值:用","分隔的关键字列表

6、public function GetFinallyResult($spword=' ')
函数说明:获得最终分词结果
参数列表:
$spword    词条之间的分隔符
返回值:string

7、public function GetSimpleResult()
函数说明:获得粗分结果
返回值:array

8、public function GetSimpleResultAll()
函数说明:获得包含属性信息的粗分结果
属性(1中文词句、2 ANSI词汇(包括全角),3 ANSI标点符号(包括全角),4数字(包括全角),5 中文标点或无法识别字符)
返回值:array

9、public function GetFinallyIndex()
函数说明:获取hash索引数组
返回值:array('word'=>count,...) 按出现频率排序

10、public function MakeDict( $source_file, $target_file='' )
函数说明:把文本文件词库编译成词典
参数列表:
$source_file   源文本文件
$target_file   目标文件(如果不指定,则为当前词典)
返回值:void

11、public function ExportDict( $targetfile )
函数说明:导出当前词典全部词条为文本文件
参数列表:
$targetfile  目标文件
返回值:void

PHP 相关文章推荐
用PHP函数解决SQL injection
Dec 09 PHP
PHP URL参数获取方式的四种例子
Feb 28 PHP
Yii2隐藏frontend/web和backend/web的方法
Dec 12 PHP
浅谈php中的访问修饰符private、protected、public的作用范围
Nov 20 PHP
PHP使用栈解决约瑟夫环问题算法示例
Aug 27 PHP
Docker搭建自己的PHP开发环境
Feb 24 PHP
分析php://output和php://stdout的区别
May 06 PHP
PHP获取日期对应星期、一周日期、星期开始与结束日期的方法
Jun 22 PHP
PHP实现八皇后算法
May 06 PHP
PHP 实现文件压缩解压操作的方法
Jun 14 PHP
php+lottery.js实现九宫格抽奖功能
Jul 21 PHP
Laravel find in set排序实例
Oct 09 PHP
ThinkPHP缓存方法S()概述
Jun 13 #PHP
采用ThinkPHP中F方法实现快速缓存实例
Jun 13 #PHP
浅析ThinkPHP中execute和query方法的区别
Jun 13 #PHP
采用thinkphp自带方法生成静态html文件详解
Jun 13 #PHP
PHP中使用gettext解决国际化问题的例子(i18n)
Jun 13 #PHP
Yii结合CKEditor实现图片上传功能
Jun 13 #PHP
在Yii框架中使用PHP模板引擎Twig的例子
Jun 13 #PHP
You might like
PHP 数据结构 算法描述 冒泡排序 bubble sort
2011/07/10 PHP
PHP动态输出JavaScript代码实例
2015/02/12 PHP
Zend Framework教程之Zend_Config_Xml用法分析
2016/03/23 PHP
PHP实现登陆表单提交CSRF及验证码
2017/01/24 PHP
PHP网页安全认证的实例详解
2017/09/28 PHP
PHP二维数组实现去除重复项的方法【保留各个键值】
2017/12/21 PHP
跨域表单提交状态的变相判断代码
2009/11/12 Javascript
使用js正则控制input标签只允许输入的值
2013/07/29 Javascript
简单时间提示DEMO从0开始一直进行计时
2013/11/19 Javascript
jquery ajax跨域解决方法(json方式)
2014/02/04 Javascript
jQuery中复合属性选择器用法实例
2014/12/31 Javascript
JavaScript内存管理介绍
2015/03/13 Javascript
jquery自定义表格样式
2015/11/23 Javascript
基于iscroll.js实现下拉刷新和上拉加载效果
2016/11/28 Javascript
在 Angular中 使用 Lodash 的方法
2018/02/11 Javascript
在vue项目中使用Jquery-contextmenu插件的步骤讲解
2019/01/27 jQuery
如何在Node和浏览器控制台中打印彩色文字
2020/01/09 Javascript
JS常用正则表达式超全集(密码强度校验,金额校验,IE版本,IPv4,IPv6校验)
2020/02/03 Javascript
详解node和ES6的模块导出与导入
2020/02/19 Javascript
js实现自定义滚动条的示例
2020/10/27 Javascript
[02:37]2018DOTA2亚洲邀请赛赛前采访 VP.no[o]ne心中最强SOLO是谁
2018/04/04 DOTA
详解Python设计模式编程中观察者模式与策略模式的运用
2016/03/02 Python
利用信号如何监控Django模型对象字段值的变化详解
2017/11/27 Python
python模块smtplib学习
2018/05/22 Python
Python 限制线程的最大数量的方法(Semaphore)
2019/02/22 Python
python openpyxl使用方法详解
2019/07/18 Python
手机使用python操作图片文件(pydroid3)过程详解
2019/09/25 Python
python PIL/cv2/base64相互转换实例
2020/01/09 Python
css3动画事件—webkitAnimationEnd与计时器time事件
2013/01/31 HTML / CSS
Sephora丝芙兰印尼官方网站:购买化妆品和护肤品
2018/07/02 全球购物
马来西亚最热门的在线时尚商店:FashionValet
2018/11/11 全球购物
幼儿园教师自我鉴定
2014/03/20 职场文书
政府领导干部个人对照检查材料思想汇报
2014/09/24 职场文书
论文致谢词范文
2015/05/14 职场文书
关于车尾的标语大全
2015/08/11 职场文书
SQL Server一个字符串拆分多行显示或者多行数据合并成一个字符串
2022/05/25 SQL Server