分词工具对比
选择LTP、ICTCLAS、结巴分词等国内代表分词软件与THULAC做性能比较。我们选择Windows作为测试环境,根据第二届国际汉语分词测评发布的国际中文分词测评标准,对不同软件进行了速度和准确率测试。
在第二届国际汉语分词测评中,共有四家单位提供的测试语料(Academia Sinica、 City University 、Peking University 、Microsoft Research), 在评测提供的资源icwb2-data中包含了来自这四家单位的训练集(training)、测试集(testing), 以及根据各自分词标准而提供的相应测试集的标准答案(icwb2-data/scripts/gold).在icwb2-data/scripts目录下含有对分词进行自动评分的perl脚本score。
我们在统一测试环境下,对若干流行分词软件和THULAC进行了测试,使用的模型为各分词软件自带模型。THULAC使用的是随软件提供的简单模型Model_1。评测环境为 Intel Core i5 2.4 GHz 评测结果如下:
msr_test(560KB)
AlgorithmTimePrecisionRecallLTP-3.2.03.21s0.8670.896ICTCLAS(2015版)0.55s0.8690.914jieba0.26s0.8140.809THULAC0.62s0.8770.899
pku_test(510KB)
AlgorithmTimePrecisionRecallLTP-3.2.03.83s0.9600.947ICTCLAS(2015版)0.53s0.9390.944jieba0.23s0.8500.784THULAC0.51s0.9440.908
除了以上在标准测试集上的评测,我们也对各个分词工具在大数据上的速度进行了评测,结果如下:
CNKI_journal.txt(51 MB)
AlgorithmTimeSpeedLTP-3.2.0348.624s149.80KB/sICTCLAS(2015版)106.461s490.59KB/sjieba22.5583s2314.89KB/sTHULAC42.625s1221.05KB/s