自然语言处理数据集和性能

1. 数据集

THUCNews中文数据集:
THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成，包含74万篇新闻文档（2.19 GB），均为UTF-8纯文本格式。我们在原始新浪新闻分类体系的基础上，重新整合划分出14个候选分类类别：财经、**、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。使用THUCTC工具包在此数据集上进行评测，准确率可以达到88.6%。
使用方法：
提供了两种方式运行工具包：

使用java开发工具，例如eclipse，将包括lib\THUCTC_java_v1.jar在内的lib文件夹下的包导入自己的工程中，仿照Demo.java程序调用函数即可
使用根目录下的THUCTC_java_v1_run.jar运行工具包。
使用命令 java -jar THUCTC_java_v1_run.jar + 程序参数

运行参数

[-c CATEGORY_LIST_FILE_PATH] 从文件中读入类别信息。该文件中每行包含且仅包含一个类别名称。
[-train TRAIN_PATH] 进行训练，并设置训练语料文件夹路径。该文件夹下每个子文件夹的名称都对应一个类别名称，内含属于该类别的训练语料。若不设置，则不进行训练。
[-test EVAL_PATH] 进行评测，并设置评测语料文件夹路径。该文件夹下每个子文件夹的名称都对应一个类别名称，内含属于该类别的评测语料。若不设置，则不进行评测。也可以使用-eval。
[-classify FILE_PATH] 对一个文件进行分类。
[-n topN] 设置返回候选分类数，按得分大小排序。默认为1，即只返回最可能的分类。
[-svm libsvm or liblinear] 选择使用libsvm还是liblinear进行训练和测试，默认使用liblinear。
[-l LOAD_MODEL_PATH] 设置读取模型路径。
[-s SAVE_MODEL_PATH] 设置保存模型路径。
[-f FEATURE_SIZE] 设置保留特征数目，默认为5000。
[-d1 RATIO] 设置训练集占总文件数比例，默认为0.8。
[-d2 RATIO] 设置测试集占总文件数比例，默认为0.2。
[-e ENCODING] 设置训练及测试文件编码，默认为UTF-8。
[-filter SUFFIX] 设置文件后缀过滤。例如设置“-filter .txt”，则训练和测试时仅考虑文件名后缀为.txt的文件。

IMDB英文数据集:
1、下载地址
http://thuctc.thunlp.org/sendMessage
2、数据集介绍：
THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成，包含74万篇新闻文档（2.19 GB），均为UTF-8纯文本格式。我们在原始新浪新闻分类体系的基础上，重新整合划分出14个候选分类类别：财经、**、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。使用THUCTC工具包在此数据集上进行评测，准确率可以达到88.6%
3、数据集分析
THUCNews中文数据集：
cnews.vocab.txt
cnews.train.txt是训练数据
cnews.val.txt是验证数据
cnews.test.txt是测试数据

2. IMDB数据集下载和探索模块及指标学习模块

3. THUCNews数据集下载和探索

4. 学习召回率、准确率、ROC曲线、AUC、PR曲线这些基本概念

**ROC曲线:**在ROC曲线中，以FPR为x轴，TPR为y轴
自然语言处理数据集和性能
在ROC空间，ROC曲线越凸向左上方向效果越好，
AUC:AUC即是ROC下方与x轴上方围成的面积

PR曲线: