1. 数据集

THUCNews中文数据集:
THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成,包含74万篇新闻文档(2.19 GB),均为UTF-8纯文本格式。我们在原始新浪新闻分类体系的基础上,重新整合划分出14个候选分类类别:财经、**、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。使用THUCTC工具包在此数据集上进行评测,准确率可以达到88.6%。
使用方法
提供了两种方式运行工具包:

使用java开发工具,例如eclipse,将包括lib\THUCTC_java_v1.jar在内的lib文件夹下的包导入自己的工程中,仿照Demo.java程序调用函数即可
使用根目录下的THUCTC_java_v1_run.jar运行工具包。
使用命令 java -jar THUCTC_java_v1_run.jar + 程序参数

运行参数

[-c CATEGORY_LIST_FILE_PATH] 从文件中读入类别信息。该文件中每行包含且仅包含一个类别名称。
[-train TRAIN_PATH] 进行训练,并设置训练语料文件夹路径。该文件夹下每个子文件夹的名称都对应一个类别名称,内含属于该类别的训练语料。若不设置,则不进行训练。
[-test EVAL_PATH] 进行评测,并设置评测语料文件夹路径。该文件夹下每个子文件夹的名称都对应一个类别名称,内含属于该类别的评测语料。若不设置,则不进行评测。也可以使用-eval。
[-classify FILE_PATH] 对一个文件进行分类。
[-n topN] 设置返回候选分类数,按得分大小排序。默认为1,即只返回最可能的分类。
[-svm libsvm or liblinear] 选择使用libsvm还是liblinear进行训练和测试,默认使用liblinear。
[-l LOAD_MODEL_PATH] 设置读取模型路径。
[-s SAVE_MODEL_PATH] 设置保存模型路径。
[-f FEATURE_SIZE] 设置保留特征数目,默认为5000。
[-d1 RATIO] 设置训练集占总文件数比例,默认为0.8。
[-d2 RATIO] 设置测试集占总文件数比例,默认为0.2。
[-e ENCODING] 设置训练及测试文件编码,默认为UTF-8。
[-filter SUFFIX] 设置文件后缀过滤。例如设置“-filter .txt”,则训练和测试时仅考虑文件名后缀为.txt的文件。

IMDB英文数据集:
1、下载地址
http://thuctc.thunlp.org/sendMessage
2、数据集介绍:
THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成,包含74万篇新闻文档(2.19 GB),均为UTF-8纯文本格式。我们在原始新浪新闻分类体系的基础上,重新整合划分出14个候选分类类别:财经、**、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。使用THUCTC工具包在此数据集上进行评测,准确率可以达到88.6%
3、数据集分析
THUCNews中文数据集:
cnews.vocab.txt
cnews.train.txt是训练数据
cnews.val.txt是验证数据
cnews.test.txt是测试数据

2. IMDB数据集下载和探索模块及指标学习模块

3. THUCNews数据集下载和探索

4. 学习召回率、准确率、ROC曲线、AUC、PR曲线这些基本概念

**ROC曲线:**在ROC曲线中,以FPR为x轴,TPR为y轴
自然语言处理数据集和性能
在ROC空间,ROC曲线越凸向左上方向效果越好,
AUC:AUC即是ROC下方与x轴上方围成的面积
自然语言处理数据集和性能
PR曲线:
自然语言处理数据集和性能
自然语言处理数据集和性能自然语言处理数据集和性能

相关文章:

  • 2021-04-09
  • 2021-08-14
  • 2021-09-23
猜你喜欢
  • 2021-10-17
  • 2022-12-23
  • 2022-12-23
  • 2021-12-04
  • 2021-12-25
  • 2021-12-12
相关资源
相似解决方案