【发布时间】:2012-02-19 18:07:44
【问题描述】:
我正在使用 libsvm 来预测情绪。我想知道输入必须采用什么格式 假设我正在使用字数统计。
[label] [index]:[value] [index]:[value]
这是 libsvm 所需的格式。那么这是否意味着我只有两个标签(一个代表正面,一个代表负面),索引将是该标签下的每个单词,值将是每个单词的频率?
这是否也意味着我需要存储单词到索引的映射以在我的测试集中使用?
【问题讨论】:
我正在使用 libsvm 来预测情绪。我想知道输入必须采用什么格式 假设我正在使用字数统计。
[label] [index]:[value] [index]:[value]
这是 libsvm 所需的格式。那么这是否意味着我只有两个标签(一个代表正面,一个代表负面),索引将是该标签下的每个单词,值将是每个单词的频率?
这是否也意味着我需要存储单词到索引的映射以在我的测试集中使用?
【问题讨论】:
请查看 libsvm 中给出的示例文件。它被称为heart_scale。遵循那个...这是一个很好的例子...
【讨论】:
LIBSVM 使用所谓的“稀疏”格式,不需要存储零值。因此具有属性的数据
5 0 2 0
表示为
1:5 3:2
因此,您只需指定 nonzero 属性的 index 和 value。
标签位于第一列。对于二进制情况,您可以将 +1 用于正样本,将 -1 用于负样本。顺便说一句,您不仅限于 2 个标签。您可以使用其他数字(例如 1,2,3,4,5,...)
【讨论】: