【发布时间】:2013-12-08 03:29:50
【问题描述】:
尝试为庞大的数据集进行多标签分类。我有大约 4000 个独特的标签,所以当我尝试使用 LabelBinarizer().fit(yTuple)/transform 时,它只需要很长时间。根据标签的数量和行数(600 万行)是正常的还是我做错了什么?
笔记本电脑配置:Mac,i5 四核,16 GB RAM,剩余足够的硬盘空间(大约 250 GB 可用空间)
代码很简单,但还是贴在这里:
yTuple = [tuple(item.split(' ')) for item in getY(filepath)]
lb = LabelBinarizer().fit(yTuple)
Y_indicator = lb.transform(yTuple)
getY(filepath) - 这将一次返回一行的标签集。
【问题讨论】:
标签: scikit-learn