【发布时间】:2012-06-23 21:36:29
【问题描述】:
我正在使用 scikit-learn 对文本文档进行聚类。我正在使用 CountVectorizer、TfidfTransformer 和 MiniBatchKMeans 类来帮助我做到这一点。 新的文本文档一直添加到系统中,这意味着我需要使用上面的类来转换文本并预测一个聚类。我的问题是:我应该如何将数据存储在磁盘上? 我应该简单地腌制矢量化器、转换器和 kmeans 对象吗? 我应该只保存数据吗?如果是这样,如何将其添加回矢量化器、转换器和 kmeans 对象?
任何帮助将不胜感激
【问题讨论】:
标签: python machine-learning data-mining scikit-learn