【发布时间】:2015-06-05 21:15:03
【问题描述】:
我正在用 Python 做一些文本分析工作。不幸的是,我需要切换到 R 才能使用特定的包(不幸的是,无法在 Python 中轻松复制该包)。
目前文本被解析成二元计数,减少到大约 11000 个二元的词汇,然后存储为字典:
{id1: {'bigrams':[(bigram1, count), (bigram2, count), ...]},
id2: {'bigrams': ...}
我需要将它放入 R 中的 dgCMatrix 中,其中行是 id1、id2、...,列是不同的二元组,因此一个单元格代表该 id-二元组的“计数”。
有什么建议吗?我曾考虑将其扩展为大型 CSV,但这似乎效率极低,而且由于内存限制可能不可行。
【问题讨论】:
-
具有实际值且数量更多的示例可能更有用。因为您希望我们在尝试编码之前做很多工作。也许你喜欢 Python 编码器比这个软弱的 R 编码器更能掌握这种布局,但你能提供更多的内容吗?
标签: python r sparse-matrix text-analysis