【问题标题】:Transporting Sparse Matrix from Python to R将稀疏矩阵从 Python 传输到 R
【发布时间】:2015-06-05 21:15:03
【问题描述】:

我正在用 Python 做一些文本分析工作。不幸的是,我需要切换到 R 才能使用特定的包(不幸的是,无法在 Python 中轻松复制该包)。

目前文本被解析成二元计数,减少到大约 11000 个二元的词汇,然后存储为字典:

{id1: {'bigrams':[(bigram1, count), (bigram2, count), ...]},
id2: {'bigrams': ...} 

我需要将它放入 R 中的 dgCMatrix 中,其中行是 id1、id2、...,列是不同的二元组,因此一个单元格代表该 id-二元组的“计数”。

有什么建议吗?我曾考虑将其扩展为大型 CSV,但这似乎效率极低,而且由于内存限制可能不可行。

【问题讨论】:

  • 具有实际值且数量更多的示例可能更有用。因为您希望我们在尝试编码之前做很多工作。也许你喜欢 Python 编码器比这个软弱的 R 编码器更能掌握这种布局,但你能提供更多的内容吗?

标签: python r sparse-matrix text-analysis


【解决方案1】:

您能否使用scipymmwrite 以MatrixMarket 格式写出矩阵,然后使用Matrix 包中的readMM 将其读入R?

【讨论】:

  • 这成功了!这不是一种超级高效的内存效率方式(据我所知),但设法让它在我的计算机上运行得很好。
  • 希望它非常省时!哈哈! :) 很高兴我能帮上忙。
猜你喜欢
  • 2015-10-14
  • 2023-04-10
  • 2012-09-04
  • 2022-08-18
  • 2018-01-19
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多