【问题标题】:Corpus not properly reading text in R语料库无法正确读取 R 中的文本
【发布时间】:2015-06-29 07:49:50
【问题描述】:

我正在使用“tm”R 包对一个小型推文数据集进行分析。数据位于 csv 文件中,包含一些元数据和推文本身,如下所示:

2461,1425999216,RT @victoriavaneyk: Bitcoin is being used by African migrant workers to send money home #Bitcoin http://t.co/z0Lkm2ncUw,2.9690174302789387

我将文件读入数据框并尝试从中构建语料库:

data <- read.csv(file, header=TRUE)
corpus <- Corpus(DataframeSource(data))

数据框似乎包含我所期望的内容,包括推文的文本。但是当我检查语料库时,似乎所有的文本都被某个整数值替换了。这个整数是从哪里来的?为什么推文的文字不见了?

> inspect(corpus[1])
<<VCorpus (documents: 1, metadata (corpus/indexed): 0/0)>>

[[1]]
<<PlainTextDocument (metadata: 7)>>
2461
1425999216
2940
2.96901743027894

【问题讨论】:

  • 试试data &lt;- read.csv(file, header=TRUE, stringsAsFactors=FALSE)
  • 成功了,谢谢!

标签: r twitter corpus


【解决方案1】:

data &lt;- read.csv(file, header=TRUE, stringsAsFactors=FALSE)

【讨论】:

  • 您应该添加其他信息来解释它的作用。
猜你喜欢
  • 2019-11-01
  • 1970-01-01
  • 2019-02-27
  • 1970-01-01
  • 2017-08-26
  • 2021-02-07
  • 2015-01-22
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多