【发布时间】:2012-03-22 13:45:55
【问题描述】:
我想从我的计算机中读取一个文件(该文件是一个 html 文档)并将其存储在语料库中(我正在使用包tm)。
你有什么解决办法吗?
这是我尝试过的:
data<-read.csv(fileName)
c2<-Corpus(VectorSource(data))
它主要工作,但我有时会收到错误:列多于列名
我想我不应该将read.csv 用于网页,因为我没有找到更好的解决方案。
感谢您的帮助 =)
【问题讨论】:
我想从我的计算机中读取一个文件(该文件是一个 html 文档)并将其存储在语料库中(我正在使用包tm)。
你有什么解决办法吗?
这是我尝试过的:
data<-read.csv(fileName)
c2<-Corpus(VectorSource(data))
它主要工作,但我有时会收到错误:列多于列名
我想我不应该将read.csv 用于网页,因为我没有找到更好的解决方案。
感谢您的帮助 =)
【问题讨论】:
网页肯定不符合 CSV 应有的规范。相反,您可能希望使用 XML 包中的 readHTMLTable 函数。
这是从实际网页中抓取的,但应该是相同的想法
file <- "http://xkcd.com/"
dat <- readLines(file)
c2 <- Corpus(VectorSource(dat))
【讨论】: