【问题标题】:Create a corpus with a single file (webpage)使用单个文件(网页)创建语料库
【发布时间】:2012-03-22 13:45:55
【问题描述】:

我想从我的计算机中读取一个文件(该文件是一个 html 文档)并将其存储在语料库中(我正在使用包tm)。

你有什么解决办法吗?

这是我尝试过的:

data<-read.csv(fileName)
c2<-Corpus(VectorSource(data))

它主要工作,但我有时会收到错误:列多于列名

我想我不应该将read.csv 用于网页,因为我没有找到更好的解决方案。

感谢您的帮助 =)

【问题讨论】:

标签: file r


【解决方案1】:

网页肯定不符合 CSV 应有的规范。相反,您可能希望使用 XML 包中的 readHTMLTable 函数。


这是从实际网页中抓取的,但应该是相同的想法

file <- "http://xkcd.com/"
dat <- readLines(file)
c2 <- Corpus(VectorSource(dat))

【讨论】:

  • 感谢您的回答,但我不明白我应该如何使用 readHTMLTable 的结果创建语料库。你介意给我举个例子吗?
  • @user1278743 澄清一下,您是专门寻找 HTML 页面的文本,对吗?你真的不需要为你的语料库提取页面的表格,对吗?
  • @user1278743 啊,我明白了 - 你想退回什么?只是显示的文字? html标签也是如此?您能否提供更多关于您期望退货的详细信息。
  • 是的,我想要带有 html 标签和内容的文本。我想把整个文本放在一个语料库中。
猜你喜欢
  • 2019-07-17
  • 1970-01-01
  • 2011-05-15
  • 2017-07-10
  • 2016-09-22
  • 2016-03-17
  • 2015-08-02
相关资源
最近更新 更多