【发布时间】:2012-04-10 03:32:54
【问题描述】:
我正在使用包tm。我有一个充满 html 文档的语料库,我想删除除 html 标签之外的所有内容。这几天我一直在尝试这样做,但我似乎无法找到任何好的解决方案。
例如,假设我有一个这样的文档:
<html>
<body>
<h1>hello</h1>
</body>
</html>
我希望文档变成这样:
<html> <body> <h1>
(或者使用结束标签,我真的不介意。)
我的目标是计算每个标签在文档中的使用次数。
【问题讨论】:
标签: regex r text-mining tm