【发布时间】:2012-09-15 12:53:59
【问题描述】:
首先我使用的 IDE 是带有 .net 框架的可视化 C#。
好的,我有大约 20,000 个 html 文档,其中包含我需要提取并按日期顺序排序的信息。
文件上的日期存储在这个html标签中
<td valign="top" class="createdate">
Tuesday, 03 April 2012 20:39
</td>
注意:每个 html 文件中的所有日期都采用该格式
我想提取日期,然后想自动阅读每个 html 文档并测量短语或单词的出现次数。
我不是要求某人为我创建整个程序,但如果您能提供尽可能多的详细信息,说明我如何对这 20000 个 html 文件进行排序并提取单词或短语的出现日期和次数,然后将其导出将信息转换为 word 格式或 excel 我将不胜感激。
哦,我正在使用这些数据来研究我的论文,我知道如何对井字符串和所有字符串方法进行字符串操作,例如查找单词的出现等。
我遇到的问题是如何获取 html 数据或者只是内容,然后将它们分类为可用的格式。谢谢
【问题讨论】:
-
HTML Agility Pack 非常适合解析 HTML:htmlagilitypack.codeplex.com
-
文档是 XHTML 文档吗?如果是这样,您可以将文件解释为 XML 文件并使用 XQuery 来提取日期。然后可以使用它来重命名文件以包含日期或其他内容。如果文档不是格式良好的 XML,您可以从文档构建一个 DOM 并进行查询。
-
尝试将问题分解成部分,为每个部分编写一些代码,然后在这里再次询问您是否遇到困难,提供代码示例以及您尝试过的方法。这样你会得到更好的答案,你的问题对于 SO 的格式来说太宽泛了。您已经得到了一些暗示解决方案各个部分的答案。
-
上下文可以,但需要有一个具体的问题。以最后一段开头,并有一个问题与?标记。我不认为这个链接应该是你的主要方法,但可能是一个工具stackoverflow.com/questions/10334984/…