【问题标题】:What's the best way to extract table content from a group of HTML files?从一组 HTML 文件中提取表格内容的最佳方法是什么?
【发布时间】:2010-09-09 06:45:32
【问题描述】:

用 TIDY 清理了一个满是 HTML 文件的文件夹后,如何提取表格内容进行进一步处理?

【问题讨论】:

    标签: java html excel csv extract


    【解决方案1】:

    遍历文本并使用正则表达式:)

    http://www.knowledgehouse.sg

    【讨论】:

      【解决方案2】:

      查看建议后,我最终使用了HtmlUnit

      使用 HtmlUnit,我能够自定义 Java 代码以打开文件夹中的每个 HTML 文件,导航到 TABLE 标记, 查询每列内容并提取创建 CSV 文件所需的数据。

      【讨论】:

        【解决方案3】:

        取决于您要进行哪种处理。您可以告诉 Tidy 生成 XHTML,它是一种 XML,这意味着您可以在结果上使用所有常用的 XML 工具,例如 XSLT 和 XQuery。

        如果您想在 Microsoft Excel 中处理它们,那么您应该能够从 HTML 中切出表格并将其放入一个文件中,然后在 Excel 中打开该文件:它会很高兴地将 HTML 表格转换为电子表格页面。然后您可以将其保存为 CSV 或 Excel 工作簿等。(您甚至可以在 Web 服务器上使用它——返回一个 HTML 表格,但将 Content-Type 标头设置为 application/ms-vnd.excel:Excel 将打开并导入表格并将其转换为电子表格。)

        如果您希望将 CSV 输入数据库,那么您可以像以前一样通过 Excel,或者如果您想自动化该过程,您可以编写一个程序,使用您选择的 XML 导航 API 来迭代表行并将它们保存为 CSV。 Python 的 Elementtree 和 CSV 模块将使这变得非常简单。

        【讨论】:

          【解决方案4】:

          如果你想从 HTML 标记中提取内容,你应该使用某种类型的 HTML 解析器。为此,有很多,这里有两个可能适合您的需求:

          http://jtidy.sourceforge.net/
          http://htmlparser.sourceforge.net/

          【讨论】:

            【解决方案5】:

            在 .NET 中,您可以使用 HTMLAgilityPack

            有关更多信息,请参阅 StackOverflow 上的 previous question

            【讨论】:

              【解决方案6】:

              我过去曾在此类事情上使用 BeautifulSoup 并取得了巨大成功。

              【讨论】:

                猜你喜欢
                • 1970-01-01
                • 2021-08-20
                • 2011-01-20
                • 2011-04-24
                • 1970-01-01
                • 2019-05-09
                • 2010-09-09
                • 2011-03-16
                • 2010-09-18
                相关资源
                最近更新 更多