【发布时间】:2013-05-20 20:54:17
【问题描述】:
我正在寻找一种将 HTML 表格干净地转换为可读纯文本的方法。
即给定一个输入:
<table>
<tr>
<td>Height:</td>
<td>200</td>
</tr>
<tr>
<td>Width:</td>
<td>440</td>
</tr>
</table>
我期望输出:
Height: 200
Width: 440
我宁愿不使用外部工具,例如w3m -dump file.html,因为它们 (1) 依赖于平台,(2) 我想对流程进行一些控制,并且 (3) 我认为它可以单独使用 Python,无论是否有额外的模块。
我不需要任何自动换行或可调整的单元格分隔符宽度。将制表符用作单元格分隔符就足够了。
更新
这是一个老用例的老问题。鉴于pandas provides the read_html method,我目前的答案肯定是pandas-based。
【问题讨论】:
标签: python html html-table html-parsing plaintext