【发布时间】:2011-05-06 02:38:10
【问题描述】:
我正在尝试在 Python 中解析一些 html。以前有一些方法确实有效……但现在,如果没有变通办法,我什么都不能真正使用。
- SGMLParser 消失后beautifulsoup 出现问题
- html5lib 无法解析“外面”的一半内容
- lxml 试图对典型的 html “太正确”(属性和标签不能包含未知的命名空间,否则会抛出异常,这意味着几乎没有 Facebook 连接的页面可以被解析)
现在还有哪些其他选择? (如果他们支持 xpath,那就太好了)
【问题讨论】:
-
您需要向我们提供当前方法失败的页面示例。否则,我们如何知道我们提出的解决方案是否能解决您的问题?另外,不要忘记在code.google.com/p/html5lib/issues/entry 报告 html5lib 错误