【发布时间】:2011-09-23 13:33:43
【问题描述】:
我想用 Python 2.7 做一些屏幕抓取,但我不知道 HTMLParser、SGMLParser 或 Beautiful Soup 之间的区别。
这些都是为了解决同一个问题,还是出于不同的原因而存在?哪个最简单,哪个最健壮,哪个(如果有)是默认选择?
另外,如果我忽略了一个重要的选项,请告诉我。
编辑:我应该提一下,我在 HTML 解析方面并不是特别有经验,而且我特别感兴趣的是哪一个能让我最快地移动,目标是解析一个特定的 HTML网站。
【问题讨论】:
-
通过一些好的例子来掌握使用 lxml 的 xpath 用法将是 IMO 的一个好方法。试试这些:lxml.de/tutorial.html & techchorus.net/web-scraping-lxml
标签: python html parsing beautifulsoup html-parsing