【发布时间】:2011-07-01 04:31:32
【问题描述】:
我知道有 lxml 和 BeautifulSoup,但这不适用于我的项目,因为我事先不知道我试图从其中抓取文章的网站的 HTML 格式是什么。有没有类似于 Readability 的 Python 类型的模块,在查找文章内容并返回它方面做得很好?
【问题讨论】:
-
今天早些时候有人问过这个问题,是你吗?
-
不是真正的重复。我认为 OP 想要一个类似于 python 中的 readability.js 模块,这是公平的要求。只是措辞不明确。
标签: python algorithm screen-scraping beautifulsoup lxml