【发布时间】:2011-01-16 05:40:10
【问题描述】:
我正在尝试从网站抓取内容,对其进行解析,提取我想要的内容,然后将其放入数据库中。
我正在使用 PHP。
我使用 cURL 构建了一个脚本,该脚本遍历我需要的页面并获取 HTML 内容。现在,据我了解,我需要一个工具或库来允许我获取包含页面 HTML 的字符串并对其进行解析。
关于如何(最好)使用 PHP 做到这一点的任何提示?
【问题讨论】:
标签: php curl web-scraping
我正在尝试从网站抓取内容,对其进行解析,提取我想要的内容,然后将其放入数据库中。
我正在使用 PHP。
我使用 cURL 构建了一个脚本,该脚本遍历我需要的页面并获取 HTML 内容。现在,据我了解,我需要一个工具或库来允许我获取包含页面 HTML 的字符串并对其进行解析。
关于如何(最好)使用 PHP 做到这一点的任何提示?
【问题讨论】:
标签: php curl web-scraping
如果您需要遵循 HTML 结构,请使用 DOM 扩展名。使用loadHTML方法加载数据,然后您可以将数据用作DOMDocument或SimpleXML文档(使用simplexml_import_dom进行转换)。
如果您只需要提取一些内容而不为理解文档结构而烦恼,请使用regular expressions。
【讨论】: