【发布时间】:2014-02-07 03:23:20
【问题描述】:
我一直在尝试loadHTMLfile。它在大多数情况下运行良好,但在许多情况下都失败了。我想知道是否有解决以下问题的方法。
很多时候,loadHTMLfile 会失败,例如,如果提供给函数的 URL 是:www.somedomain.com,当在浏览器地址栏中输入这样的 URL 时,它会重定向到之前的 www.somedomain.com/page/default.asp它呈现。
网络爬虫如何克服这个问题?有没有办法使用一些 PHP 函数,例如 loadHTMLfile 来加载在向服务器发出请求并发生所有重定向后呈现的文档的 HTML 文件? (本质上是模拟用户通过任何浏览器地址栏访问 URL)
感谢任何建议,在此先感谢!
【问题讨论】:
-
网络爬虫如何克服这个问题? - 他们没有使用 PHP
标签: php curl web-crawler