【问题标题】:PHP application designPHP应用程序设计
【发布时间】:2011-01-04 10:54:07
【问题描述】:

我必须做一个将废弃大约 100 个 URL 的 Scraper,该 Scraper 必须在由 CronJob 调用的 PHP CLI 中运行。我完全不知道如何管理这个......对于我正在考虑创建一个新文件的每个 URL,以便在我必须更新特定 URL 的代码时弄清楚。

这可能是一个不错的选择吗?那么,是否可以从单个 CronJob 调用所有这些文件?

【问题讨论】:

    标签: php scraper


    【解决方案1】:

    您希望通过将这 100 个 url 存储在数据库或文本文件中来轻松管理它们。 然后只需加载所有 url,遍历它们并调用你的抓取函数。

    【讨论】:

      【解决方案2】:

      你能做的是,

      在数据库中维护所有 100 个 URL 的列表以及 别名(可以是任何名称,例如 http://google.com 的“Google”)。

      使用以下命名约定“别名名称.php”为每个 URL 创建文件,编写代码以解析该文件中的 URL。

      现在您可以调用一个 Cronjob,它将从数据库中检索您的所有 URL。您可以遍历每个 URL 并使用相应的别名执行文件。

      例如。 如果您的 URL 是:http://google.com 并且它的别名是 Google。为此,您需要创建名为 Google.php 的文件,编写报废代码。在 cron 作业中,您将有类似的代码

      $urls = getAllURLs();    
      foreach($urls as $url){
      
      include_once($url['alias'].".php");
      
      }
      

      希望这会有所帮助。

      谢谢!

      侯赛因

      【讨论】:

        猜你喜欢
        • 2011-03-20
        • 2011-03-11
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2011-11-06
        • 2011-07-13
        相关资源
        最近更新 更多