【发布时间】:2011-01-04 10:54:07
【问题描述】:
我必须做一个将废弃大约 100 个 URL 的 Scraper,该 Scraper 必须在由 CronJob 调用的 PHP CLI 中运行。我完全不知道如何管理这个......对于我正在考虑创建一个新文件的每个 URL,以便在我必须更新特定 URL 的代码时弄清楚。
这可能是一个不错的选择吗?那么,是否可以从单个 CronJob 调用所有这些文件?
【问题讨论】:
我必须做一个将废弃大约 100 个 URL 的 Scraper,该 Scraper 必须在由 CronJob 调用的 PHP CLI 中运行。我完全不知道如何管理这个......对于我正在考虑创建一个新文件的每个 URL,以便在我必须更新特定 URL 的代码时弄清楚。
这可能是一个不错的选择吗?那么,是否可以从单个 CronJob 调用所有这些文件?
【问题讨论】:
您希望通过将这 100 个 url 存储在数据库或文本文件中来轻松管理它们。 然后只需加载所有 url,遍历它们并调用你的抓取函数。
【讨论】:
你能做的是,
在数据库中维护所有 100 个 URL 的列表以及 别名(可以是任何名称,例如 http://google.com 的“Google”)。
使用以下命名约定“别名名称.php”为每个 URL 创建文件,编写代码以解析该文件中的 URL。
现在您可以调用一个 Cronjob,它将从数据库中检索您的所有 URL。您可以遍历每个 URL 并使用相应的别名执行文件。
例如。 如果您的 URL 是:http://google.com 并且它的别名是 Google。为此,您需要创建名为 Google.php 的文件,编写报废代码。在 cron 作业中,您将有类似的代码
$urls = getAllURLs();
foreach($urls as $url){
include_once($url['alias'].".php");
}
希望这会有所帮助。
谢谢!
侯赛因
【讨论】: