【问题标题】:advance php crawler,website with backend高级 php 爬虫,带后端的网站
【发布时间】:2014-06-21 10:55:27
【问题描述】:

我的想法是, 创建一个网站,将其他来源的内容汇总并显示在页面中,

说, 我有 10,15 个处理娱乐新闻的网站列表 我必须抓取网站,然后将数据保存到数据库中,在按日期/时间排序的网页上输出内容, 必须抓取标题,完整内容或 10,15 行,图像,然后链接到原始来源。 该站点必须每 5.10 分钟更新一次。 在每次更新中,检查新文章并在无限滚动的网页中显示标题、文本、图像、原始源链接。 好吧,我的经验是使用 php。 任何 php 框架、服务、类开始? 任何帮助将不胜感激。

谢谢

【问题讨论】:

    标签: php web web-crawler aggregate aggregation


    【解决方案1】:

    您是否可以通过使用来自网站的 RSS 提要来收集相同的信息,而不是抓取页面和屏幕抓取?如果可能,您应该避免屏幕抓取。

    如果必须抓取,请尝试使用 DOM 解析器,而不是正则表达式。
    http://simplehtmldom.sourceforge.net/

    【讨论】:

    • 我尝试了 RSS 聚合。问题是 15 个 RSS 提要中有 10 个没有图片 我需要用图片、标题、描述来解析帖子
    • 我已经更新了我的答案,包括一个 DOM 解析器而不是使用正则表达式来从网页收集数据。
    • 因为我必须一次废弃 20,25 个网页并且必须将其保存在数据库中,我如何通过简单的 html dom 来实现这一点?
    猜你喜欢
    • 2012-09-24
    • 2018-07-20
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-04-06
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多