【问题标题】:Having trouble scraping the opengraph在抓取 opengraph 时遇到问题
【发布时间】:2016-08-01 23:01:30
【问题描述】:

我正在尝试使用 NodeJS 从网页中抓取数据。我使用request 模块获取我的数据并使用cheerio 进行解析。但是我注意到了一些事情:当我访问一些带有 chrome 的页面(例如,this nyt article)并检查源代码时,与 og:title 的属性 property 的标签 meta 完全匹配。如果我从 Node scraper 请求同一页面并检查标签,我有 108 个meta 标签,属性property 设置为og:title我已经尝试过使用 User-Agents,但没有发现。

  • 造成差异的原因是什么?
  • 是否有意在这些网站上这样做以阻止抓取?

【问题讨论】:

    标签: javascript html node.js web-scraping


    【解决方案1】:

    事实证明,我的问题是我的抓取妄想症(我相信每个网站都想将他们的信息锁定在抓取防御层后面)和我对cheerio 缺乏了解的产物。对于任何有类似问题的人:

    $(tag).attr(attribute,value) 会将每个tagattribute 设置为值。

    要查找所有attribute 设置为valuetags,这就是你想要的:

    $(tag[attribute = 'value']);
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2023-03-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-03-15
      • 1970-01-01
      • 1970-01-01
      • 2015-11-27
      相关资源
      最近更新 更多