【发布时间】:2016-08-01 23:01:30
【问题描述】:
我正在尝试使用 NodeJS 从网页中抓取数据。我使用request 模块获取我的数据并使用cheerio 进行解析。但是我注意到了一些事情:当我访问一些带有 chrome 的页面(例如,this nyt article)并检查源代码时,与 og:title 的属性 property 的标签 meta 完全匹配。如果我从 Node scraper 请求同一页面并检查标签,我有 108 个meta 标签,属性property 设置为og:title。 我已经尝试过使用 User-Agents,但没有发现。
- 造成差异的原因是什么?
- 是否有意在这些网站上这样做以阻止抓取?
【问题讨论】:
标签: javascript html node.js web-scraping