【问题标题】:Is there any way to crawl dynamic website without library?有没有办法在没有库的情况下抓取动态网站?
【发布时间】:2021-08-17 09:48:02
【问题描述】:

我正在使用“axios”从网站上抓取数据(https://movie.daum.net/premovie/released)

我需要ol标签下的li标签的数据,但是li标签没有显示在source中。

element tab in dev tool

source tab in dev tool

我猜该网站使用 JavaScript 等动态呈现 li 标签,但我不知道在加载所有标签后如何抓取它们。

关键是,我想在没有任何与 puppeteer 一样的爬行相关的库的情况下做到这一点。

如果你知道的话,请告诉我该怎么做。谢谢。

==============

找到解决方法了!

[웹 크롤링] JavaScript로 된 html 불러오기

它是用韩文写的,但真的很有帮助。

【问题讨论】:

  • 如果您希望在向下滚动页面时加载所有电影,您可以查看浏览器的网络选项卡并调用他们的 API 并以这种方式加载数据吗?
  • @AranMulholland 是的,我找到了检查网络选项卡并使用 XHR 文件的方法!感谢您的回答。
  • 如果您找到了解决方案,您应该将解决方案放在答案中,用英文解释并标记问题为您自己回答,以便其他人将来可以使用知识而问题不会永远没有答案。
  • axios 不是库吗?
  • @AranMulholland 谢谢!我不知道如何将问题标记为已回答。感谢您分享知识。

标签: javascript ajax web axios web-crawler


【解决方案1】:

找到解决方法了!

就我而言,我发现 XHR 存在于开发工具的网络选项卡中。 所以我向 XHR url 请求了 'get' axios 方法,而不是网页的 url。

XHR tab in dev tools

[웹 크롤링] JavaScript로 된 html 불러오기

我在这里找到的! 它是用韩文写的,但真的很有帮助。

【讨论】:

  • 我们真正推荐的关于堆栈溢出的一件事是从您找到答案的网站获取答案,并在此处的答案中写下摘要,这样人们就不必点击可能会消失的链接时间所以即使网站上的答案失败,我们也有答案。如果您在此处没有足够的积分来编辑您的答案,请再写一个并将其作为答案,这样人们就可以在此处找到答案而无需浏览其他网站。这样,未来任何需要的人都可以找到答案。
  • @AranMulholland 感谢您的帮助!我添加了开发工具中现有的 XHR 图像。
猜你喜欢
  • 2021-04-08
  • 1970-01-01
  • 2015-03-05
  • 2019-11-01
  • 2012-01-31
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多