【问题标题】:Get original URL from a reddit URL从 reddit URL 获取原始 URL
【发布时间】:2018-02-09 17:35:20
【问题描述】:

考虑这个链接: https://www.reddit.com/r/todayilearned/comments/6x6iz8/til_princess_diana_on_live_tv_shook_the_hand_of/?ref=share&ref_source=link

原来的喜欢是

http://www.bbc.com/news/av/magazine-39490507/how-princess-diana-changed-attitudes-to-aids

使用 Javascript,如何在不使用 Reddit API 的情况下从第一个链接到达原始链接?

【问题讨论】:

  • 是的,抓取页面并获取链接
  • 为您提供不同的视角或纠正您的问题。您提供的链接确实以任何方式引用了 bbc.com 链接。碰巧您的原始链接指向的页面包含该链接。因此,唯一的方法是抓取该链接的页面。
  • @Paul:当您尝试在 Reddit 上分享帖子(通过单击分享按钮)时,您会得到这种格式(而不是原始链接)
  • @Ari,正确。本质上,当您单击共享时,他们会为您提供一个网页,该网页恰好有指向原始文章的链接。如前所述,网络抓取可能是您唯一的选择。

标签: javascript node.js reddit


【解决方案1】:

如果您谈论的是在网页中运行的 JavaScript,则不能。您需要使用 Reddit API,或者抓取 Reddit 网页。但是,由于跨域安全规则,您无法使用 JavaScript 抓取网页,因此您必须使用 API。

编辑:啊,Paul 刚刚指出您标记了 Node.js;如果您从服务器执行此操作,则可以进行抓取。查找“使用 node.js 抓取”。粗略浏览一下 Google 后,似乎大多数解决方案都涉及下载 Reddit 网页的 HTML,然后使用名为 Cheerio 的库对其进行解析。还有这东西scrape-it 看起来很有前途。

【讨论】:

  • 他标记了node.js,所以也许我们可以假设它是服务器端而不是客户端。
猜你喜欢
  • 2015-03-23
  • 1970-01-01
  • 1970-01-01
  • 2010-10-21
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-01-07
相关资源
最近更新 更多