【问题标题】:How to access links using a different proxy server in R?如何在 R 中使用不同的代理服务器访问链接?
【发布时间】:2020-08-13 06:49:23
【问题描述】:

我正在尝试使用不同的代理服务器在 R 中进行网页抓取。我在 R 中使用 use_proxy 函数,但没有运气。

请在下面找到我的代码的 sn-p:

 GET("http://had.co.nz", use_proxy("202.40.185.107", 8080), verbose())

它正在吐出以下错误:

 Error in curl::curl_fetch_memory(url, handle = handle) : 
 Timeout was reached: [had.co.nz] Connection timed out after 10000 milliseconds

谁能帮助我如何更改 R 中的代理服务器以避免被网站所有者阻止。我认为上述方法是最简单的,但对我不起作用。如果有任何网络抓取向导可以让我更好地执行此操作或如何解决此问题,我将不胜感激。

提前致谢!

【问题讨论】:

    标签: r web-scraping proxy screen-scraping proxy-server


    【解决方案1】:

    要使用代理,您需要能够连接到它。您确定可以连接到代理服务器 202.40.185.107:8080 吗?您可以通过例如轻松尝试。将 202.40.185.107:8080 放入浏览器或尝试使用命令行 ping 202.40.185.107:8080。

    您可以尝试不同的代理。我在网上找到了这个,它是免费的。请注意 - 如果您使用代理是为了不被网站所有者阻止,那么您将使用的代理也可能被网站所有者阻止。

    GET("http://had.co.nz", use_proxy("35.169.156.54", 3128), verbose())
    

    【讨论】:

    • 不,它实际上并不能在我的浏览器上运行。我收到以下错误:错误:尝试检索 URL 202.40.185.107:8080 时未经授权:网络中存在 HTTP 流量循环。检查您的网络拓扑和代理和防火墙配置您的缓存管理员是网站管理员。由 202.40.185.107 (Mikrotik HttpProxy) 于 2020 年 8 月 13 日星期四 07:17:49 GMT 生成。那么我该如何解决这个问题呢?我应该在哪里找到适用于我的浏览器的代理??
    • 我已经更新了我的答案以展示如何使用有效的代理。
    • 太好了。你能告诉我你是从哪里找到代理的吗?那真的很棒。谢谢你的帮助:)
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-05-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-12-04
    • 2016-09-29
    相关资源
    最近更新 更多