【问题标题】:urllib slower than browser to access htmlurllib 比浏览器访问 html 慢
【发布时间】:2016-03-30 14:44:15
【问题描述】:

下面的python脚本在我的PC上加载一个twitter页面的源代码需要3秒,这比检索其他网站的源代码要高得多,比如youtube。当我在浏览器中加载相同的 twitter 页面时,谷歌浏览器中的“网络”标签告诉我 html 在 0.3 秒内被检索到。

为什么 urllib 比我的浏览器慢很多?

import urllib2
import time

start=time.time()
channel='pontifex'
url="https://twitter.com/"+channel
page = urllib2.urlopen(url).read()
print str(round(time.time()-start,0))+" secs total"

【问题讨论】:

标签: python web-scraping urllib


【解决方案1】:

缓存就是答案,它通常由浏览器完成,以减少经常访问的网站的加载时间。如果不是浏览器,那么谷歌等搜索引擎也会缓存经常访问的网站,以便检索它们只需几毫秒

看到这个帖子: How can Google be so fast?

【讨论】:

  • 谢谢。这很有帮助。为了加快速度,urllib 有什么方法可以访问我的浏览器访问的同一个缓存?另外,我仍然想知道为什么 twitter 会比我之前用 urllib 抓取的所有其他网站慢得多。 3 秒是永恒的。
  • @AlexisEggermont 尝试使用 urllib2,它是 urllib 的更新版本。见stackoverflow.com/questions/2018026/…
  • 我不同意这个,我一直在比较Python的urllib get请求和其他语言,java,vba,c#,node.js,性能比较差,肯定不是正确的 urllib。
猜你喜欢
  • 1970-01-01
  • 2020-12-31
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-03-12
相关资源
最近更新 更多