【问题标题】:Extracting data from website从网站中提取数据
【发布时间】:2017-03-30 21:30:31
【问题描述】:

我是 python 新手,我想对股票进行技术分析。 以下是我可以通过定义开始日期和结束日期来获取数据的网站。 http://www.scstrade.com/StockScreening/SS_CompanySnapShotHP.aspx?symbol=LOTCHEM

我熟悉 pandas 和 numpy。在网上搜索后,我发现了一个可以帮助提取数据的库 BeautifulSoup。我的问题是,上述库是否足以通过定义开始和结束日期从上述链接中提取数据。或者,如果有人可以建议任何其他库或其他智能方法来提取数据。

【问题讨论】:

  • 你可能可以,但最好使用 API 而不是网页抓取。
  • 看起来该页面使用 javascript 来用数据填充表格,这意味着您需要一个刮板才能呈现一个功能齐全的网站,而不仅仅是 html。你可能需要像 phantomjs 或 selenium 这样的东西

标签: python beautifulsoup


【解决方案1】:

我认为有3个选项:

  • 如果您需要简单的抓取,请使用模块requests
  • 使用selenium 模块来模拟浏览器驱动程序的实际浏览器活动。如果页面使用JavaScript 填充数据,selenium 可能会派上用场。
  • 另一个不错的选择是mechanize

有关它们的更多信息:requestsseleniummechanize

【讨论】:

  • 感谢您为我提供如此有用的见解。您能否评论一下在抓取和处理大量数据时哪种编程语言更高效、更快。
  • 我正在使用python 中的所有这个模块,我认为它的性能非常令人满意。
  • 感谢您的建议。
猜你喜欢
  • 2018-04-03
  • 2015-08-26
  • 1970-01-01
  • 2023-04-05
  • 2016-02-27
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多