【问题标题】:Obtaining financial data from Google Finance which is outside the scope of the API从 Google Finance 获取超出 API 范围的财务数据
【发布时间】:2010-11-03 19:36:20
【问题描述】:

Google 的财务 API 不完整 - 页面上的许多数字,例如:

http://www.google.com/finance?fstype=ii&q=NYSE:GE

无法通过 API 获得。

我需要这些数据来根据 Greenblatt 公式对加拿大证券交易所的公司进行排名,该公式可通过 google 搜索“greenblatt index scans”获得。

我的问题:访问和处理这些网页上的数据的最智能/干净/有效的方式是什么。在这种情况下,这种繁琐的方法真的有必要吗?如果是,最好的方法是什么?我目前正在为与此相关的项目学习 Python。

【问题讨论】:

    标签: python api data-mining google-finance


    【解决方案1】:

    您可以尝试要求 Google 提供缺少的 API。否则,您将被screen scraping 卡住,这永远不会有趣,容易在没有通知的情况下中断,并且可能违反 Google 的服务条款。

    但是,如果您仍然想编写屏幕抓取工具,则很难击败 mechanize 和 BeautifulSoup 的组合。 BeautifulSoup 是一个 HTML 解析器,mechanize 是一个基于 Python 的 Web 浏览器,它可以让您登录、存储 cookie,并且通常可以像任何其他 Web 浏览器一样导航。

    【讨论】:

      【解决方案2】:

      BeautifulSoup 将是使用 Python 解析 HTML 的首选方法

      您是否研究过 Google 以外的选项(例如 Yahoo Finance API)?

      【讨论】:

      • 谢谢,我会研究一下 BeautifulSoup。没错,Yahoo Finance API 更完整 - 不幸的是,Yahoo 没有加拿大股票的必要数据。
      【解决方案3】:

      抓取网页总是很糟糕,但我建议将它们转换为 xml(通过 tidy 或其他一些 HTML -> XML 程序),然后使用 xpath 遍历您感兴趣的节点。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2021-01-18
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2021-04-17
        • 2017-07-03
        相关资源
        最近更新 更多