【发布时间】:2019-11-18 16:53:31
【问题描述】:
我想从 yahoo Finance 中抓取特定符号的数据。
我可以抓取表格格式,但不能抓取非表格格式。我应用相同的原理在同一页面中抓取信息,但没有结果。
到目前为止,我可以从https://finance.yahoo.com/quote/AAPL/profile?p=AAPL 刮下来
我用来刮表的代码是:
import numpy as np
import pandas as pd
import requests
import lxml
from lxml import html
symbol = 'AAPL'
url = 'https://finance.yahoo.com/quote/' + symbol + '/profile?p=' + symbol
page = requests.get(url)
tree = html.fromstring(page.content)
table = tree.xpath('//table')
assert len(table) == 1
tstring = lxml.etree.tostring(table[0], method='html')
df = pd.read_html(tstring)[0]
df
我要刮右边的桌子
Sector: Consumer Goods
Industry: Electronic Equipment
Full Time Employees: 137,000
如果您能帮助获取信息或提供一些提示和建议,我将不胜感激。
【问题讨论】:
-
你为什么忽略你的导入?对繁殖很重要。
-
顺便说一句,雅虎金融库已经存在
-
如果你想抓取网页,beautifulsoup 可能比普通的 XPath 更好
标签: python yahoo-finance