【发布时间】:2017-07-30 20:24:53
【问题描述】:
我正在尝试读取以下文件,但在读取 csv 时遇到问题。 CSV 文件在数据标题之前的文件顶部包含大量信息。我已经尝试过skirows,并且内容可以跳过文件顶部的内容,但它不起作用。
有人可以提供有关如何读取此文件的建议吗?
当前节目
import urllib
import pandas as pd
import StringIO
import datetime
import sys
if sys.version_info[0] < 3:
from StringIO import StringIO as stio
else:
from io import StringIO as stio
myfile=[]
dls "http://www.spdrgoldshares.com/assets/dynamic/GLD/GLD_US_archive_EN.csv"
f = urllib.urlopen(dls)
myfile += f.readline()
TESTDATA=stio(myfile)
daily_prices = pd.read_csv(TESTDATA, sep=",", header=None, skiprows=13,
names=["Date", "GLD Close", "LBMA Gold Price", "NAV per GLD in Gold",
"NAV/share at 10.30 a.m. NYT", "Indicative Price of GLD at 4.15 p.m. NYT",\
"Mid point of bid/ask spread at 4.15 p.m. NYT","Premium/Discount of GLD mid
point v Indicative Value of GLD at 4.15 p.m. NYT",\
"Daily Share Volume","Total Net Asset Value Ounces in the Trust as at 4.15
p.m. NYT", "Total Net Asset Value Tonnes in the Trust as at 4.15 p.m. NYT",
"Total Net Asset Value in the Trust"])
在 csv 上的表头之前,文件中包含以下信息。我尝试使用跳过行和内容,但两者都不起作用。
SPDR Gold Shares(纽约证券交易所 Arca),
““SPDR”商标经 The McGraw-Hill Companies, Inc.(“McGraw-Hill”)许可使用。SPDR“Gold Trust 或其附属公司不提供任何金融产品的赞助、背书、销售或由 McGraw-Hill 推广。”
"注意:本文档仅供参考,如有更改,恕不另行通知。未经 SPDR Gold Shares spdrgoldshares@ssga.com 的书面许可,不得以任何方式复制本文档的任何部分。在任何情况下都不得它被用作或被视为出售要约或招揽购买其中提到的证券或其他工具的要约”
“注意:SPDR Gold Shares 并不表示此信息是准确或完整的,因此不应依赖此信息。SPDR Gold Shares 不对任何损失、损害、费用或索赔负责,无论以何种方式产生,因依赖此文件中包含的数据的结果。”
“注意:在未公布 LBMA 黄金价格的日期,使用最新的 LBMA 黄金价格。”
"*注:自 2015 年 3 月 20 日起,本信托一直使用 LBMA 下午黄金价格作为确定本信托黄金价值的黄金价格。在此之前,本信托使用伦敦 PM 定盘价,即已于 2015 年 3 月 19 日停产。所有对 LBMA 黄金价格的参考仅供参考。ICE benchmark Administration Limited 对价格或价格可能参考的基础产品的准确性不承担任何责任或义务。
【问题讨论】:
标签: python pandas csv urllib stringio