【发布时间】:2020-05-28 18:01:59
【问题描述】:
我正在尝试从网站获取数据以将它们写入要处理的 excel 文件。我有一个主要的 url 方案,我必须相应地更改“年份”和“参考编号”:
http://calcio-seriea.net/presenze/"年份"/"参考号"/
我已经尝试编写部分代码,但我遇到了一个问题。首先,我应该保持年份不变,而参考数取18区间的每一个数字。然后年份增加1,参考数字又取18区间的每一个数字。我试着给一个示例:
Y = 1998 RN = [1142:1159];
Y = 1999 RN = [1160:1177];
Y = 2000 RN = [1178:1195];
Y = … RN = …
那么从 2004 年开始,间隔变为 20,所以
Y = 2004 RN = [1250:1269];
Y = 2005 RN = [1270:1289];
截至年 = 包括 2019 年。
这是我目前能做的代码:
import pandas as pd
year = str(1998)
all_items = []
for i in range(1142, 1159):
pattern = "http://calcio-seriea.net/presenze/" + year + "/" + str(i) + "/"
df = pd.read_html(pattern)[6]
all_items.append(df)
pd.DataFrame(all_items).to_csv(r"C:\Users\glcve\Desktop\data.csv", index = False, header = False)
print("Done!")
提前感谢大家
【问题讨论】:
-
这应该是两个独立且非常具体的问题。第一个应该只是关于字符串格式,第二个是如何正确地将检索到的数据输入到DataFrame中。
-
哦,好的。我认为在两个不同的主题中提出两个问题是垃圾邮件。那我就换
-
你应该一次问一个问题,这样你就可以对cmet中的问题进行反馈或更专注地回答。
-
在写入 csv 之前,您只需
pd.concat(all_items)。 -
HampusLarsson 我编辑了问题 Datanovice 谢谢我已经检查过了,它有效!在我这边真的很愚蠢的问题啊啊啊
标签: python pandas web-scraping