【问题标题】:split dataset to 1000 row make it sub dataset将数据集拆分为 1000 行,使其成为子数据集
【发布时间】:2022-12-13 14:16:27
【问题描述】:

我有一个包含 820016 行的大型数据库。我想每次读取每1000行,进入特定的流程。如何通过 for 循环或其他具有新索引的拆分数据帧来拆分数据帧?

df = pd.DataFrame(df)
i=0
k=1000
y={}
for index , item in enumerate(df,start=1):
    df1=df.iloc[i:k]
    print(df1)
    i=k
    k=k+50

或者

arr = df.to_numpy()
arr = arr.astype(float)
import copy
m=3
i=0
k=50
df= copy.deepcopy(df)
for row in arr:
    df1=df.iloc[i:k]

【问题讨论】:

  • 欢迎来到堆栈溢出!您当前的方法会遇到什么类型的错误?与其问“我该怎么做”,不如问“我该如何解决这个问题?”。您可以查看此链接以获取有关提问的更多信息:stackoverflow.com/help/how-to-ask
  • +50:如果您想以 1000 步为单位阅读,请使用 +1000
  • 在第二个代码示例中,循环没有任何意义。想一想并了解它的作用。该代码看起来像是巧合的编程。

标签: python


【解决方案1】:
df = pd.DataFrame({"A": range(820016)})

groups = df.groupby(np.arrange(len(df)) // 1000)

for group_id, group in groups:
    print(group)

这应该给你你正在寻找的东西!

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-04-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多