【问题标题】:How to deal with dataset containing multiple csv files?如何处理包含多个 csv 文件的数据集?
【发布时间】:2021-06-08 14:33:43
【问题描述】:

我正在实现一个 LSTM,但我遇到了数据集问题。 我的数据集是多个 CSV 文件(不同的问题实例)的形式,我在一个目录中有 100 多个 CSV 文件,我想在 python 中读取和加载它们。我的问题是我应该如何着手构建用于训练和测试的数据集。有没有办法将每个 csv 文件分成两部分(80% 训练和 20% 测试),然后将每个部分的 80% 分组为训练数据,并将 20% 分组为测试。 还是有另一种更有效的做事方式 我如何将这些多个 CSV 作为输入来训练和测试 LSTM? 这是我的 csv 文件结构的一部分 CSV file structure 这是我的 csvs 文件的屏幕(问题实例)csvs files

【问题讨论】:

    标签: python lstm tf.keras


    【解决方案1】:

    您可以使用 pandas pd.concat() 将多个数据帧与相同的列 (pandas docs) 组合在一起。

    您可以iterate through that directory 创建一个 csv 文件名列表,使用 pd.read_csv() 读取每个 csv,然后使用以下内容连接到最终数据帧:

    final_df=pd.DataFrame(columns=[<YOUR COLUMNS>])
    for csv_path in csv_files_list:
        df=pd.read_csv(csv_path)
        final_df=pd.concat(final_df, df)
    

    从这里,您可以使用 sklearn 或您喜欢的任何其他方法拆分您的训练和测试数据。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-06-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多