【问题标题】:filter TabularDataset in azure ML在 azure ML 中过滤 TabularDataset
【发布时间】:2021-01-06 14:11:22
【问题描述】:

我的数据集很大。我正在使用 Azure ML 笔记本并使用 azureml.core 读取日期集并转换为 azureml.data.tabular_dataset.TabularDataset。无论如何我会过滤表格数据集中的数据而不转换为熊猫数据框。 我正在使用下面的代码来读取数据。由于数据很大,熊猫数据框内存不足。我不必将完整的数据加载到程序中。只需要子集。有什么办法可以在转换为熊猫数据框之前过滤记录

def read_Dataset(dataset):
    ws = Workspace.from_config()
    ds = ws.datasets
    tab_dataset = ds.get(dataset)
    dataframe = tab_dataset.to_pandas_dataframe()
    return dataframe

【问题讨论】:

    标签: pandas azure-machine-learning-studio azure-machine-learning-service azureml azureml-python-sdk


    【解决方案1】:

    目前,我们仅支持简单采样、按列名过滤和日期时间 (reference here)。 tabulardataset 上的完整过滤功能(例如按列值)是未来几个月即将推出的功能。一旦功能准备就绪,我们将更新我们的公共文档。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2017-11-06
      • 2017-08-27
      • 1970-01-01
      • 2022-12-18
      • 2022-11-08
      • 2018-08-25
      • 1970-01-01
      相关资源
      最近更新 更多