【发布时间】:2022-10-19 00:31:26
【问题描述】:
为了实现自定义 Huggingface 数据集,我需要实现三种方法:
from datasets import DatasetBuilder, DownloadManager
class MyDataset(DatasetBuilder):
def _info(self):
...
def _split_generator(self, dl_manager: DownloadManager):
'''
Method in charge of downloading (or retrieving locally
the data files), organizing them according to the splits
and defining specific arguments for the generation process
if needed.
'''
...
def _generate_examples():
...
现在,在_split_generator 方法中,我需要从 S3 下载一个 CSV 文件(一个私有存储桶,需要密钥才能访问它)。下载后,该文件将被进一步处理。
不知道有没有办法使用参数dl_manager来下载呢?我想我可以使用其他一些方法/外部库下载该文件,但我想知道是否可以使用 Huggingface 的 datasets 对象和功能来完成它。
在this repo 中,您可以看到许多自定义数据集的示例。例如,用于构建的数据亚马逊美国评论从https://s3.amazonaws.com/amazon-reviews-pds/tsv/amazon_reviews_us_" + name + ".tsv.gz" 下载(如您所见here)。虽然这是一个公共链接,但每个人都可以访问它。相反,我想使用Downloadmanager 对象从 S3 下载我的私人数据。
【问题讨论】:
标签: python amazon-s3 huggingface-datasets