【发布时间】:2021-06-20 14:10:42
【问题描述】:
我收到了一个包含数据的 .npz 文件。我探索了数据集,并注意到它有 5 种数据类型:
cell_data = np.load("C:/Users/alexs/Documents/DataMining/cell-data.npz")
cell_data.files
在输出中给出这个:
['images', 'counts', 'folds', 'compressed', 'allow_pickle']
还有图片attached。
我被保证数据集本身有 3 折。计数是每行的 Nx6 矩阵 对应于单个图像补丁,每列对应于 6 种细胞类型(称为 T1、T2、...、T6)。折叠似乎是一个 1xN 矩阵,但我不确定,它包含范围为 {0,2} 的值。
我将如何找出每个折叠的实例数,如果可能的话,我将如何找出折叠的范围,即哪些实例属于哪些折叠(或将实例分组到它们自己的单独数组中表示每个折叠,如 fold1 = x、fold2 = x_2 等)然后为每个折叠绘制直方图,以便分别绘制每种细胞类型的计数(总共 6 个图)?
【问题讨论】:
-
请不要用不相关的东西(介绍、感谢、道歉等 - 已删除)来混淆您的问题。
-
我猜折叠包含与图像数量匹配的 N 个条目?如果是这种情况,为什么不将它们映射在一起?
-
@jhso 是的,有 2351 张图片,所以只是这些图片如何分成 3 折的问题?老实说,我不确定我会怎么做,我对编程很陌生
标签: python machine-learning dataset histogram