【发布时间】:2015-08-11 22:20:16
【问题描述】:
我正在用这样的数据集做一些练习:
包含许多词典的列表
users = [
{"id": 0, "name": "Ashley"},
{"id": 1, "name": "Ben"},
{"id": 2, "name": "Conrad"},
{"id": 3, "name": "Doug"},
{"id": 4, "name": "Evin"},
{"id": 5, "name": "Florian"},
{"id": 6, "name": "Gerald"}
]
列表很少的字典
users2 = {
"id": [0, 1, 2, 3, 4, 5, 6],
"name": ["Ashley", "Ben", "Conrad", "Doug","Evin", "Florian", "Gerald"]
}
Pandas 数据框
import pandas as pd
pd_users = pd.DataFrame(users)
pd_users2 = pd.DataFrame(users2)
print pd_users == pd_users2
问题:
- 我应该像 users 还是像 users2 那样构建数据集?
- 是否存在性能差异?
- 一个比另一个更易读吗?
- 是否有我应该遵循的标准?
- 我通常将这些转换为 pandas 数据帧。当我这样做时,两个版本是相同的......对吗?
- 每个元素的输出都是正确的,所以我是否使用 panda df 并不重要?
【问题讨论】:
-
很好的问题我会选择第一个选项,因为与第二个选项相比,我进行搜索和插入操作会不那么乏味
-
我会选择第一个,只要使用方便是最重要的方面。移动物品时,将 ID 与 NAME 放在一起会很方便。
-
第一个版本很容易排序,而第二个版本不行。