【发布时间】:2018-09-19 06:42:57
【问题描述】:
统计软件Stata 允许将短文本sn-ps 保存在数据集中。这可以使用notes 和/或characteristics 完成。
这对我来说很有价值,因为它允许我保存各种信息,从提醒和待办事项列表到有关我如何生成数据的信息,甚至是特定变量的估计方法曾是。
我现在正在尝试在 Python 3.6 中提供类似的功能。到目前为止,我已经在网上查看并查阅了许多帖子,但是这些帖子并没有完全解决我想要做的事情。
一些参考帖子包括:
What is the difference between save a pandas dataframe to pickle and to csv?
What is the fastest way to upload a big csv file in notebook to work with python pandas?
对于一个小的NumPy 数组,我得出结论,函数numpy.savez() 和dictionary 的组合可以将所有相关信息充分存储在一个文件中。
例如:
a = np.array([[2,4],[6,8],[10,12]])
d = {"first": 1, "second": "two", "third": 3}
np.savez(whatever_name.npz, a=a, d=d)
data = np.load(whatever_name.npz)
arr = data['a']
dic = data['d'].tolist()
但是,问题仍然存在:
是否有更好的方法可以将其他信息片段合并到包含 NumPy 数组或(大)Pandas DataFrame 的文件中?
我特别有兴趣了解您可能通过示例提出的任何建议的特定优点和缺点。依赖项越少越好。
【问题讨论】:
标签: python pandas numpy stata hdf5