【发布时间】:2011-09-08 16:25:48
【问题描述】:
最近,我经常不得不在同一个分析中处理来自多个 .csv 源的时间序列数据。 为简单起见,我们假设所有系列都是常规的季度系列(两者之间没有缺失值)。通常,原始 .csv 数据包含一个日期列和 1-3 个变量。 不幸的是,该系列在 .csv 文件中的长度不相等。
我开始在 R 中组织我的数据集,结果发现一大堆包含大量window()commands。另外,我必须在将 NA 和原始系列转换为 ts()objects 之前将它们连接起来,因为我发现连接(多变量)ts()objects 非常违反直觉。
请注意,我添加 NA 的原因是我希望所有系列都具有相同的长度。当然,我可以修剪较长的,但是当不使用较短的系列时,我最终会失去观察。
我考虑编写一个函数来读取 .csv 文件并使用它的日期列来创建 ts()objects 并且可能与另一个函数合并所有单个系列以在数据丢失时创建一个包含 NA 的多元系列。我发现自己一直在切换数据类型,阅读 ts 和 zoo 手册——我简直不敢相信它有那么复杂。
我真的觉得这个问题真的很普遍,想到了在excel中的准备。我的意思是我真的很讨厌excel,但是这次我想知道更有经验的用户会做什么? R 还是 Excel?
编辑:添加了一些示例数据(需要汇总每日数据) 文件1:
27.05.11;5965.95
26.05.11;5947.06
25.05.11;5942.82
24.05.11;5939.98
file2(没有日期列,但我知道开始和频率)
Germany;Switzerland;USA;OECDEurope
69,90974;61,8241;55,60966;64,96157
67,0394;62,18966;56,47361;64,15152
70,56651;63,6347;56,87237;65,43568
文件3:
1984-04-01,33.3238396624473
1984-07-01,63.579833082501
1984-10-01,35.8375401560349
我承认示例性数据确实有助于说明问题,但它是解决比我更有经验的用户的问题的最佳实践类型。您如何为多变量 ts 分析准备数据?
【问题讨论】:
-
我的意思是我确实明白,如果知道开始和频率,常规系列不需要日期列,但部分问题是:是否有创建
ts或 @987654329 的标准方法@ 来自 csv 的带有日期列的对象? -
您可能需要提供一些数据文件示例,因为
read.zoo应该可以处理其中一些问题。
标签: r time-series