【发布时间】:2019-06-21 12:01:19
【问题描述】:
我刚刚开始研究实时流数据处理框架的主题,我有一个问题我至今找不到任何结论性的答案:
常见的嫌疑人(Apache 的 Spark、Kafka、Storm、Flink 等)是否支持以 纳秒(甚至皮秒)的事件时间分辨率处理数据?
大多数人和文档都在谈论毫秒或微秒分辨率,但如果可能有更多分辨率或问题,我无法找到明确的答案。我推断唯一具有该功能的框架是 influxData 的 Kapacitor 框架,因为他们的 TSDB influxDB 似乎以纳秒分辨率存储时间戳。
这里的任何人都可以就此提供一些见解,甚至提供一些知情的事实吗?提供此功能的替代解决方案/框架?
任何事情都将不胜感激!
感谢和问候,
西蒙
我的问题的背景:我正在一个环境中工作,该环境具有大量用于数据存储和处理的专有实现,并且目前正在考虑一些组织/优化。我们正在使用许多不同的诊断/测量系统以不同的采样率进行等离子体物理实验,现在高达“每秒超过千兆样本”。我们系统中的一个常见事实/假设是每个样本确实有一个以纳秒分辨率记录的事件时间。当尝试使用已建立的流(或批处理)处理框架时,我们必须保持这个时间戳分辨率。或者更进一步,因为我们最近在某些系统上突破了 1 Gsps 阈值。因此我的问题。
【问题讨论】:
标签: apache-kafka apache-flink apache-storm apache-kafka-streams kapacitor