【发布时间】:2019-11-04 19:10:06
【问题描述】:
我有一个非常大的表,其中每一行代表一个称为 Trip 的抽象。行程由数字列组成,例如车辆 ID、行程 ID、开始时间、停止时间、行驶距离、行驶时长等。因此每个行程都是浮点值的一维向量。
我想将此表或向量列表转换为行程序列列表,其中行程按车辆 ID 分组为序列,并根据开始时间排序。序列长度需要限制为特定大小,例如 256,但可以/应该有多个具有相同 VehicleId 的序列。
示例:
(序列长度 = 4)
[
(Vehicle1, [Trip1, Trip2, Trip3, Trip4]),
(Vehicle1, [Trip5, Trip6, Trip7]),
(Vehicle2, [Trip1, Trip2, Trip3, Trip4])
]
我正在尝试使用基于序列的模型(例如 LSTM / Transformer)基于这些行程对驾驶模式进行建模。将每个行程想象成一个词嵌入,每个行程序列作为一个句子。不知何故,我需要通过 BigQuery / Apache Beam 函数(或任何其他推荐的工具)的组合来构建这些句子,因为我们正在谈论数百 GB 的数据。我对这两种工具都很陌生,因此我们将不胜感激。
【问题讨论】:
标签: python tensorflow google-bigquery google-cloud-dataflow apache-beam