【问题标题】:Python: parsing text of unknown lengthPython:解析未知长度的文本
【发布时间】:2018-05-14 10:25:57
【问题描述】:

我有一个充满字符串的数据库,例如:

as.web.product.viewed(AT)2018-01-28T19:00:52.032Z(THEN)as.web.product.viewed(AT)2018-01-28T19:02:20.132Z

(另一个可能的分隔符是“(WITH)”,动作是as.web.product.purchased,所以理想情况下我需要一个尽可能通用的解决方案)

在一个序列中可以有任意数量的动作,并且或多或少是任意顺序。我需要能够隔离动作名称(例如as.web.product.viewed)和它发生的时间,并保持动作的顺序。

最像 Python 的方式是什么?

编辑:所需的输出(对于上面的示例) - 2 个列表,例如:

['as.web.product.viewed','as.web.product.viewed']
['2018-01-28T19:00:52.032Z','2018-01-28T19:02:20.132Z']

【问题讨论】:

  • 我认为你要么有一堆if/else 条件,要么是一个正则表达式。就个人而言,我会选择后者。
  • 请准确发布您期望的输出/结果。

标签: python parsing text-processing text-parsing string-parsing


【解决方案1】:

当出现圆括号中的文本时,您可以使用正则表达式来拆分字符串:

import re
pat = re.compile('''\([A-Za-z]+\)''')
s = "as.web.product.viewed(AT)2018-01-28T19:00:52.032Z(THEN)as.web.product.viewed(AT)2018-01-28T19:02:20.132Z"
r = (re.split(pat, s))
print (list(zip(r[::2], r[1::2]))) # group pairwise if needed !

这会返回:

[('as.web.product.viewed', '2018-01-28T19:00:52.032Z'), ('as.web.product.viewed', '2018-01-28T19:02:20.132Z')]

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-02-28
    • 1970-01-01
    • 2015-07-22
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多