【发布时间】:2019-03-21 17:52:46
【问题描述】:
我想将希腊语和希伯来语中的所有单词与非单词分开。
我正在使用此代码:
words = re.findall(r'\w+|\S+', text)
结果不是那么令人满意,例如:
它分开 ⸂ἡμῶν καὶ κυρίου⸃ -> (⸂ἡμῶν) (καὶ) (κυρίου) (⸃) 我也想分开 (⸂) (ἡμῶν)
它不会将 ⸂ὑπὲρ⸃ 与 (⸂)ὑπὲρ(⸃) 分开
对于希伯来语,它也不会将 [ὑμῖν] 与 ([) (ὑμῖν) (]) 分开。它将不应该分开的东西分开。
【问题讨论】:
-
嗨,OpenBiblica,你看过这个吗? stackoverflow.com/questions/25067355/…
-
你可能需要
re.UNICODE, stackoverflow.com/a/393915/9214517