【发布时间】:2020-09-26 21:45:43
【问题描述】:
我有一些来自电影脚本的 .txt 数据,看起来像这样。
JOHN
Hi man. How are you?
TOM
A little hungry but okay.
JOHN
Let's get breakfast then
我想解析出文本并创建一个包含 2 列的数据框。 I 代表人,例如 JOHN 和 TOM,第二列代表行(这是每个名称下方的文本块)。结果会像..
索引 |人 |线条
0 |约翰 | “嗨,伙计。你好吗?”
1 |汤姆 | “有点饿,但还好。”
2 |约翰 | “那我们去吃早餐吧”
【问题讨论】:
-
您已经很好地描述了问题和一些测试数据,但没有尝试解决方案。您认为您需要如何读取文本文件,将其分解为常规部分并将数据放入 DataFrame 中? (这三个任务或多或少都是微不足道的,但也许您遇到了特定问题?)
-
split('\n)(在换行符上)可能会返回一个列表,其中每个列表的第一个元素中都有角色的名字 -
你有空行然后你可以使用
split('\n\n")和双\n来拆分字符串列表["JOHN\nHi man. How are you?", "TOM\nA little hungry but okay."]。然后每个字符串你可以split('\n', 1)得到列表["JOHN", "Hi man. How are you?"] -
如果每个文本都在一行中,那么您可以使用
split("\n")拆分为行