【发布时间】:2017-08-12 23:44:25
【问题描述】:
我有一个包含如下行的文本文件:
一堆文字,有逗号、标点符号等,ham
该行总是以 ham 或 spam 结尾。如何读取包含此类数据的 csv 文件,并将文本的第一部分存储到“名称”字段中的最后一个逗号,并将最后一位存储为“标签”字段(在上述情况下,它将是:
df["label"] = "ham",
df["name"] = 'A bunch of text, with commas, punctuations etc.'
是否还有一种方法可以清除我上面描述的未指定的文本?假设某行末尾没有垃圾邮件或火腿,我想跳过那些。如何使用 pandas.read_csv() 来实现这一点?
【问题讨论】:
标签: python string pandas dataframe split