【发布时间】:2017-08-11 08:35:03
【问题描述】:
我有一个 text 文件,其中包含非英文字母的单词,我想打开它,进行一些预处理,最后将其保存为 .csv 文件,并在其他地方使用它。
读取和存储文件的代码:
with open('file.txt', encoding="utf-8") as f:
train = f.read().splitlines()
然后创建一个数据框,以及存储它的代码:
df.to_csv('file.csv', index=True, encoding="utf-8")
util 现在一切似乎都很好,但是当我尝试使用此代码打开 file.csv 时:
train = pd.read_csv('file.csv', encoding="utf-8")
我面对这个:
进程以退出代码 -1073740940 (0xC0000374) 结束
无需进入下一行。
另外,当我尝试使用 ISO-8859-1 编码打开它时,没关系;但是当我尝试打印 .csv 的头部时,它只会打印一些问号('?')
有人知道怎么回事吗?
【问题讨论】:
-
可能是编码问题。源文件中有特殊字符吗?
-
因为它是一些新闻的文本,所以一切都可能在其中。也不是英文的。
-
是什么语言?
-
它是波斯语