【发布时间】:2019-11-13 08:15:30
【问题描述】:
我是 pandas 和 keras 的新手,我正在尝试构建一个网络来生成词嵌入。我正在关注这个guide,试图使其适应我的特定数据集。我应该从我的dataset(DBLP-ACM,您可以在此处下载)中选择一些列进行进一步的文本阐述,但 pandas 无法按预期工作。
我已经尝试过使用与上面链接的指南相同的语法,但是 pandas 将每一列放在一个大列中(名称很奇怪:['id,"title","authors","venue","年”;;;;;'])。不用说,很多行都显示像
这样的错误line 393: expected 7 fields, saw 11
我还尝试了其他解决方案,例如
quoting = csv.QUOTE_NONE
engine = "python"
但没有按预期工作。基本上,我不明白为什么这个数据集看起来格式不正确(因为用 csv 查看器打开它看起来没问题)以及如何使用 pandas 正确读取它,并将其提交到程序的下一部分。
编辑:正如我在 cmets 中指出的那样,我在拆分数据集(用于训练和测试)时做错了,并且在此过程中出现了格式错误。仅供参考,我只是使用了一个在线 csv 拆分器。公认的解决方案对原始数据集完美无缺。
【问题讨论】:
-
尝试将
engine = "python"传递到pandas.read_csv()的函数调用中。这有什么不同吗? -
我在每一行都有一个
Skipping line 1: ',' expected after '"'。不过,还是有区别的。 -
不完全确定您的错误是什么。尝试粘贴错误?
-
pastebin.com/SX8eFFvF 这是完整的错误。它跳过数据集中的每一行,简单地说(有 1400 行,因为我拆分了数据集)
标签: python pandas csv tensorflow keras