【发布时间】:2010-10-04 09:21:23
【问题描述】:
我正在编写一个 Python 实用程序,它需要解析一个我无法控制的、定期更新的大型 CSV 文件。该实用程序必须在只有 Python 2.4 可用的服务器上运行。 CSV 文件根本不引用字段值,但 Python 2.4 version of the csv library 似乎没有给我任何关闭引用的方法,它只允许我设置引号字符(dialect.quotechar = '"' 或其他)。如果我尝试将引号字符设置为 None 或空字符串,则会出现错误。
我可以通过将dialect.quotechar 设置为一些“稀有”字符来解决这个问题,但这很脆弱,因为没有 ASCII 字符我可以绝对保证不会出现在字段值中(分隔符除外,但是如果我设置dialect.quotechar = dialect.delimiter,事情就会出乎意料地变得混乱)。
在Python 2.5 and later 中,如果我将dialect.quoting 设置为csv.QUOTE_NONE,CSV 阅读器会尊重这一点并且不会将任何字符解释为引号字符。有没有办法在 Python 2.4 中复制这种行为?
更新:感谢 Triptych 和 Mark Roddy 帮助缩小问题范围。这是一个最简单的演示:
>>> import csv
>>> import StringIO
>>> data = """
... 1,2,3,4,"5
... 1,2,3,4,5
... """
>>> reader = csv.reader(StringIO.StringIO(data))
>>> for i in reader: print i
...
[]
Traceback (most recent call last):
File "<stdin>", line 1, in ?
_csv.Error: newline inside string
仅当行的 final 列中有单个双引号字符时才会出现此问题。不幸的是,这种情况存在于我的数据集中。我接受了 Tanj 的解决方案:手动分配一个非打印字符("\x07" 或BEL)作为引号字符。这很hacky,但它有效,而且我还没有看到另一个解决方案。以下是实际解决方案的演示:
>>> import csv
>>> import StringIO
>>> class MyDialect(csv.Dialect):
... quotechar = '\x07'
... delimiter = ','
... lineterminator = '\n'
... doublequote = False
... skipinitialspace = False
... quoting = csv.QUOTE_NONE
... escapechar = '\\'
...
>>> dialect = MyDialect()
>>> data = """
... 1,2,3,4,"5
... 1,2,3,4,5
... """
>>> reader = csv.reader(StringIO.StringIO(data), dialect=dialect)
>>> for i in reader: print i
...
[]
['1', '2', '3', '4', '"5']
['1', '2', '3', '4', '5']
在 Python 2.5+ 中,将引用设置为 csv.QUOTE_NONE 就足够了,而 quotechar 的值将无关紧要。 (我实际上是通过csv.Sniffer 获取我的初始方言,然后覆盖quotechar 值,而不是通过子类化csv.Dialect,但我不希望这会分散真正问题的注意力;以上两个会话表明Sniffer 不是问题。)
【问题讨论】: