【发布时间】:2021-04-22 22:03:50
【问题描述】:
首先,我是一名 DBA,对 python(或任何编码语言)的经验很少,因此我们将不胜感激。
我需要解析数百个 CSV 文件以找出可能存在的任何 unicode 字符,而手动执行此操作是不可能的。目的是定义当我们尝试导入非 unicode 数据库时数据会有多大问题(这是一个更复杂的故事,但这是情况的要点)。
我已经能够打开 CSV 文件并读取内容,包括 unicode 字符 - 如果我有无限的时间,我会用头撞墙,但是......我不会吨。在此先感谢您提供的任何光芒。
【问题讨论】:
-
当您说“unicode 字符”时,您是指非 ascii 字符吗?
-
正确,我正在寻找西里尔文、日文、中文、韩文等
-
您在寻找
unidecodemodule吗?或类似的?见Romanization of Unicode text。 -
不,我只需要将找到的任何 unicode 字符转储到输出文件中而不进行转换。