【发布时间】:2013-09-03 07:23:54
【问题描述】:
我有一个 csv 文件,其中包含字符串形式的文本。 一些文本行是例如中文或俄文。
我想要做的是使用 Python 来计算文本行中 unicode 和 ASCII 字符的数量。 如果 ASCII 与 Unicode 字符的比例超过 90%,我想保留该行,如果不将其从 csv 中删除。
这背后的想法是删除所有非拉丁语言,但保留例如德国元音变音符号,为此我想使用比率解决方案。
有人想解决这个问题吗?
非常感谢!
这是我的 csv 数据的一些示例:
She wants to ride my BMW the go for a ride in my BMW lol http://t.co/FeoNg48AQZ
RT @YuaElena: Бабушка лаÑково говорит 5-летнему Тёмочке: - Смотри, Темик, вон едет "би-би". - Бог Ñ Ñ‚Ð¾Ð±Ð¾Ð¹, бабка, Ñто-ж BMW 335xi 4x4.
所以你应该知道我的数据是什么样子的。
【问题讨论】:
-
据我所知,整个文件是以某种方式编码的,它不是用 ascii 或 unicode 编码的单个字符,您必须定义要接受的字符/字符范围数一下。
-
您有 CSV 文件的示例吗?
-
@ameer,我想他想区分字符串的哪些字符也是 ASCII 表的一部分,哪些不是。不过严格来说你是对的。