【发布时间】:2011-08-23 19:01:00
【问题描述】:
我对 bash 和 perl 之类的东西还很陌生,需要一些帮助来完成一项任务。我正在准备(添加和编辑)一个大型高棉 Unicode 语料库,以用于 ICU 高棉断词补丁。
到目前为止,我一直无法找到一个稳定的解决方案来自动删除所有英文字母和标点符号(只留下高棉)。
有人告诉我 Perl 可能是要走的路,但我不确定从哪里开始(我不是真正的程序员)。
我过去使用过 bash 脚本,但结果并不完美(我最终不得不手动检查列表并删除非高棉字符)。
以下是我过去的一些建议:
LC_ALL=POSIX sort khmerdict.txt | sed '/[[:punct:]]/d' > khmer-sorted.txt
哪个应该删除标点符号...但由于某种原因它删除了我文件中的很多行,所以它没用。
还有这个:
sed -e 's/[a-zA-Z]//g' -e 's// /g' -e 's/\t/ /g' -e 's/[«|»|:|;|.|,|(|)|-|?|។|”|“]//g' -e 's/[0-9]//g' -e 's/ /\n/g' -e 's/០//g' -e 's/១//g' -e 's/២//g' -e 's/៣//g' -e 's/៤//g' -e 's/៥//g' -e 's/៦//g' -e 's/៧//g' -e 's/៨//g' -e 's/៩//g' dictionary.txt | \
这是删除英文字母、标点符号以及所有高棉数字的又一次尝试……但就像我说的那样,它并没有完全准确。
有没有人知道一个稳定的解决方案可以很好地与高棉 Unicode 配合使用?也许有一种方法可以使用一系列 Unicode 字符 (Khmer Unicode Mapping PDF) 删除所有内容?
如果您想尝试字典上的内容,可以在此处下载测试版本:http://www.sbbic.org/Khmer-Unicode-Wordlist.zip
这里有一个简短的列表供大家参考:
កំណត់
--
ស្រូវ
ទម្លាប់
}
é
"សំយុង
"លើក"
"ព"
"ផ"
ទស្សន--
–សម្ភាស
ចម្ងាយahead
ទាត់១
谢谢, 内森
【问题讨论】: