【发布时间】:2018-06-17 18:10:34
【问题描述】:
在我的文件中不知何故添加了 Â。我不确定它是什么以及它是如何添加的。
12345AÂ 210Â CBCDEM
我想从文件中删除这个字符。我尝试了基本的 sed 命令将其删除但不成功。
sed -i -e 's/\Â//g'
我还读到 dos2unix 可以完成这项工作,但不幸的是这也不起作用。假设它是十六进制字符,我也尝试使用十六进制值 sed -i 's/\xc2//g' 将其删除,但这也没有用
我真的很想了解这个角色是什么以及它是如何被添加的。此外,是否有可能删除文件中的所有此类字符。
添加编码细节:--
file test.txt
test.txt: ISO-8859 text
echo $LANG
en_US.UTF-8
操作系统详情:--
uname -a
Linux vm-testmachine-001 3.10.0-693.11.1.el7.x86_64 #1 SMP Fri Oct 27 05:39:05 EDT 2017 x86_64 x86_64 x86_64 GNU/Linux
问候。
【问题讨论】:
-
文件是如何创建的?
-
该文件被创建为从 Mongo 导出。 Mongo 没有这样的字符。
-
当然。你能检查一下你的系统使用的编码和你的数据库使用的编码吗?
-
尝试运行
file <filename>并将结果包含在您的问题中。od -c <filename> | head之类的东西也可能有用。我们需要更多信息。
标签: unix sed character-encoding