【问题标题】:Tab / LF / CR unicode characterTab / LF / CR unicode 字符
【发布时间】:2011-01-27 13:26:40
【问题描述】:

我有一个 Unicode 文件 (UTF-16 FFFE little-endian BOM),其中包含以制表符分隔的字段行。

阅读Splitting unicode (I think) using .split in ruby,我将使用 Ruby 拆分(文件到行,然后行到字段)。

顺便说一句,Unicode 字符是什么:

  • 低频
  • CR
  • 标签

谢谢!

【问题讨论】:

  • 这真的是你的问题吗,这三个字符在 Unicode 中的代码点是什么?
  • 我同意,这真的是问题吗?这可以通过在互联网上快速检查来回答,但供将来参考:unicode.org/charts/#symbols,尤其是unicode.org/charts/PDF/U0000.pdfen.wikipedia.org/wiki/Basic_Latin_Unicode_block
  • 我问的是 unicode char 和 Ruby 语法中的 unicode 代码。假设 blob (blob = Record.first.file_attached) 正在存储 UTF-16 原始数据。然后: rows = blob.split("\u000D") rows.size 如果我执行 u8rows = Iconv.conv("utf-8", "utf-16le", blob).split("\n") 则返回 1 u8rows.size 是 232 我的问题是:在 Ruby 中,用于分割 UTF-16 FFFE blob 的 unicode CR/LF char 是什么

标签: ruby unicode iconv


【解决方案1】:
低频:U+000A CR:U+000D 标签:U+0009

http://en.wikipedia.org/wiki/List_of_Unicode_characters

【讨论】:

    【解决方案2】:

    Unicode 选项卡是u0009。 LF 是u000a,CR 是u000d

    实际上与 ASCII 相同。

    【讨论】:

    • 只是因为 Unicode 的前 256 个码点与 Latin-1 中的相同。而前 128 则使用 ASCII。
    猜你喜欢
    • 2019-03-14
    • 1970-01-01
    • 1970-01-01
    • 2011-03-07
    • 1970-01-01
    • 1970-01-01
    • 2020-09-07
    • 1970-01-01
    相关资源
    最近更新 更多