【问题标题】:python3.6: can i use (\\u\w\w\w\w) to remove all unicode from tweet jsonpython3.6:我可以使用 (\\u\w\w\w\w) 从推文 json 中删除所有 unicode
【发布时间】:2018-04-02 06:23:14
【问题描述】:

我正在做一些推特挖掘,并通过 pandas 将推文的 json 提取到 python3 中

在进一步处理之前,我注意到很多数据不一致/不干净,甚至对我有用(目前) 所以我使用正则表达式使推文字符串一致或删除有问题的项目

下面是:

data['full_text'] = data['full_text'].replace('^@ABC(\\u2019s)*[ ,\n\t]*', '', regex=True)
data['full_text'] = data['full_text'].replace('(\\n)', '', regex=True)
data['full_text'] = data['full_text'].replace('(\\t)', '.', regex=True)
data['full_text'] = data['full_text'].replace('(\\u2018)|(\\u2019)', "'", 
regex=True)
data['full_text'] = data['full_text'].replace('(\\u201c)|(\\u201d)', "\"", regex=True)
data['full_text'] = data['full_text'].replace('(\\n)|(\\t)', '', regex=True)

即 - 如果在开始时使用,则删除 twitter 句柄(包括链接到它的标点符号) - json 应该没有撇号的问题。保持一切一致,并用单个 ' 替换左/右撇号的 unicode - 一些推文使用反斜杠表示引用,其他推文使用 unicode。保持一致并用 \" 替换 unicode - 删除所有标签 - 假设所有新行都是新句子,所以用句号替换它们

据我所知,这就是真正需要的。 ~ 之类的东西可能是无用的,对它们没有真正的目的。推文也会有我不关心的表情符号(暂时)

其余的标点符号和这些表情符号遵循 \uXXXX 格式 其中 x 是数字或字母

所以我的最后一行计划如下:

data['full_text'] = data['full_text'].replace('(\\u\w\w\w\w)', "", regex=True)

鉴于我拥有大量推文,我无法验证一切是否正常,这就是为什么有人可以提供一些建议?

根据我的研究,我不断看到人们发布以下内容:

([\u2600-\u27BF])|([\uD83C][\uDF00-\uDFFF])|([\uD83D][\uDC00-\uDE4F])|([\uD83D][\uDE80-\uDEFF]) 

但是当我尝试这些时,我仍然会看到 json 中留下的表情符号等。那么为什么不直接使用 \u\w\w\w\w ??? (尤其是最后使用的时候?)

============================================== ========================== 更新:

data['full_text'] = data['full_text'].replace('^@ABC(\\u2019s)*[ ,\n\t]*', '', regex=True)
data['full_text'] = data['full_text'].replace('(\\n)', '', regex=True)
data['full_text'] = data['full_text'].replace('(\\t)', '.', regex=True)
data['full_text'] = data['full_text'].replace('(\\u2018)|(\\u2019)', "'", regex=True) 
data['full_text'] = data['full_text'].replace('(\\u201c)|(\\u201d)', "\"", regex=True)
data['full_text'] = data['full_text'].replace('https:\/\/t.co\/(\w{10})', "", regex=True)
import string
data['full_text'] = data['full_text'].replace('[^{}]'.format(string.printable), '', regex=True)

感谢 James,尽管我得到的信息相互矛盾。最后一行合适吗?它是否删除了除 unicode 之外的任何内容?

【问题讨论】:

  • can i use (\\u\w\w\w\w) to remove all unicode from tweet json 可能不会……
  • 为什么不呢?在 regex101 中,它似乎在一些示例中删除了所有 unicode 而没有触及实际消息
  • 显示一些示例数据(json)和预期的最终处理结果。

标签: python json regex python-3.x unicode


【解决方案1】:

看来您对 unicode 有误解。 Unicode 是描述字符/文本/表情符号/象形文字/等的标准。而已。例如,

  • 字符 0041(自从 unicode 为十六进制以来的第 65 个字符)的 unicode 标准是“拉丁大写字母 A”。
  • 字符 2600 的 unicode 标准是“带有光线的黑色太阳”。

就是这样。 Unicode 给出了字符应该是什么的描述。由特定的字体和编码决定是否显示字符以及它在屏幕上的样子。对于我的特定设置(Windows 10,终端中的 Consolas 字体)Consolas 没有代表'\u2600' 的字符,因此它只显示混淆豆腐的默认“缺失”字符(中间有一个问号的框)。

那么这与您的问题有什么关系?字符串'\u2600' 不是 5 个字符而是一个字符,由其 unicode 十六进制代码点表示。这就是为什么\u\w\w\w\w 的正则表达式不起作用的原因,因为它会查找 5 个字符,但每个 unicode 字符只是一个字符。

您可以自己测试。

len('\u2600')
# returns
1

如果你真的想删除所有非ASCII字符,你可以过滤掉你不想要的文本。

import string

df['full_text'] = df['full_text'].replace('[^{}]'.format(string.printable), '', regex=True)

【讨论】:

  • 我知道它可以代表一个字符,即 \u2019 \2018 代表撇号字符等,从 json 看起来像表情符号的样子看起来像一对这样:\ud83d\ude00 = 笑脸。但它们仍然遵循 \uXXXX 格式。这就是为什么我尝试用不需要 unicode(或被删除)的东西替换字符的每个 unicode 表示。我认为我的困惑的主要部分是我的大部分代码都有效(除非我忽略了某个地方),除了最后一行
  • 我是不是和这样的人不遵循相同的逻辑(唯一的区别是他们的代码更安全,因为他们在列表中查找 unicode 而不是像我这样的一揽子删除但他们的代码不能处理所有表情符号):stackoverflow.com/questions/13729638/…
  • 所以如果我想要一个没有 unicode 的 json,(这有助于提高可读性并且在被拉入程序时不太可能导致问题),当然可以在保存之前删除任何带有 \u +4 额外字符的内容回到json?
  • 是的,问题是你打算如何去做。您不能搜索后跟 4 个字符的 \u,因为这不是字符串实际包含的内容。
  • 我忘了详细说明我将其保存回 json。我知道一旦读入(到我的特定程序),unicode 将被其适当的字符替换。但是如果我在记事本++中打开,我可以看到unicode,这对工作没有帮助(例如,也许我只想将粘贴复制到不会转换unicode的excel中)。我并不真正需要的表情符号,而且听起来我也不需要 unicode(例如,对于文本分析,\" 可能比 \u201c 和 \201d 更容易处理)
猜你喜欢
  • 1970-01-01
  • 2022-01-25
  • 2015-01-05
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-03-22
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多