【发布时间】:2016-12-11 08:14:20
【问题描述】:
我想从 python(3) src 打印表情符号
我正在开展一个分析Facebook Message histories 的项目,在下载的原始 htm 数据文件中,我发现很多表情符号显示为带有问号的框,就像无法显示值时一样。如果我将这些符号作为字符串复制粘贴到终端中,我会得到诸如\U000fe328 之类的值。这也是我通过 BeautifulSoup 运行 htm 文件并输出数据时得到的输出。
我在 Google 上搜索了这个字符串(和其他字符串),并且始终提供它们的唯一网站之一是 iemoji.com,在上述字符串 this page 的情况下,该字符串将字符串列为 Python Src。我希望能够将这些字符串打印为它们对应的表情符号(毕竟,它们在收到消息时最初是表情符号),环顾四周后,我发现了一个 src 编码at this page 的映射,它将上面的类似字符串映射到表情符号字符串名称。然后我找到了this emoji string names to Unicode 列表,大部分似乎将表情符号名称映射到 Unicode。如果我尝试打印出这些值,我会得到很好的输出。喜欢关注
>>> print(u'\U0001F624')
????
有没有办法将这些“Python src”编码映射到它们的 unicode 值?如果不是因为原始 src 映射丢失了 unicode 库中大约 50% 的 unicode 值,那么链接这两个库将起作用。如果我最终不得不这样做,有没有一种好方法可以找到给定表情符号的 Python Src 值?根据我的测试表情符号字符串等于它们的 Unicode,例如'????' == u'\U0001F624',但我似乎无法与\U000fe328 建立任何关系
【问题讨论】:
-
u'\U0001F624'=='????',这是一个私人使用的字符。我猜 Facebook Messenger 将其用作 Unicode 标准中未定义的表情符号。 -
但必须有一些系统?几乎每一种 Src 编码或私人使用字符都被引用到 iemoji.om 上的表情符号。有什么方法可以在不抓取网站的情况下自动获取这些信息?
标签: python string unicode encoding