【发布时间】:2019-04-04 03:35:53
【问题描述】:
我正在尝试抓取这个webpage,它使用自定义字体以梵文呈现文本。我有网页中使用的字体的 ttf 文件。
我是否可以使用 ttf 文件抓取该网站并使用 Python(如果没有,任何语言)将内容编码为 unicode?
他们使用的字体是iitmsans.ttf from http://www.acharya.gen.in:8080/fonts/iitmfonts.php
【问题讨论】:
-
TTF 文件没有显示这些字形映射到哪个 Unicode 代码点。您需要创建一个表,其中包含从每个字符代码到其对应的 Unicode 代码点(也称为编码)的映射。
-
对于我来说,页面只呈现为 ½£ ÂO¤âÔOOd[kOÛOÓdÓOØO¯ 等。
-
这应该代表天城文吗?它是否有可能实际使用(类似)ISCII 或其他一些现有编码?
-
文本是梵文。它正在使用 iitmsans 字体。
-
acharya.gen.in:8080/fonts/iitmfonts.php 表示他们正在使用应该与 ISO-8859-1 兼容的自定义编码。他们是非营利组织,因此理想情况下,他们将拥有一份包含有关编码信息的公共文档。否则,您将不得不手动重建编码。我再说一遍,字体没有任何帮助(除非您可以渲染地图以帮助您查看字形的外观,以便您可以尝试在 Unicode 图表中找到它们)。
标签: python web-scraping truetype