【问题标题】:Extracting text from Open Document file generates UnicodeEncodeError从打开的文档文件中提取文本会生成 UnicodeEncodeError
【发布时间】:2013-12-15 17:23:35
【问题描述】:

我正在尝试使用 odfpy 将附加到 Open Document Presentation 文件的注释转换为文本。我设法打开文件,列出“注释”对象,设法从中提取我认为是段落的内容,并且它以某种方式起作用,直到我尝试打印带有特殊字符的注释(德语变音符号öäü),这会导致错误:

UnicodeEncodeError: 'ascii' codec can't encode characters in position 17-19: ordinal not in range(128)

现在我发现我不是第一个遇到编码问题的人,我很乐意潜入重新编码文本。我的问题是我不知道如何将音符转换为正确的字符串。这是我的代码:

import sys
from odf.presentation import Notes
from odf.opendocument import load
from odf import text

doc=load(sys.argv[1])
slides=doc.presentation
notes=slides.getElementsByType(Notes)

for page in notes:
    pars = page.getElementsByType(text.P)
    for p in pars:
        print p

我只是遍历元素并尝试打印它们,希望能神奇地出现笔记中的文本。我已经在https://spideroak.com/browse/share/enno_middelberg/public/public 存放了一个示例演示文件来说明这个问题。

谁能告诉我如何将文本从 ODF 元素中取出并放入字符串中?

非常感谢,

恩诺

【问题讨论】:

    标签: python encoding odf


    【解决方案1】:

    str(p) 失败,因为 p 包含非 ascii 文本。

    使用print unicode(p)

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2021-11-19
      • 2020-09-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-12-27
      • 1970-01-01
      相关资源
      最近更新 更多