【发布时间】:2014-02-10 18:16:21
【问题描述】:
我尝试从 .doc 文件中提取文本。文本被提取,但问题是它总是输出这些:
��ࡱ�>�� ln 个字符。
这是我的代码:
doc=open(input_file,'r')
read_text_file = doc.readline()
doc_text = ""
for line in read_text_file:
doc_text+=str(line)
return doc_text
有没有办法将其删除或重新编码为 utf-8?
【问题讨论】:
-
.doc可能是专有的 Microsoft Word 文件。你不能像纯文本文件一样阅读它。 -
你能用word打开它们,然后保存到.txt吗?
-
@tk,还没试过那个。安全吗?如果用户没有word应用怎么办?
-
你有什么要求,能不能把输入格式改成docx:pypi.python.org/pypi/docx?
-
@tk 要求能够提取 doc 和 docx 文件中的文本。我已经完成了 Docx 文件。
标签: python