【问题标题】:Text mining MS Word documents?文本挖掘 MS Word 文档?
【发布时间】:2012-05-08 12:05:38
【问题描述】:

我有大约 30 个 .docx 文档(简历),其中包含有关人员姓名、技能等的数据。我需要使用其中的一些信息填充电子表格,并且为了减少手动工作,我认为我可以使用文本挖掘方法。

是否有任何工具或方法可用于从这些文档中挖掘(某种半结构化)信息?

【问题讨论】:

  • 您可以使用python-docx 等工具获取文件的内容。获取名称、技能等更难(假设它们不遵循相同的格式)。你可以尝试手动编写一些规则,但如果你想让它更健壮,可以使用商业工具like this one...

标签: text ms-word data-mining text-mining


【解决方案1】:

在 docx 或 doc 中有多种读取 word 文件的方法, docx 文件只是一个花哨的容器。但是 doc 文件提取起来有点棘手。

我会告诉你一些从word中提取文本的方法

  1. .doc/docx >> open with open suit >> 使用 python 的用户 pyUNO 并获取您的数据。
  2. .doc/docx >> 使用 python .docx 模块和 Textract 和提取数据。
  3. .doc/docx >> 使用R Programming,其中有许多模块,如officer和ReporterRS >> 提取数据。
  4. 使用文本挖掘将文本从一种形式转换为另一种形式。

【讨论】:

    【解决方案2】:

    您可以尝试使用catdoc http://www.wagner.pp.ru/~vitus/software/catdoc/ 工具,该工具将从MS Word 文件中提取文本内容,然后执行您想要的任何文本处理。我可能只是grep,因为简历中存在某些单词,而不是 catdoc 的输出。过度设计解决方案毫无意义。

    【讨论】:

      【解决方案3】:

      我能想到的最好方法是使用 perl,因为我知道您可以使用 perl 模块 pull from word documents(尽管这本身可能很棘手)和 populate xml spreadsheets

      我已经很久没有愤怒地写过perl了,所以我无法提供如何做到这一点的例子,但是如果我要把一些东西放在一起来做到这一点,我会推荐perl。我相信有人会说在 python 中,甚至在 Ruby 中也有等价的函数,但是我使用的是 perl,我发现它对于操作/匹配/解析/处理文本非常有效。

      【讨论】:

        猜你喜欢
        • 2014-05-18
        • 2015-03-10
        • 2019-05-05
        • 2013-02-09
        • 1970-01-01
        • 2019-06-04
        • 1970-01-01
        • 2013-08-02
        • 2013-12-31
        相关资源
        最近更新 更多