【问题标题】:Identifying questions in exam (text recognition)识别考试中的问题(文本识别)
【发布时间】:2014-07-19 14:41:24
【问题描述】:

我有数千个 pdf 格式的考试,我想将其问题提取为标准格式(JSON、YML 或 XML)。

它们是多项选择:

问题 1

第一个在月球上行走的人是谁?

a) 尤里·加加林

b) 艾伦·雷普利

c) 尼尔·阿姆斯特朗

d) 谢泼德

问题 2

太阳系有多少颗行星?

a) 10

b) 12

c) 14

d) 15

(...)

在 JSON 中:

{
  "number": 1,
  "wording": "Who as the first man to walk on the moon",
  "alternatives": {
    "a": Yuri Gagarin
    "b": Ellen Ripley
    "c": Neil Armstrong
    "d": Shepard
  }
}

需要注意的是,由于这些考试是由不同的老师进行的,因此它们可能会略有不同。这意味着即使提取为纯文本,我也无法使用正则表达式进行匹配。 (我试过了,组合(措辞结构/替代结构)很大)

例如:

“问题 X (...)”。

“问题 (X) (...)”。

“问题 X - (...)”。

"X) (...)".

“X- (...)”。

替代方案也可能会改变:

a) (...)

一个。 (...)

a- (...)

1) (...)

我想我需要某种机器学习工具来“教”程序什么是问题并让它找到。

作为替代方案,由于问题(印刷中的)在物理上彼此相距很远,我想我可以将这些 PDF 转换为图像并使用某种图像识别。

可行吗?是否有用于识别这些问题的工具(包、库、算法)?

【问题讨论】:

    标签: machine-learning text-mining image-recognition text-recognition


    【解决方案1】:

    没有直接的机器学习解决方案可以解决您的问题。如果您的 PDF 为 1000,格式为 10 秒,最好为每种格式编写一个字符串解析器。如果走机器学习的道路,找到解决方案的时间可能会更长。 Python 应该会有所帮助。

    【讨论】:

    • 其实是10万。但我想你是对的。我会尝试一种半自动的方法。解析但也手动验证和更正。
    猜你喜欢
    • 2018-01-16
    • 2021-11-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多