【发布时间】:2014-07-19 14:41:24
【问题描述】:
我有数千个 pdf 格式的考试,我想将其问题提取为标准格式(JSON、YML 或 XML)。
它们是多项选择:
问题 1
第一个在月球上行走的人是谁?
a) 尤里·加加林
b) 艾伦·雷普利
c) 尼尔·阿姆斯特朗
d) 谢泼德
问题 2
太阳系有多少颗行星?
a) 10
b) 12
c) 14
d) 15
(...)
在 JSON 中:
{
"number": 1,
"wording": "Who as the first man to walk on the moon",
"alternatives": {
"a": Yuri Gagarin
"b": Ellen Ripley
"c": Neil Armstrong
"d": Shepard
}
}
需要注意的是,由于这些考试是由不同的老师进行的,因此它们可能会略有不同。这意味着即使提取为纯文本,我也无法使用正则表达式进行匹配。 (我试过了,组合(措辞结构/替代结构)很大)
例如:
“问题 X (...)”。
“问题 (X) (...)”。
“问题 X - (...)”。
"X) (...)".
“X- (...)”。
替代方案也可能会改变:
a) (...)
一个。 (...)
a- (...)
1) (...)
我想我需要某种机器学习工具来“教”程序什么是问题并让它找到。
作为替代方案,由于问题(印刷中的)在物理上彼此相距很远,我想我可以将这些 PDF 转换为图像并使用某种图像识别。
可行吗?是否有用于识别这些问题的工具(包、库、算法)?
【问题讨论】:
标签: machine-learning text-mining image-recognition text-recognition