【发布时间】:2018-11-20 04:04:32
【问题描述】:
目标:
1.开发一种规范方法,使用纯文本来唯一地表示一般的 STEM 论文,特别是数学论文。
- 开发可以将现有的 STEM 类型论文转换为 100% 准确度的规范形式的软件。请注意,我不能容忍任何错误,因为作为一个人,我无法校对数百万篇论文以纠正转换中的错误,即使平均每篇论文的错误率为 0.001。
问题:
- 由于无法处理的数学符号,我在 Stackoverflow 和其他地方(例如 PyMuPDF)上看到的所有 PDF 到文本、TeX 到文本等程序都不能真正工作。
2.PDF 真的很难处理。
3.TeX 真的很难处理,因为 STEM 论文作者倾向于将大量宏添加到他们的源文件中,这往往会破坏 LatexML 和其他转换器。处理我自己的论文很容易,因为我不使用很多新命令。然而,有许多作者的论文包含\def 甚至不能被de-macro 处理的宏。为了真正让 TeX 工作,假设我什至可以在 arXiv 上获得大多数论文的源文件,我几乎必须编写自己的 TeX 引擎变体,以某种方式扩展所有必需的宏并生成纯文本文档。
还有其他方法可以解决这个问题吗?目前,我更喜欢的目标格式几乎只是用 LaTeX 编写的纯文本 + 数学符号,除了那些在语义上重要的格式(例如 \mathcal{A} 和 A 是单独的实体)之外没有其他格式。假设我的笔记本电脑足够强大,我可以学习建立一个神经网络来训练它理解这些打印的数学符号。网络要学习的符号实际上只有不到 200 个,并且由于缺乏变化,它们的形状应该很容易识别。我应该这样做吗?
【问题讨论】:
-
这是一个非常广泛的要求,需要非常准确的结果,而没有任何一般可以使用的示例。
-
@Werner 当然。我的目标是将arxiv.org/abs/1802.00001 等随机论文中的文本转换为纯文本,同时保留所有语义上重要的信息。
标签: pdf latex postscript mathml