【问题标题】:How to successfully convert math papers to plain text如何成功地将数学论文转换为纯文本
【发布时间】:2018-11-20 04:04:32
【问题描述】:

目标:

1.开发一种规范方法,使用纯文本来唯一地表示一般的 STEM 论文,特别是数学论文。

  1. 开发可以将现有的 STEM 类型论文转换为 100% 准确度的规范形式的软件。请注意,我不能容忍任何错误,因为作为一个人,我无法校对数百万篇论文以纠正转换中的错误,即使平均每篇论文的错误率为 0.001。

问题:

  1. 由于无法处理的数学符号,我在 Stackoverflow 和其他地方(例如 PyMuPDF)上看到的所有 PDF 到文本、TeX 到文本等程序都不能真正工作。

2.PDF 真的很难处理。

3.TeX 真的很难处理,因为 STEM 论文作者倾向于将大量宏添加到他们的源文件中,这往往会破坏 LatexML 和其他转换器。处理我自己的论文很容易,因为我不使用很多新命令。然而,有许多作者的论文包含\def 甚至不能被de-macro 处理的宏。为了真正让 TeX 工作,假设我什至可以在 arXiv 上获得大多数论文的源文件,我几乎必须编写自己的 TeX 引擎变体,以某种方式扩展所有必需的宏并生成纯文本文档。

还有其他方法可以解决这个问题吗?目前,我更喜欢的目标格式几乎只是用 LaTeX 编写的纯文本 + 数学符号,除了那些在语义上重要的格式(例如 \mathcal{A}A 是单独的实体)之外没有其他格式。假设我的笔记本电脑足够强大,我可以学习建立一个神经网络来训练它理解这些打印的数学符号。网络要学习的符号实际上只有不到 200 个,并且由于缺乏变化,它们的形状应该很容易识别。我应该这样做吗?

【问题讨论】:

  • 这是一个非常广泛的要求,需要非常准确的结果,而没有任何一般可以使用的示例。
  • @Werner 当然。我的目标是将arxiv.org/abs/1802.00001 等随机论文中的文本转换为纯文本,同时保留所有语义上重要的信息。

标签: pdf latex postscript mathml


【解决方案1】:

是的,你可以试试。识别符号,随后将它们转换为 LaTeX 格式(例如,将每个平方根写入 \sqrt)。

您可以进一步参考本文的识别问题:

https://www.sciencedirect.com/science/article/abs/pii/003132039090113Y -

手写符号的识别

Torfinn Taxt,Jórunn B.Ólafsdóttir,MortenDæhlen∥

http://neuralnetworksanddeeplearning.com/chap1.html - 在这里您可以通过代码示例了解更多关于将神经网络应用于手写稿件的信息。

【讨论】:

  • 非常感谢!好吧,我什至不需要处理手写符号。只是 arXiv 上的典型论文,它们的字体范围通常非常有限。
  • 哦,这让问题变得更容易了!
  • 对于手写符号,每个符号都存在人为错误和书写不准确的问题。你似乎从那个错误中解脱出来了。
猜你喜欢
  • 1970-01-01
  • 2010-09-22
  • 1970-01-01
  • 2011-03-12
  • 1970-01-01
  • 2012-04-12
  • 2014-09-08
  • 2011-04-06
  • 1970-01-01
相关资源
最近更新 更多