【发布时间】:2017-01-28 19:03:28
【问题描述】:
我有大量 PDF 文档。我使用Apache Tika 将它们转换为文本,现在我想将它们分成段落。我不能使用正则表达式,因为文本转换使段落之间的区别变得不可能:一些文档在段落之间有一个\n 的标准方式,但有些文档在同一段落的行之间有一个\n,然后是一个双@ 987654325@ 段落之间(使用 Tika 转换为 HTML 而不是文本没有帮助)。
Python 的 NLTK 书有 splitting sentences using machine learning 的方式,所以我想尝试类似的段落,但我找不到训练数据。
有这方面的训练数据吗?我应该尝试一些可能有效的复杂正则表达式吗?
【问题讨论】:
标签: python regex machine-learning apache-tika