【问题标题】:Bullets in document getting as a question mark in GATE NLP文档中的项目符号在 GATE NLP 中成为问号
【发布时间】:2016-08-08 10:35:41
【问题描述】:

我是GATE NLP 的新手。我有一个文件,其中包含项目符号。当我将它加载到GATE 时。项目符号被检测为未知类型符号,打印为 。我还尝试将编码设置为UTF-8。而且我还尝试以编程方式加载文档,然后项目符号被检测为 ?

谁能解释一下?

例子:

 Promoted to Senior Member Technical in 2.5 years of experience.

这是GATE DEVELOPER UI 中的符号,? 符号在我“以编程方式”执行时显示。

【问题讨论】:

  • 您必须提供更多详细信息,否则无法回答您的问题...例如:您正在加载哪种文件(txt、pdf、doc、docx)? “以编程方式加载”是什么意思?你能发布你的源代码的相关部分吗?
  • 对于pdf,这可能与此有关:在 WinAnsiEncoding 中,任何大于 040 的未使用代码都映射到项目符号字符 issues.apache.org/jira/browse/PDFBOX-1713
  • 适用于 pdf ,doc , Docx 。以编程方式意味着,我正在使用嵌入式门来加载文档并使用管道执行它。当我执行它时,然后呢?有吗?

标签: java encoding nlp stanford-nlp gate


【解决方案1】:

根据我的经验,docdocx 文件通常不会产生 字符。项目符号丢失(文本格式为项目符号列表)或打印为(带有原始项目符号字符的文本)。

另请参阅此相关问题:Parsing either font style or block of paragraph in GATE

Pdf 文件通常在 GATE 文档中产生“-bullet characters”。它可能与一些 pdfApache PDFBox 问题有关,参见例如this one.

这些字符也有一个 unicode 值。在 XML 中,它们被编码为例如。在这种情况下,我的建议是跟踪此类字符(它们可能具有不同的 unicode 值,具体取决于原始项目符号字符)并将它们替换为可打印的内容(例如 )。

关于? 字符:我可能是由于您的java 环境不支持这些字符。参见例如:Why Some Unicode Characters appears to be question mark in the console?

【讨论】:

  • 是的,问题出在 pdf 文档上。现在我将 doc 转换为 HTML,然后处理 HTML document 。所以,它对我有用。谢谢@dedek
猜你喜欢
  • 2015-12-20
  • 2023-03-17
  • 2020-12-08
  • 1970-01-01
  • 2013-05-06
  • 2015-12-29
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多