【问题标题】:Partial Text match - Uima Ruta部分文本匹配 - Uima Ruta
【发布时间】:2019-06-27 15:48:01
【问题描述】:

在 Ruta (WORDTABLE) 中是否可以进行部分文本匹配?

示例输入: 年鉴 书 数据手册 崇拜 友谊 年鉴

CSV 示例: 书;b. 船;嘘。

我有一个示例 CSV 文件和一个示例输入,我需要在其中匹配以“book”和“ship”结尾的单词。需要从第 2 列分配特征值。

【问题讨论】:

  • 如果文本由分解器/分词器处理,您可以使用 WORDTABLE 和 WORDLIST 的普通字典查找。字典查找适用于自动创建的 RutaBasic。这是一个选择吗?
  • @PeterKluegl 我试过 WORDTABLE 但只找到单词 book
  • 我的意思是您可以添加一个分解器,为年份和书籍创建单独的注释。然后,WORDLIST/WORDTABLE 也应该在年鉴中找到书。
  • CSV 文件包含多个条目,如何解组?
  • 我会使用另一个分析引擎,如包装器 jwordsplitter 或其他东西

标签: uima ruta


【解决方案1】:

是的,你可以使用正则表达式:

DECLARE MyWord(String ending);
W{REGEXP(".*book\b") -> CREATE(MyWord, "ending"="b");

或者你可以使用字符串函数:

w:W{endsWith(w.ct, "book") -> CREATE(MyWord, "ending"="b")};

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多