【问题标题】:Documenting illegible documents记录难以辨认的文件
【发布时间】:2014-11-07 10:51:45
【问题描述】:

我正在尝试制作可搜索的手写文档记录。其中一些有时非常不清楚,我正在寻找在数据库中捕获它们的最有效方法,但仍然能够使用任何可能的字母/单词分支来搜索术语。

我目前的想法如下......但我认为寻找“Tom Sawyer”的查询会非常缓慢地实现这样的目标。有谁知道如何最好地做到这一点?

表格:全文 FullTextID 全文 0001 此文本由 T{*1}m {*2} 编写 0002 这份文件更{*1}阅读 表格:更改 DocID ChangeID ChangeIter ChangeText 00001 1 1 我 00001 1 1 00001 1 2 索耶 00001 1 2 赛尔 00002 1 1 乐趣 00002 1 1 硬 00002 1 1 凌乱

...或者可能只是一个修改过的全文表,所有变体在 {} 之间连接,然后在 WHERE 子句中使用 Perl 表达式进行扫描?

提前致谢

【问题讨论】:

标签: mysql perl substring


【解决方案1】:

Mysql 和 regex 不是这种搜索的最佳工具。

您生成问题中提到的变体并将所有文本解析为 n-gram。然后将它们输入使用 n-gram 作为输入的搜索引擎,而不是原始文本。

【讨论】:

  • 非常感谢 Daxim - 我以前听说过 N-gram,但从来没有想过这个...我会读一些书! :)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-09-16
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多