【问题标题】:machine learning to overcome typo errors [closed]机器学习以克服拼写错误[关闭]
【发布时间】:2013-08-22 04:42:00
【问题描述】:

假设我有一个药物名称列表(crocin、seroflo、oxitab 等)。列表很长。现在假设我需要查找列表中是否存在特定药物,但也可能存在拼写错误。假设我打算在列表中找到 crocin,但我输入的是 crosin。我希望机器学习算法能够克服我的这个印刷错误以及像crocin和crosin这样的小差异,它应该返回匹配找到

【问题讨论】:

  • 在 Stack Overflow,代码优先于网站链接,因为一旦链接发生变化,问题将不再具有历史价值。请访问 here 获取有关将代码格式化为您的问题的帮助。

标签: text machine-learning classification


【解决方案1】:

我认为您不需要机器学习,一个简单的编辑距离算法应该可以做到这一点。

https://en.wikipedia.org/wiki/Edit_distance

【解决方案2】:

我同意使用 ML 方法的必要性值得怀疑。但是如果你真的想使用基于学习的方法进行“拼写校正”(我不确定这是否适用于药名),你可以参考以下论文:

一种基于 winnow 的上下文相关拼写校正方法

噪声通道拼写校正的改进错误模型

用于搜索查询拼写校正的大规模基于排序器的系统

具有潜在查询拼写校正的判别模型 结构支持向量机

一种在以域为中心的搜索中进行拼写纠正的图形方法。

这篇论文是关于人名更正的:

基于散列的个人姓名拼写更正方法

【讨论】:

  • 任何数据库都可以用来解决这个问题。假设我把这两个表作为regular_list 和new _list。那么通过查询我可以比较上述距离并让数据库相应地返回解决方案吗????
猜你喜欢
  • 2012-09-04
  • 1970-01-01
  • 2017-12-25
  • 1970-01-01
  • 1970-01-01
  • 2013-02-04
  • 2011-06-16
  • 2018-11-16
  • 1970-01-01
相关资源
最近更新 更多