【发布时间】:2017-01-14 21:54:00
【问题描述】:
我是机器学习的新手,我正在寻找一种基于训练数据集学习字符串模式的技术。
我的问题: 我有不同类型的单词,属于不同的类别。每个类别都有自己的模式(例如,一个具有固定长度,只有特殊字符,另一个存在仅出现在该“单词”类别中的其他字符)。
例如:
"ABC" -> type1
"ACC" -> type1
"a8 219" -> type2
"c 827" -> type2
"ASDF 123" -> type2
...
我正在寻找一种机器学习技术,以根据训练数据自行学习这些模式。我已经尝试自己定义一些预测变量(例如字长、特殊字符的数量……),然后使用神经网络来学习和预测类别。但这实际上不是我想要的。我想要一种技术来自己学习每个类别的模式 - 甚至可以学习我从未想过的模式。
我想为算法提供学习数据(由单词类别示例组成),并希望它学习每个类别的模式,以便在以后的生产中从相似或相等的单词中预测类别。
有最先进的方法吗?
感谢您的帮助
【问题讨论】:
标签: machine-learning pattern-matching weka mahout