【发布时间】:2015-11-21 00:04:55
【问题描述】:
我有一个大型餐厅菜肴数据集(例如,“Pulled Pork”、“Beef Brisket”...)
我正在尝试“规范化”(错误的词)菜肴。我希望“Pulled Pork”、“Pulled Pork Sandwich”和“Jumbo Pork Slider”都映射到一道菜“Pulled Pork”。
到目前为止,我已经开始使用 Python 进行 NLTK,并且在玩频率分布等方面获得了一些乐趣。
有没有人有解决这个问题的高级策略?也许我可以搜索一些关键字?
谢谢
【问题讨论】:
-
“拉肉”列表中的常见元素似乎是“猪肉”一词。我很想在菜的数据集中找到 n 个最常用的词(您可能想专门过滤掉名词),然后找到包含特定常用词的菜子集(可能重叠)。
-
尝试hyponym生成,见alt.qcri.org/semeval2015/task17/和无耻插件:aclanthology.info/papers/…
标签: python machine-learning nlp nltk