【问题标题】:Mapping Large Dataset to Categories with scoring使用评分将大型数据集映射到类别
【发布时间】:2020-01-20 16:42:23
【问题描述】:

试图找出解决这个问题的最佳方法。

我有一份几十万种食物的清单。我拥有的数据是:描述(基本上是项目名称)、食品类别、成分(食品项目表)

我正在尝试将每个食品项目与存在于不同数据集中的食品类别进行匹配。这些食品类别的划分略有不同,因此食品项目表中的食品类别没有一对一的映射。该数据集的字段包括:主类别、子类别和产品示例。 (食品分类表)

在食品项目表中,食品类别可能是错误的或笼统的。基本上,食品项目表中的食品类别是通用的,而食品类别表中的食品类别更为具体。

我希望创建一个算法来查看特定食品(在食品表中)并将其与食品类别表中的“推荐”条目相匹配。可能会给我前 5 个选项和每个选项的分数(或百分比匹配)。

如果可能的话,我希望随着时间的推移根据手动更正/干预、过去的映射等来学习...不确定 AI 是否是此处使用的正确术语。

此数据存储在 SQL Server 2016 中。它周围的应用程序位于 ASP.Net (C#) 中

再次寻找解决此问题的最佳方法。

【问题讨论】:

    标签: c# sql sql-server artificial-intelligence


    【解决方案1】:

    我想您有一些样本数据已经正确分类,可用作算法的指南。

    假设您已经对一些食物进行了分类:

    Name          Category  Ingredients
    Apple         Fruit     Apple
    Cheesecake    Dessert   Apple, Butter, Flour, Sugar, Cheese
    Cheeseburger  Junk      Bread, Tomato, Cheese, Meat
    

    算法应计算每种成分的分类,并给出相对百分比。类似的东西

    Ingredient    Category  Percentage
    Apple         Fruit     56
    Apple         Dessert   34
    Apple         Salad      6
    Apple         Drink      4
    Cheese        Sandwich  70
    Cheese        Junk      21
    Cheese        Dessert    7
    Cheese        Salad      2
    

    然后,当您有未分类的食物时,您只需将所有成分的百分比相加并按类别排序。

    您应该考虑增加一些权重,以使食物的所有成分的总分始终为 1。例如,如果您的食物有 4 种成分,则每种成分的得分仅为 0.25。这将降低一种成分在非常复杂的食谱中的重要性。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-09-19
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2012-10-08
      相关资源
      最近更新 更多