【问题标题】:Recommendations for using graphs theory in machine learning? [closed]在机器学习中使用图论的建议? [关闭]
【发布时间】:2012-01-18 14:15:13
【问题描述】:
通过观看 Christopher Bishops 的视频 (http://videolectures.net/mlss04_bishop_gmvm/),我学到了很多关于使用图表进行机器学习的知识。我发现它非常有趣,并观看了同一类别(机器学习/图表)中的其他一些内容,但想知道是否有人对学习更多方法有任何建议?
我的问题是,虽然这些视频给出了很高的理解,但我还没有太多的实践技能。我读过 Bishops 关于机器学习/模式的书以及 Norvig 的 AI 书,但两者似乎都没有涉及到具体使用图表。随着搜索引擎和社交网络的出现,我认为基于图表的机器学习会很流行。
如果可能,任何人都可以建议一个可以学习的资源吗? (我是这个领域的新手,开发对我来说是一种爱好,所以如果有一个非常明显的资源可供学习,我很抱歉......我尝试了谷歌和大学网站)。
提前致谢!
【问题讨论】:
标签:
algorithm
math
artificial-intelligence
machine-learning
graph-theory
【解决方案1】:
首先,我强烈推荐 Maksim Tsvetovat 和 Alexander Kouznetsov 的书Social Network Analysis for Startups。对于需要快速掌握特定学科(在本例中为图论)的基本流利程度的程序员来说,这样的书是天赐之物,这样他们就可以开始编写代码来解决该领域的问题。两位作者都是受过学术训练的图论者,但他们的书的目标读者是程序员。本书中几乎所有的大量示例都是使用 networkx 库在 python 中编写的。
其次,对于您心目中的项目,两种类库如果不是必不可少的话,也是非常有用的:
很容易安装和开始试验这些库,尤其是使用它们
学习基本的图论词典和分析单位
(例如,度数序列分布、节点遍历、图
运算符);
区分图中的关键节点(例如,度中心性,
特征向量中心性,分类);和
识别原型图子结构(例如,二分结构,
三角形、循环、派系、集群、社区和核心)。
使用图分析库快速理解图论的这些基本要素的价值在于,在大多数情况下,概念之间存在 1:1 映射 我刚刚在(networkx 或 igraph)库中提到了 functions。
因此,例如,您可以快速生成两个大小相等(节点数)的随机图,渲染然后查看它们,然后轻松计算例如平均度数序列或中间中心性,以及直接观察者如何变化这些参数的值会影响图的结构。
W/r/t ML 和图论技术的结合,这是我有限的个人经验。我在日常工作和图论中使用 ML 的频率较低,但很少一起使用。这只是一个仅限于我个人经验的经验观察,所以事实上我还没有发现一个问题,在这两个领域中结合技术似乎很自然。大多数情况下,图论分析在 ML 的盲点中很有用,即大量标记训练数据的可用性——监督 ML 技术在很大程度上依赖于此。 p>
说明这一点的一类问题是在线欺诈检测/预测。几乎不可能收集到可以合理确定地分离并标记为“欺诈性帐户”的数据(例如,归因于特定用户的在线交易集)。如果它们特别聪明和有效,那么您将错误地标记为“合法”,并且对于那些涉嫌欺诈的账户,通常第一级诊断(例如,额外的身份验证或延长兑现等待时间)通常是足以使他们停止进一步的活动(这将允许进行明确的分类)。最后,即使您设法以某种方式设法收集了一个合理无噪声的数据集来训练您的 ML 算法,它肯定会严重不平衡(即,比“欺诈”数据点更“合法”);这个问题可以通过统计预处理(重采样)和算法调整(加权)来管理,但它仍然是一个可能会降低结果质量的问题。
因此,虽然我从未能够成功地将 ML 技术用于这些类型的问题,但至少在两个例子中,我使用图论取得了一些成功——在最近的例子中,通过应用一个从卡内基梅隆大学的一个小组的项目最初指向detection of online auction fraud on ebay。
【解决方案2】:
MacArthur Genius Grant 获得者和斯坦福大学教授 Daphne Koller 合着了一本名为 Probabalistic Graphical Models 的关于贝叶斯网络的权威教科书,其中包含对应用图论的严格介绍对人工智能。它可能与您正在寻找的内容不完全匹配,但在其领域中非常受推崇。
【解决方案4】:
虽然这与您正在寻找的内容不完全匹配,但 textgraphs 是一个专注于图论和自然语言处理之间联系的研讨会。 Here 是一个链接。我相信研讨会也产生了this book。