【问题标题】:Want to apply machine learning algorithm to analysis of complex data想将机器学习算法应用于复杂数据的分析
【发布时间】:2017-10-07 15:11:21
【问题描述】:

我目前正在研究我的一项工作任务,我正在考虑一些特定的想法和新方法来解决它,所以我真的希望我能得到该领域专家的帮助:-)。

我目前正在对历史数据的复杂数据集进行分析,该数据集表示建造海上平台的成本与当前油田已发现资源之间的关系(或者可以使用年产量的平均值)。每个数据点都有一组参数,例如地理来源、主要碳氢化合物的类型、水深、到最近的基础设施的距离、平台类型等(共 10 个参数)。 这个想法是构建一条趋势线,可以用来预测未来油田的成本,因为后者的生产/资源总是被报告的。

总体趋势是,如果资源/产量增加,成本也会增加。所以在模型中可以很容易地观察到一些线性,但是,在这种情况下,简单的线性回归太虚了,因为我们在数据集中给出了很多不同的信息。

我攻读了应用数学硕士学位,专攻数值方法和偏微分方程,但我现在面临的是一个非常常见的与统计行业相关的问题。我还假设这项任务是通过应用机器学习算法来解决的完美候选,因为将不断添加越来越多的数据点,并且曲线/趋势线可用于进一步预测未来领域的成本,了解他们的生产/资源和性质(参数)。但是,我对这个领域完全陌生,因此您的任何评论、信息等将不胜感激:-)

提前致谢

【问题讨论】:

  • 欢迎来到 Stackoverflow。首先 - 见stackoverflow.com/help/how-to-ask - 你应该有一个具体的问题才能得到一个具体的答案,这个问题可能会被关闭,因为它可能会基于意见。虽然我们会尽力帮助您

标签: python algorithm machine-learning statistics


【解决方案1】:

恕我直言,这个问题非常宽泛,并不是很具体,所以您可能会得到一个宽泛但不具体的答案。

我相信您有一个很好的机器学习实施用例。干得好。

我建议获取一些非常实用和实用的“操作方法”资源。我真的很喜欢this ML course,它可以为您指出从哪里开始以及如何进行动手操作,例如将数据划分为学习、测试和交叉验证集、规范化、正则化、派生特征等。

通常 - 您已经发现您的问题看起来像是具有多个特征的受监督机器学习。线性回归可能无法完全发挥作用(正如您所指出的),您可以尝试构建更复杂的模型,但不要过于复杂。我将从具有正则化参数的多项式模型开始,并查看某些派生特征是否更合适。

但只有您可以看到您的数据是什么样子以及什么可以作为初始模型:) 祝你好运

【讨论】:

  • 非常感谢您的回答!我完全同意这个问题很广泛,我没想到会得到任何准确的答案。只是想有人指出我正确的方式。而且我认为堆栈溢出只是我可以获得这种建议的最佳场所。我一定会在课程时代报名参加课程!再次感谢您的评论
猜你喜欢
  • 2020-01-24
  • 2017-06-07
  • 2012-03-14
  • 2019-07-15
  • 2011-08-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多