【问题标题】:Parsing Unstructured Data解析非结构化数据
【发布时间】:2011-03-14 16:40:55
【问题描述】:

我正在编写一个书签,它将从站点中提取信息并将其发送到用户帐户以保存以供以后使用。这通常包括获取非结构化信息并将其结构化的问题。举个例子,一个业余爱好者想要保存一个项目以备后用。他们需要获取许多部件并遵循说明。在一篇博客中,作者可以将说明称为directionsrecipe 或任何数量的同义词。一个人可能会列出带有<li> 标签的信息来订购步骤,而另一个人可能不会。

将非结构化数据转化为结构化信息的一般策略是什么?是否有其他策略来确定哪些内容是相关的? (即 Instapaper 或可读性)

【问题讨论】:

  • 我认为没有“通用策略”。 “一般策略”可能是告诉他们构建他们的内容。如果这不是一个选择,你可能应该让自己被谷歌聘用,并在你生命的未来几十年里用他们的后备来解决这个问题:)

标签: javascript ruby-on-rails parsing computer-science


【解决方案1】:

嗯...也许您可以将它与 Google 结合使用?看看头部和元标签也是一个好主意。您还可以列出单词的使用频率。哎呀,您甚至可以有一个弹出警报,要求用户输入有关页面的数据。

【讨论】:

  • 如果爱好者只使用 WordPress 或 Blogger 并且元标记没有意义怎么办?
  • @rynmrtn:在那种情况下,他们可能不关心用户从他们的东西中提取结构化数据。
【解决方案2】:

这个问题似乎没有一个好的计算机科学答案,所以我决定改变方法,让用户按照他们认为合适的方式组织数据。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-11-20
    • 2017-08-30
    • 2015-09-14
    • 2015-07-26
    • 1970-01-01
    • 1970-01-01
    • 2019-07-29
    相关资源
    最近更新 更多