【发布时间】:2011-03-14 16:40:55
【问题描述】:
我正在编写一个书签,它将从站点中提取信息并将其发送到用户帐户以保存以供以后使用。这通常包括获取非结构化信息并将其结构化的问题。举个例子,一个业余爱好者想要保存一个项目以备后用。他们需要获取许多部件并遵循说明。在一篇博客中,作者可以将说明称为directions 或recipe 或任何数量的同义词。一个人可能会列出带有<li> 标签的信息来订购步骤,而另一个人可能不会。
将非结构化数据转化为结构化信息的一般策略是什么?是否有其他策略来确定哪些内容是相关的? (即 Instapaper 或可读性)
【问题讨论】:
-
我认为没有“通用策略”。 “一般策略”可能是告诉他们构建他们的内容。如果这不是一个选择,你可能应该让自己被谷歌聘用,并在你生命的未来几十年里用他们的后备来解决这个问题:)
标签: javascript ruby-on-rails parsing computer-science