【问题标题】:how schema.org can help in nlpschema.org 如何在 nlp 中提供帮助
【发布时间】:2014-10-11 09:51:44
【问题描述】:

我主要从事 nlp 工作,从网页中收集基于兴趣的数据。

我发现这个来源 http://schema.org/ 对 nlp 的东西很有帮助。

我浏览了文档,从中我可以看到它添加了额外的标签属性来识别 html 标签内容。

它可以帮助搜索引擎根据用户查询获取特定数据。

它说:Schema.org 提供了一组共享词汇,网站管理员可以使用这些词汇以主要搜索引擎可以理解的方式标记他们的页面:Google、Microsoft、Yandex 和 Yahoo!

但我不明白它如何帮助我成为 nlp 人?通常我会解析网页内容以处理并从中提取数据。 schema.org 可能会有所帮助,但不知道如何使用它。

任何示例或指导都是值得赞赏的。

【问题讨论】:

    标签: nlp data-mining


    【解决方案1】:

    Schema.org 使用微数据格式进行表示。人们使用微数据进行文本分析和提取策划内容。可以有很多应用。

    1. 假设您要创建新闻摘要系统。因此,您可以使用hNews 微格式来提取最相关的内容并对其进行汇总

    2. 假设如果您有基于评论的搜索引擎,您希望在其中列出评论最多的产品。您可以使用hReview microfomrat 提取评论,现在对其进行情感分析以识别产品有 -ve 或 +ve 评论

    3. 如果您想创建基于技能的简历分类器,请使用hResume 微格式提取内容。它可以为您提供各种详细信息,例如联系方式(使用 hCard 微格式)、经验、成就、与此工作相关、教育、技能/资格、隶属关系 ,出版物,性能/性能技能等。您可以对其执行分类器以对具有特定技能的简历进行分类

    Thought schema.org 不能直接帮助nlp 伙计们,它提供了更好地执行文本处理的平台。

    查看此http://en.wikipedia.org/wiki/Microformat#Specific_microformats 以查看各种镜像格式,同一页面将为您提供更多详细信息。

    【讨论】:

      【解决方案2】:

      Schema.org 类似于词汇表或本体,用于注释数据,特别是网页。

      从网页中提取微数据是个好主意,但它真的被 Web 开发人员使用吗?我不这么认为,我认为大多数微数据都被谷歌或雅虎等公司使用。

      最后,您可以找到数据,但不是很多,主要由特定类型的网站使用。

      您要提取什么以及用于什么类型的应用程序?因为您可能可以使用其他类型的数据,例如 DBpediaFreebase

      【讨论】:

        【解决方案3】:

        GoodRelations 还支持 schema.org。您可以根据定义的各种域上下文从前端动态注释您的内容。因此,schema.org 对于 NLP 提取非常有用。甚至可以将它用于 HATEOS 服务以实现超媒体链接关系。任何上下文的元数据(关于数据的数据)通常对内容和数据都有好处。替代方案包括微格式、RDFa、RDFa Lite 等。您拥有的上下文越多越好,因为它将您的数据转化为智能内容并帮助爬虫机器人理解数据。它还进一步进入数据网络并帮助对资源域进行全局查询。从长远来看,这些方法将有助于代理在网络上进行迁移学习的领域适应。几乎使网页成为大量常识知识库的外化单元。它们还可以帮助广告代理商了解发布商网站并更好地对广告重定向进行情境化。

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 2017-04-26
          • 2015-03-07
          • 2011-07-23
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多