【发布时间】:2014-10-11 09:51:44
【问题描述】:
我主要从事 nlp 工作,从网页中收集基于兴趣的数据。
我发现这个来源 http://schema.org/ 对 nlp 的东西很有帮助。
我浏览了文档,从中我可以看到它添加了额外的标签属性来识别 html 标签内容。
它可以帮助搜索引擎根据用户查询获取特定数据。
它说:Schema.org 提供了一组共享词汇,网站管理员可以使用这些词汇以主要搜索引擎可以理解的方式标记他们的页面:Google、Microsoft、Yandex 和 Yahoo!
但我不明白它如何帮助我成为 nlp 人?通常我会解析网页内容以处理并从中提取数据。 schema.org 可能会有所帮助,但不知道如何使用它。
任何示例或指导都是值得赞赏的。
【问题讨论】:
标签: nlp data-mining