【发布时间】:2019-06-11 21:00:47
【问题描述】:
更新:我想通了。见底部...但如果我遗漏了什么,请随时纠正我...
对于来自以下元标记的信息,crawler-conf.yaml(以及其他地方,如果需要)中的正确设置是什么:
<meta name="college" content="artdesign"/>
要正确捕获到字段名称为“college”或“seed”的索引中吗?
我看到以下设置可能需要设置,但尝试了各种变体,似乎没有捕获数据。
在crawler-conf.yaml:
# lists the metadata to persist to storage
# these are not transfered to the outlinks
metadata.persist:
- _redirTo
- error.cause
- error.source
- isSitemap
- isFeed
- college
- seed
不确定“持久存储”是否意味着索引?
crawler-conf.yaml 中的另一个选项是:
# configuration for the classes extending AbstractIndexerBolt
indexer.md.mapping:
- parse.title=title
- parse.keywords=keywords
- parse.description=description
- domain=domain
- college=college
- college=seed
我之前曾问过这样一个事实,即“种子”的某些值似乎正在传播到获取的没有元标记的文档。该设置是:
# metadata to transfer to the outlinks
# used by Fetcher for redirections, sitemapparser, etc...
# these are also persisted for the parent document (see below)
# metadata.transfer:
# - seed
因此,正如标题中所问的,我的问题是如何在crawler-conf.yaml(或任何其他配置)中配置这些选项,以可靠地从该问题顶部列出的元标记中捕获数据,而无需将其传播到获取的没有该元标记的文档?
【问题讨论】:
标签: elasticsearch stormcrawler