【问题标题】:TYPO3: Indexed search and crawler relationTYPO3:索引搜索和爬虫关系
【发布时间】:2017-09-23 03:29:48
【问题描述】:

我已经使用 TYPO3 indexed_search 完成了几个网站。但是我觉得我仍然不明白 indexed_search 和爬虫之间关系的本质。例如,根据一些作者来索引 tt_news,我只需要一个通用爬虫配置和一个用于 tt_news 的 indexed_search 配置;但是对于教程的其他作者,我应该为 tt_news 创建一个爬虫配置。

我不清楚 crawler 和 indexed_search 之间的关系。它们如何匹配?根爬虫配置在找到 indexed_search 配置时仅运行它就足够了吗?还是两者都需要生成 URL?我已经设法只使用一个爬虫根配置创建了一个索引,但我通过我自己的调用 cli_dispatch.phpsh 的 shell 脚本运行索引。

indexed_search 和 crawler 在功能(生成 URL)方面是否多余?

欢迎提供任何线索。

最佳,

乙。

【问题讨论】:

    标签: content-management-system web-crawler typo3


    【解决方案1】:

    Indexed_search 可以在没有爬虫的情况下通过索引访问者访问的页面来工作。明显的缺点是未访问的页面不会被编入索引,因此不会出现在搜索结果中。如果您配置了多个前端用户组,那么访问页面的机会会更低。

    爬虫可以通过访问每个页面来解决这个问题。此外,它可以访问页面,就好像它是 FE 用户组(组合)的成员一样。通过这种方式,它可以帮助为各种用户构建整个网站的索引。

    Xavier Perseguers 在tutorial 中解释了大部分细节。它是为旧版本编写的,但我想其中大部分仍然有效。 (距离我上次使用 indexed_search 已经有一段时间了,但当时教程帮助很大)。

    【讨论】:

    • 嗨。非常感谢您的回答。我实际上已经使用了几次该教程。这在很大程度上是一种食谱类型的教程。我想更好地了解索引搜索的内部。在最新版本中,一直在使用 Fluid,并且出现了一些错误(从我的角度来看)。我也想了解为什么在爬虫和索引搜索中存在双重功能。
    • Jigal,也许你知道这个问题的答案:为什么 crawler_im 脚本不处理索引搜索钩子,而爬虫脚本会处理?我知道这是一个事实,因为我正在查看源代码,对我来说它绝对没有逻辑。你对此有见解吗?最佳。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-02-25
    • 2013-02-08
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多