【发布时间】:2014-02-01 13:50:54
【问题描述】:
我试图找到如何阻止爬虫访问我的链接,如下所示:
site.com/something-search.html
我想屏蔽所有的 /something-*
有人可以帮我吗?
【问题讨论】:
-
这个问题似乎是题外话,因为它是关于 SEO
标签: seo web-crawler robots.txt
我试图找到如何阻止爬虫访问我的链接,如下所示:
site.com/something-search.html
我想屏蔽所有的 /something-*
有人可以帮我吗?
【问题讨论】:
标签: seo web-crawler robots.txt
User-agent: *
Disallow: /something-
这会阻止路径以 /something- 开头的所有 URL,例如可从 http://example.com/robots.txt 访问的 robots.txt:
http://example.com/something-http://example.com/something-foohttp://example.com/something-foo.htmlhttp://example.com/something-foo/bar仍允许使用以下 URL:
http://example.com/somethinghttp://example.com/something.htmlhttp://example.com/something/【讨论】:
在您的 robots.txt 中
User-agent: *
Disallow: site.com/something-(1st link)
.
.
.
Disallow: site.com/somedthing-(last link)
为您不想被看到的每个页面添加条目!
虽然 robots.txt 中不允许使用正则表达式,但一些智能爬虫可以理解它!
看看here
【讨论】:
Disallow 不得包含 URL 的主机(在您的情况下为 site.com)。