【发布时间】:2010-12-21 23:33:46
【问题描述】:
我的任务是抓取/解析和索引许多图书馆网页上的可用书籍。我通常使用 HTML Agility Pack 和 C# 来解析网站内容。其中之一是:
http://bibliotek.kristianstad.se/pls/bookit/pkg_www_misc.print_index?in_language_id=en_GB
如果您搜索 *(所有书籍),它将返回许多书籍列表,每页分页 10 本书。
我发现的典型网络爬虫在这个网站上失败了。我还尝试编写自己的爬虫,它会遍历页面上的所有链接并生成 post/get 变量以动态生成结果。我也无法做到这一点,主要是因为我得到了一些 404 错误(尽管我确信生成的链接是正确的)。
网站依赖javascript生成内容,并采用GET和POST变量提交的混合模式。
【问题讨论】:
-
这里有问题吗?
标签: c# web-crawler