【问题标题】:How can I scrape data from a website protected with Shibboleth?如何从受 Shibboleth 保护的网站上抓取数据?
【发布时间】:2011-05-25 04:03:56
【问题描述】:

我正在尝试从我大学的一个网站上抓取数据,该网站使用 Shibboleth 作为一种身份验证/保护形式。但是,我很难确定通过它并到达我希望抓取的页面的最佳方式。我有有效的凭据,可以用来登录。有人对如何完成这项任务有任何建议吗?

【问题讨论】:

  • 也许你应该用谷歌搜索它,并留给你自己
  • @Ibu 为什么?他不是在问如何绕过安全性,而是在问如何以编程方式登录。

标签: screen-scraping shibboleth


【解决方案1】:

我一直致力于成功编写 Shibbolized 登录脚本(在我的例子中,用于监控 Shibboleth IdP 及其保护的应用程序的运行状况)。

我正在使用 Python 的 urllib 模块及其类来处理重定向跟踪和 cookie 传递(用于 Shibboleth)和登录表单发布。在对 urllib 进行一些修改后,您可以通过 Shibbolized 登录获得成功。您可以使用这种方法来处理对 Shibbolized 网站的初始登录,然后直接使用 Python 的 urllib 来处理抓取。

Example Python script for logging into Shibboleth

【讨论】:

    【解决方案2】:

    您可以使用 Mechanize 提交表单并登录网站:http://wwwsearch.sourceforge.net/mechanize/

    【讨论】:

      【解决方案3】:

      我相信ECP 配置文件旨在通过非浏览器客户端(即命令行)访问受 Shibboleth 保护的资源

      尝试我在上面链接的 Shibboleth wiki 页面上提供的示例客户端之一

      【讨论】:

        【解决方案4】:

        你也可以试试Apache JMeter,只记录你的动作,做一些脚本(嗯,就shibboleth而言,这不是那么容易),然后你就可以自动访问这个页面了。

        [编辑 - 更好的解决方案] 我相信在 Shibboleth 文档页面上是 scripts 用于 Grinder(另一个负载测试工具)。这个测试计划实际上应该很容易修改并用于您的目的的 Python(ok Jython)脚本

        【讨论】:

          【解决方案5】:

          回复很晚,但您可以在通过身份验证后使用 Facebook Webdriver 进行登录和抓取。

          【讨论】:

            猜你喜欢
            • 1970-01-01
            • 2022-01-07
            • 1970-01-01
            • 2023-04-04
            • 1970-01-01
            • 2019-10-10
            • 1970-01-01
            • 1970-01-01
            • 2015-07-01
            相关资源
            最近更新 更多