【问题标题】:Setting timeouts to parse webpages using python lxml设置超时以使用 python lxml 解析网页
【发布时间】:2010-05-05 02:48:49
【问题描述】:

我正在使用python lxml库来解析html页面:

import lxml.html

# this might run indefinitely
page = lxml.html.parse('http://stackoverflow.com/')

有没有办法设置解析超时?

【问题讨论】:

    标签: python lxml


    【解决方案1】:

    它看起来使用urllib.urlopen 作为开启程序,但最简单的方法是修改套接字处理程序的默认超时。

    import socket
    timeout = 10
    socket.setdefaulttimeout(timeout)
    

    当然,这是一个快速而肮脏的解决方案。

    【讨论】:

    • 这只会在下载页面的 Web 请求时间过长时停止,而不是在 解析 时间过长时停止。有没有人找到办法做到这一点?
    猜你喜欢
    • 2017-07-29
    • 2023-04-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-09-02
    • 2015-09-08
    • 1970-01-01
    • 2016-05-13
    相关资源
    最近更新 更多