【问题标题】:Python html parsing. Can i do on ready?Python html 解析。我可以做好准备吗?
【发布时间】:2016-11-22 08:08:30
【问题描述】:

我是 python 新手。我可以拨打电话以获取ready 状态的 html 内容吗?我需要解析站点,其中有一些我只能在ready 状态下查看的 html。有没有变种可以做到这一点?谢谢和对不起我的英语。这是我的一段代码:

import lxml.html as html
from lxml.html import tostring
import string
import re

letters = list(string.ascii_lowercase)
main_domain_stat = 'http://www.copyright.gov/onlinesp/list/'

page = html.parse('%s/a_agents.html' % (main_domain_stat))

【问题讨论】:

    标签: python curl html-parsing lxml


    【解决方案1】:

    你无法通过查看 html 来获得 readystate 的状态。 html 模块是一个 html 解析器(你应该试试 beautifulsoup),你可以访问这些参数,你只会得到 html 代码。

    我看到了两种解决方案: 首先,您查看加载结束时可能出现的内容。如果你找到它,它就存在。 其次,您可以使用 selenium webdriver(python 模块)来测试页面是否完全下载。

    【讨论】:

    • 据我所知 selenium 会调用浏览器。我可以隐藏使用它吗?
    • 不,这对于 selenium 是不可能的,因为它模拟了真实用户的使用
    • 你也许可以在这里找到你要找的东西:stackoverflow.com/questions/6025082/…
    猜你喜欢
    • 1970-01-01
    • 2011-09-10
    • 1970-01-01
    • 2018-12-16
    • 1970-01-01
    • 2011-02-01
    • 2016-06-21
    • 2012-07-03
    相关资源
    最近更新 更多