【问题标题】:Fetch html content from a destination url that is on onload of the first site in urllib2从 urllib2 中第一个站点的 onload 目标 url 获取 html 内容
【发布时间】:2012-09-12 08:29:04
【问题描述】:

我正在尝试使用 urllib2 获取网站的 HTML 内容。该站点有一个正文 onload 事件,它在此站点上提交表单,因此它会转到目标站点并呈现我需要的详细信息。

response = urllib2.urlopen('www.xyz.com?var=999-999')

www.xyz.com 包含一个发布到“www.abc.com”的表格,这个 动作值取决于 url 'var=999-999' 中的内容 这意味着如果 var 值更改为,则操作值将更改 '888-888'

response.read()

这仍然给了我 "www.xyz.com" 的 html 内容,但我想要 生成的操作 url。获取 html 的任何建议 最后一页的内容?

提前致谢

【问题讨论】:

    标签: python urllib2


    【解决方案1】:

    你必须弄清楚对第二页的调用,包括发送的参数,这样你就可以从你的 python 代码中自己调用,最好的方法是在打开谷歌浏览器页面检查器的情况下导航第一页,然后转到网络选项卡在哪里POST 调用将被捕获,您可以看到发送的参数和所有参数。然后从 urllib2 重新创建相同的 POST 调用。

    【讨论】:

    • 我想把这些留给图书馆,但无论如何我已经在 selenium 中实现了。
    猜你喜欢
    • 2012-07-11
    • 2011-09-21
    • 2012-04-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-12-15
    • 1970-01-01
    • 2018-08-16
    相关资源
    最近更新 更多