【问题标题】:Querying web pages with Python使用 Python 查询网页
【发布时间】:2013-10-04 01:46:22
【问题描述】:

我正在学习使用 Python 进行网络编程,我正在做的练习之一如下:我正在编写一个 Python 程序来查询网站“orbitz.com”并返回最低机票。出发和到达城市和日期用于构建 URL。

我是用 urlopen 命令来做的,如下:

(search_str 包含 URL)

from lxml.html import parse

from urllib2 import urlopen

parsed = parse(urlopen(search_str))

doc = parsed.getroot()

links = doc.findall('.//a')

the_link = (links[j].text_content()).strip()

这个想法是从查询结果中检索所有链接并搜索“Delta”、“United”等字符串,并读出链接旁边的美元金额。

直到今天它都成功运行 - 看起来 orbitz.com 已经更改了他们的输出页面。现在,当您在 orbitz.com 网站上输入旅行详细信息时,会出现一个页面,显示一个轮子,上面写着“查找行程”或类似的内容。这只是一个填充页面,不包含任何真实信息。几秒钟后,显示实际结果页面。不幸的是,Python代码每次都返回填充页面的链接,我从来没有得到真正的结果。

我该如何解决这个问题?我是网络编程的相对初学者,因此非常感谢任何帮助。

【问题讨论】:

    标签: python html web urlopen


    【解决方案1】:

    这种事情在爬虫的世界里很正常。

    您需要做的是找出它在“行程页面”之后重定向到的 url,然后直接从脚本中点击该 url。

    然后确定他们是否也更改了最终搜索结果页面,如果是,请修改您的脚本以适应这些更改。

    【讨论】:

    • 谢谢。但是,我仍然卡住了。看起来填充器的 URL 与结果页面的 URL 完全相同。或者可能没有显示真正的 URL。你能告诉我如果它没有显示在浏览器中,如何获取 URL?
    • 除非你告诉我网站是什么,网址是什么,我无法提供帮助......
    猜你喜欢
    • 2017-03-19
    • 2014-04-04
    • 1970-01-01
    • 2019-03-28
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-10-19
    相关资源
    最近更新 更多