【发布时间】:2011-10-03 16:22:26
【问题描述】:
我很困惑,需要一些关于如何做到这一点甚至是否可以做到的想法。
我有一个客户想为特定国家(在本例中为泰国)的说英语的旅行者打造一个网站。不同的交通方式(公共汽车和火车)都有很好的网站来提供各自的信息。就它们呈现的数据而言,两者都是非常静态的(时间表很少改变)。这是我需要从中获取信息的站点之一:train schedules 客户希望为用户提供搜索起点和终点位置的能力,并使用外部网站的信息确定他们如何最好地到达那里,提供一条路线,其中包含不同交通方式的时间表。
现在,以我有限的经验,我认为这样做的方法是从外部站点的服务器(通过 API 或其他方式)检索原始时间表信息并将信息保留在数据库中,这可以是根据需要查询。我们的第一个想法是联系相关当局以确定如何/是否可以这样做,但事实证明,这主要是由于语言障碍造成的。
我的客户建议基本上是“屏幕抓取”,但这听起来充其量是复杂的,下载网页并通过 HTML 过滤相关/必要的数据以放入数据库。我担心这些主要是静态网站上的信息是如此静态,以至于数据甚至没有保存在数据库中来构建页面,并且网页本身会在发生变化时更新(硬编码)。
我真的可以在这里使用一些帮助和建议。谢谢!
【问题讨论】:
标签: screen-scraping external web sites