【发布时间】:2012-10-11 19:22:39
【问题描述】:
我想写一个正则表达式来解析这个网页(查看源:http://www.imdb.com/search/title?title=spiderman&title_type=feature)。基本上我想提取<tr class=".+"> 和</tr> 之间的所有部分。该网页是来自 imdb 的电影列表(http://www.imdb.com/search/title?title=spiderman&title_type=feature),这里的每个部分都表示一部电影。我尝试了正则表达式
<tr class=".+">(.+\n)+</tr>
但是,它不起作用。另外,我不允许使用 DOM。有没有人有什么建议?谢谢!
【问题讨论】:
-
为什么不允许使用 DOM?
标签: regex html-parsing