【问题标题】:how to write regular expression for this purpose?如何为此目的编写正则表达式?
【发布时间】:2012-10-11 19:22:39
【问题描述】:

我想写一个正则表达式来解析这个网页(查看源:http://www.imdb.com/search/title?title=spiderman&title_type=feature)。基本上我想提取<tr class=".+"> 和</tr> 之间的所有部分。该网页是来自 imdb 的电影列表(http://www.imdb.com/search/title?title=spiderman&title_type=feature),这里的每个部分都表示一部电影。我尝试了正则表达式

<tr class=".+">(.+\n)+</tr>

但是,它不起作用。另外,我不允许使用 DOM。有没有人有什么建议?谢谢!

【问题讨论】:

  • 为什么不允许使用 DOM?

标签: regex html-parsing


【解决方案1】:

我强烈建议您使用适当的解析器。但这是您的案例的正则表达式。

<tr class="(.+)">([\s\S]+?)</tr>

【讨论】:

  • 谢谢你,伙计!这个解决方案太棒了!我不能使用解析器,因为它是一个学校项目,教授要我们练习正则表达式。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2011-05-15
  • 1970-01-01
  • 1970-01-01
  • 2020-11-06
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多