【发布时间】:2011-04-04 06:32:19
【问题描述】:
我是 Python 新手,我一直在尝试使用已用 BeautifulSoup 解析的正则表达式搜索 html。我没有取得任何成功,我认为原因是我不完全了解如何正确设置正则表达式。我看过关于类似问题的旧问题,但我仍然没有弄清楚。如果有人可以提取“/torrent/32726/0/”和“Slackware Linux 13.0 [x86 DVD ISO]”以及正则表达式如何工作的详细表达,那将非常有帮助。
<td class="name">
<a href="/torrent/32726/0/">
Slackware Linux 13.0 [x86 DVD ISO]
</a>
</td>
编辑:我的意思是,我正在尝试使用 BeautifulSoups 函数提取“/torrent/32726/0/”和“Slackware Linux 13.0 [x86 DVD ISO]”来搜索解析树。在搜索和阅读文档后,我一直在尝试各种事情,但我仍然不确定如何去做。
【问题讨论】:
-
现在他们使用解析器并且仍然想使用正则表达式o.O 你想要什么,提取带有以
/torrent/开头的href 的锚的内容?您必须遍历解析树。您可以使用正则表达式来判断当前节点是否是您想要的,但您必须遍历解析器构建的树。 -
我想我使用了错误的术语。你是对的,我想把 BeautifulSoup 生成的那个解析树,我想提取“/torrent/32726/0/”和“Slackware Linux 13.0 [x86 DVD ISO]”并将它们存储在他们自己的字典中。跨度>