【发布时间】:2013-07-07 03:16:51
【问题描述】:
我是一个业余程序员,对这个网站很陌生。我已经搜索过这个问题,但在互联网或本网站的其他任何地方都没有找到。
我正在尝试抓取打开和关闭段落 html 标记之间的所有单词(<p> 和 </p>)。我的 findall 声明适用于所有段落中的所有单词,特别是在线文章,除了有单引号或双引号的地方。完全有可能有更好的方法来做我正在尝试做的事情,或者可以轻松地调整此语句以包含带引号的段落。任何建议将不胜感激!
findall 语句:
aText = findall("<p>[A-Za-z0-9<>=\"\:/\.\-,\+\?#@'<>;%&\$\*\^\(\)\[\]\{\}\|\\!_`~ ]+</p>",text)
【问题讨论】:
-
步骤 1) 在您喜欢的搜索引擎中搜索“美汤”。步骤 2) 遵循其从 HTML 元素中提取文本的清晰示例之一。没有第 3 步,它实际上是一个相当优雅的库,仅用于此目的:)
标签: regex python-3.x findall