【发布时间】:2013-06-11 12:33:49
【问题描述】:
问题:漂亮的汤对象似乎从 HTML 中删除了有价值的信息。为什么要这样做,我该如何提取这个字段?
示例:我感兴趣的原始 HTML 表达了这一点:
<div id="KittyChow">
<h4 class="noteText">foodAmount</h4>
<span>< 1 tsp</span>
</div>
然而,当我创建我的汤对象时,相应的 HTML 行变为:
<div id="KittyChow"><h4 class="noteText">foodAmount</h4><span></span></div>
我的问题和疑问:为什么它删除了span和/span之间的信息?是不是因为“小于/
第二:如何提取这个
import re
string= "The cat is obese."
left= "The"
right= "is obese."
pattern= re.compile(left + "(.*?)" + right)
answer= pattern.findall(string)[0]
print answer
问题是,当我用 HTML 替换左右匹配字符串时,我收到“索引超出范围”错误,因为将 HTML 转换为字符串时会出现空格和缩进。
如您所知...我已经进行了相当多的研究,但我仍然坚持使用 BeautifulSoup 和 Python 的正则表达式模块在 HTML 标记的字段/属性中提取 符号。请帮我? :)
【问题讨论】:
标签: python regex beautifulsoup