【发布时间】:2018-01-13 05:41:39
【问题描述】:
网站内建有内部 HTML
美汤不提取嵌入的 HTML 代码。
我需要用 class= qwjRop 提取 div 元素
例如无法从 div 标签中提取“在这个价格上不错”
import requests
from bs4 import BeautifulSoup
url="https://www.flipkart.com/hp-pentium-quad-core-4-gb-1-tb-hdd-dos-15-be010tu-notebook/product-reviews/itmeprzhy4hs4akv?page1&pid=COMEPRZBAPXN2SNF"
def clawler(in_url):
source_code = requests.get(in_url)
plain_text = source_code.text
soup = BeautifulSoup(plain_text, "html.parser")
for name in soup.findAll('div',{'class':'qwjRop'}):
print(name.prettify())
【问题讨论】:
-
您能给我们一个您在解析时遇到问题的 HTML 示例吗? “嵌入式 HTML 代码”到底是什么意思?你是说 iframe 吗?
-
编辑了完整的代码,请查看...
标签: python-3.x beautifulsoup web-crawler