【发布时间】:2019-08-15 05:45:54
【问题描述】:
我尝试使用其 URL 链接从网页中提取 cmets 的文本内容,并使用 BeautifulSoup 进行抓取。当我单击 URL 链接时,页面上可以看到 cmets 的内容,但是 BeautifulSoup 返回的 HTML 对象不包含这些标签和文本。
我使用 BeautifulSoup 和 'html.parser' 来进行网页抓取。我成功提取了给定网页中视频的点赞数/观看次数/cmets 数,但 HTML 文件中不包含评论部分的信息。我使用的浏览器是Chrome,系统是Ubuntu 18.04.1 LTS。
这是我使用的代码(在 python 中):
from urllib.request import urlopen
from bs4 import BeautifulSoup
import os
webpage_link = "https://www.airvuz.com/video/Majestic-Beast-Nanuk?id=59b2a56141ab4823e61ea901"
try:
page = urlopen(webpage_link)
except urllib.error.HTTPError as err: # webpage cannot be found
print("ERROR! %s" %(webpage_link))
soup = BeautifulSoup(page, 'html.parser')
预期的结果是汤对象包含网页上可见的所有内容,尤其是 cmets 的文本内容(例如“不在那儿,我很享受看到白熊的生活方式。感谢提供者提供这样的服务纪录片。”和“哇……太棒了……”);但是,我在汤对象中找不到相应的节点。 任何帮助将不胜感激!
【问题讨论】:
-
我已经尝试过这里的解决方案帖子:stackoverflow.com/questions/1936466/…,但它也没有工作..
标签: python web-scraping beautifulsoup data-extraction