【发布时间】:2016-11-05 17:46:20
【问题描述】:
我尝试解析针对特定主题(如公司或产品)发布的 Facebook 帖子。作为示例帖子来自这里https://www.facebook.com/search/latest/?q=facebook
我可以正确登录 facebook(使用 python),并且我还可以获取包含我正在寻找的帖子的页面的源代码。经过一些手动代码审查后,我发现我想获得以下信息:
<div class="_5pbx userContent" data-ft="{"tn":"K"}">
<p>Here is the text of the post I need
</p>
</div>
所以我从 beautifulsoup 和以下代码开始:
soup = BeautifulSoup(pageSourceCode.content, 'html.parser')
for msg in soup.find_all('div'):
print (msg.get('class')
结果我只得到了这个......
[u'hidden_elem']
有人有抓取 Facebook 帖子的经验吗?我只需要这个用于我自己和教育目的
【问题讨论】:
-
此外,为了测试目的,我尝试执行以下操作“print soup.find_all('p')”,它只打印以下结果“[]”
标签: python facebook web-scraping beautifulsoup