【发布时间】:2015-09-02 16:03:45
【问题描述】:
我是 python 新手,我正在尝试让一个脚本与 urllib 和 BeautifulSoup4 一起工作,以收集可通过 emojitracker API 流式传输的推文。它将特定表情符号的推文输出为 .json 文件。一个例子是这个链接(在 chrome 中打开): http://emojitracker.com/api/details/1F52B
我可以从 .json 中获取所有文本,但我只想获取推文(在“文本:”之后)。我环顾四周,有一个示例可以使用 soup.findAll("a",class_="classname") 获取页面上的所有链接。
我使用了检查元素,发现我需要的推文存储为:(span class="type-string")tweet go here(/span)。所以我尝试了以下方法:
from bs4 import BeautifulSoup
import urllib.request
url = "http://emojitracker.com/api/details/1F52B"
page = urllib.request.urlopen(url)
soup = BeautifulSoup(page.read(),"html.parser")
tweets = soup.findAll("span", class_"type-string")
for tweet in tweets:
print (tweet.string)
运行,它没有打印任何东西。我怎样才能让它只打印出推文?
【问题讨论】:
-
soup.findAll("span", class_"type-string")看起来不像是有效的语法。你确定你不是指soup.findAll('span', attrs={'class': 'type-string'})? -
我也试过了,但还是没有打印出来。