【问题标题】:Is there any way to Read BeautifulSoup output with pandas to read Tables?有没有办法用熊猫读取 BeautifulSoup 输出来读取表格?
【发布时间】:2020-02-18 18:46:16
【问题描述】:

我试过这种方式

data = web_soup.findAll("table", {"id": "product-review-table"})```
print(pd.read_html(data))

错误返回: TypeError:无法读取“ResultSet”类型的对象

数据包含一个完整的表格。我只想从 Url 读取特定表,通过将 url 传递给 pd.read_html() 它将获取所有表,但为了节省执行时间我只想读取特定表。我该怎么做?

【问题讨论】:

  • 我已经得到了答案,以上提供的信息足以让任何专业人士理解。看到接受的答案,他有没有通过描述我的问题遇到任何问题?
  • 我已经得到了答案 那又怎样? 以上提供的信息足以让任何专业人士理解该标准何时取代了帮助中心和元数据中定义的标准?唯一的优点是这个问题是微不足道的,实际上相同的问题之前已经在这里讨论过很多次了。

标签: python-3.x pandas beautifulsoup


【解决方案1】:

简答

pd.read_html(str(data))

更长的答案

read_html() 的输入可以是字符串。

来自文档:

pandas.read_html(io, ..):
... 
io : str or file-like
    A URL, a file-like object, or a raw string containing HTML...

...

findAll(或find_all)的输出是一个ResultSet 对象。

ResultSet对象的字符串表示可以使用str(ResultSetObject)获取。

data = web_soup.findAll("table", {"id": "product-review-table"})
print(pd.read_html(str(data)))

【讨论】:

    猜你喜欢
    • 2015-05-30
    • 2019-10-09
    • 1970-01-01
    • 2021-04-28
    • 1970-01-01
    相关资源
    最近更新 更多