【发布时间】:2019-12-10 14:33:58
【问题描述】:
我一直在使用 pd.read_html 尝试从 url 中提取数据,但数据列在
标签而不是 .我可能在这里错过了一个简单的课程,但我不确定使用什么函数来获得好的结果(表格)而不是我得到的长字符串。任何建议,将不胜感激! 我使用了这两种方法并得到了相同的结果:
import requests
import pandas as pd
url ='http://www.linfo.org/acronym_list.html'
dfs = pd.read_html(url, header =0)
df = pd.concat(dfs)
df
import pandas as pd
url ='http://www.linfo.org/acronym_list.html'
data = pd.read_html(url, header=0)
data[0]
输出[1]:
ABCDEFGHIJKLMNOPQRSTUVWXYZ A AMD Advanced Micro Devices API 应用程序编程接口 ARP 地址解析协议 ARPANET 高级研究计划局网络 AS 自治系统 ASCII 美国信息交换标准代码 AT&T 美国电话电报公司 ATA 先进技术附件 ATM 异步传输模式 B B 字节 BELUG Bellevue Linux 用户组 BGP 边界网关协议...
【问题讨论】:
-
你期望的结果如何?
-
我正在寻找一个表格的结果,就好像我为表格标签中的相同数据运行该脚本一样。我知道我可以将页面保存为 html 文件并编辑标签以使其正常工作,但我只是在寻找一种方法以供将来参考。
-
我正在使用 BeautifulSoup 解析请求 html 每个标签 p 和 br ,最终结果是一个数据框...稍后您可以将其导出到下面的 excel 文件中
标签: python pandas dataframe import html-parsing