如果要在 Power BI 中执行此操作,则应使用 Web.Contents 函数来抓取网页。
这是一个从维基百科页面获取 html 并对其进行解析的简单查询:
let
Source = Web.Contents("https://en.wikipedia.org/wiki/Geography_of_United_States"),
Data = Json.Document(Source)
in
Data
然后,您可以使用 Power BI 的 Parsed HTML 功能来解析 HTML 并创建数据集。
如果您想使用 Python 来执行此操作,您应该使用 pandas 库将数据加载到 DataFrame 中,然后使用 to_csv() 函数将数据写入 CSV 文件。
import requests
from bs4 import BeautifulSoup
import pandas as pd
url = "https://en.wikipedia.org/wiki/Geography_of_United_States"
soup = BeautifulSoup(requests.get(url).content, "html.parser")
continent = soup.select_one("th:-soup-contains(Continent) + td").text
print(continent)
df = pd.DataFrame([continent])
df.to_csv("continent.csv", index=False, header=False)
如果要在 R 中执行此操作,则应使用 rvest 库来解析 HTML,然后使用 readr 库将数据读入数据框。
library(rvest)
library(readr)
url <- "https://en.wikipedia.org/wiki/Geography_of_United_States"
html <- read_html(url)
continent <- html_nodes(html, "th:-soup-contains(Continent) + td") %>% html_text()
df <- data.frame(continent)
write_csv(df, "continent.csv")