【发布时间】:2020-06-02 01:37:49
【问题描述】:
我正在使用 bs4 从 HTML 中提取多语言表格并将其保存为 csv。 但是无论我用 encoding=utf-8 做什么,我得到一个 BOM 写入的 csv 文件的结果是一样的。 在抓取和保存 HTML 时,是否有任何简单的方法可以使用简单的选项来更改它? (我把 utf-8 改成了 euc-** 选项,因为目标网站是用多国语言编写的,但它是徒劳的)
soup=bs(res.text,'html.parser',from_encoding='utf8')
resultset = soup.find('table',class_="type_12345")
print(resultset)
records=[]
for tr in resultset.find_all('tr'):
tds = tr.find_all('td')
#url = tds[2].a.get('href')
records.append([elem.text.encode('utf8') for elem in tds])
with open('whystillBOM.csv', 'a',encoding="utf-8-sig") as f:
writer = csv.writer(f)
writer.writerows(records)
【问题讨论】:
标签: python csv web-scraping utf-8 beautifulsoup