【发布时间】:2021-03-28 23:22:45
【问题描述】:
我正在抓取一个中文网站,通常解析中文字符是没有问题的,我用 bs4 中的模式函数来查找特定的 url。 但是,对于这个特定的中文网站,无法正确解析汤。 下面是我用来设置汤的代码:
start = f'http://www.shuichan.cc/news_list.asp?action=&c_id=93&s_id=210&page={1}'
r = requests.get(start)
soup = bs(r.content, "html.parser")
打印汤的一个例子如下:
注意:我必须将图片添加为堆栈,尽管它是垃圾邮件:)
以上内容应如下所示:
我想知道我是否必须在请求中指定某种编码,或者在汤中指定某种编码,但目前我还没有找到任何可行的方法。
提前致谢!
【问题讨论】:
标签: python web-scraping beautifulsoup request