【发布时间】:2018-08-30 16:20:33
【问题描述】:
我正在通过 lxml xpath 从网站检索一些日期:
page = requests.get(url)
tree = html.fromstring(page.content)
titles_arr = tree.xpath("//span[@class='lister-item-header']/span/a/text()")
有些标题有德语变音符号(例如üöä),所以我想像这样对返回的文本进行编码:
for title in titles_arr:
title = title.encode('utf-8')
但它仍然由 Der Herr der Ringe - Die R\u00fcckkehr des K\u00f6nigs 之类的而不是它们各自的 unicode 字符组成。我做错了什么?
谢谢
【问题讨论】:
-
对我来说,似乎不清楚
tree和xpath是什么。它是什么图书馆?似乎有几个库具有xpath方法...不是 minimal reproducible example。 -
@AndreyTyukin 使用 lxml
-
您究竟是如何获得该输出的……?
-
@deceze 请求模块