【发布时间】:2014-07-10 08:36:53
【问题描述】:
我使用 urllib2 抓取了谷歌搜索结果页面数据并将其写入文件。但是当我在浏览器中打开解析的 html 文件时,我得到了一些 utf-8 字符。
这是我在 python 中用于 htmlparse 的代码。
import os
import urllib2
import webbrowser
url = 'https://www.google.co.in/search?q=lcd+tv'
hdr = {'User-Agent': 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.11
(KHTML, like Gecko) Chrome/23.0.1271.64 Safari/537.11'}
req = urllib2.Request(url, headers=hdr)
response = urllib2.urlopen(req)
f = response.read()
file = open('file.html','w+')
file.write(f)
file.close()
这是解析后的页面截图。
我们可以在标题上的某些地方看到 ‎ 和 Â。甚至广告图片都没有加载:( .
我怎样才能删除那些 unicode ?
提前致谢。
【问题讨论】:
标签: python unicode utf-8 urllib2 codec