【发布时间】:2015-12-28 15:54:13
【问题描述】:
# my scraper script file
#-*- coding: utf-8 -*-
from selenium import webdriver
import csv
browser = webdriver.Firefox()
browser.get("http://web.com")
f = open("result.csv", 'w')
writer = csv.writer(f)
然后是第一种方法
element = browser.find_element_by_xpath("xpath_addr")
temp = [element.get_attribute("innerHTML").encode("utf-8")]
print temp # ['\xec\x84\something\xa8']
writer.writerow(temp)
这会生成带有我的语言的正确 csv 文件。(例如한글)
但是第二种情况,我觉得有点不同
element = browser.find_element_by_xpath("xpath_addr")
temp = element.get_attribute("innerHTML").encode("utf-8")
print temp # "한글"
writer.writerow(temp)
那么 csv 文件充满了非字符的东西。是什么造成了这种差异? print 也得到不同的结果,但为什么呢? (一定是我对编码知之甚少的问题)
【问题讨论】: