【发布时间】:2014-05-18 00:59:42
【问题描述】:
我正在尝试将在线论坛中的所有超链接网址保存为 CSV 文件,以用于研究项目。
当我“打印”html 抓取结果时,它似乎工作正常,因为它打印了我想要的所有 url,但我无法将这些写入 CSV 中的单独行。
我显然做错了什么,但我不知道是什么!因此,我们将不胜感激任何帮助。
这是我写的代码:
import urllib2
from bs4 import BeautifulSoup
import csv
import re
soup = BeautifulSoup(urllib2.urlopen('http://forum.sex141.com/eforum/forumdisplay.php? fid=28&page=5').read())
urls = []
for url in soup.find_all('a', href=re.compile('viewthread.php')):
print url['href']
csvfile = open('Ss141.csv', 'wb')
writer = csv.writer(csvfile)
for url in zip(urls):
writer.writerow([url])
csvfile.close()
【问题讨论】:
标签: python-2.7 csv web-scraping beautifulsoup