【发布时间】:2015-05-09 06:42:56
【问题描述】:
所以我有漂亮的汤代码,可以访问网站的主页 并刮掉那里的链接。但是,当我在 python 中获取链接时,我似乎无法清理链接(在将其转换为字符串之后)以与根 url 连接。
import re
import requests
import bs4
list1=[]
def get_links():
regex3= re.compile('/[a-z\-]+/[a-z\-]+')
response = requests.get('http://noisetrade.com')
soup = bs4.BeautifulSoup(response.text)
links= soup.select('div.grid_info a[href]')
for link in links:
lk= link.get('href')
prtLk= regex3.findall(lk)
list1.append(prtLk)
def visit_pages():
url1=str(list1[1])
print(url)
get_links()
visit_pages()
产生输出:“['/stevevantinemusic/unsolicited-material']”
期望的输出:“/stevevantinemusic/unsolicited-material”
我已经尝试过 .strip() 和 .replace() 以及 re.sub/match/etc。 . .我似乎无法隔离我需要删除的字符 '[,\',]',我已经使用子字符串对其进行了迭代,但这感觉效率低下。我确定我遗漏了一些明显的东西。
【问题讨论】:
标签: python regex web-scraping beautifulsoup python-requests