【发布时间】:2016-05-23 07:19:35
【问题描述】:
import requests
from bs4 import BeautifulSoup
r = requests.get("http://www.forever21.com/IN/Product/Category.aspx? br=f21&category=top&pagesize=100&page=1")
soup = BeautifulSoup(r.content, "html.parser")
links = soup.find_all('a', href=True)
for link in links:
if "BR=LOVE" in str(link):
link = str(link)
result = link[9:124]
#if "VariantID=" in result:
print((result))
上面的代码返回一个来自forever21.com 的链接列表。但问题在于:
http://www.forever21.com/IN/Product/Product.aspx?BR=LOVE21&Category=top&ProductID=2000183855&VariantID=
返回
http://www.forever21.com/IN/Product/Product.aspx?BR=LOVE21&:Category=top&:ProductID=2000183855&:VariantID=
请注意,它会在每个链接中自动将 & 替换为 &amp:。不知道为什么。
请告诉我为什么会这样?
【问题讨论】:
-
您确定是
&amp:而不是&(带有分号)?