【发布时间】:2019-06-17 17:33:04
【问题描述】:
我正在开展一个项目,以识别 Stack Overflow 问题正文中的某些文本。它有效,但对于这种情况,它不起作用。我正在寻找是否可以通过代码找到暴露的 AWS 访问密钥,以了解情况的严重性。代码如下:
headers = {'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
'Accept-Encoding': 'gzip, deflate',
'Accept-Language': 'en-US,en;q=0.5',
}
url = 'https://api.stackexchange.com/2.2/search/advanced?order=desc&sort=activity&body=' + 'AKIAIHXBFL3ATI64QPAQ' + '&site=stackoverflow'
req = urllib.request.Request(url, headers=headers)
response = urllib.request.urlopen(req)
time.sleep(3)
if response.info().get('Content-Encoding') == 'gzip':
pagedata = gzip.decompress(response.read())
elif response.info().get('Content-Encoding') == 'deflate':
pagedata = response.read()
elif response.info().get('Content-Encoding'):
print('Encoding type unknown')
else:
pagedata = response.read()
soup = BeautifulSoup(pagedata, "lxml")
print(soup)
这是来自soup的回复:
<html><body><p>{"items":[],"has_more":false,"quota_max":300,"quota_remaining":291}</p></body></html>
它返回并清空文件。如果我在 body=** 参数中搜索其他文本,它确实会以大量内容响应。是我做错了什么还是 API 无法进行特定的文本搜索?
【问题讨论】: