【发布时间】:2019-07-22 11:02:37
【问题描述】:
这里的菜鸟刚刚设法被远程服务器主动拒绝。我怀疑有太多的连接尝试。 ..真的,我不应该每次想尝试一些新代码时都尝试连接,所以这让我想到了这个问题: 那么,我怎样才能从页面上抓取所有内容,并将其保存到文件中...然后离线加载文件以搜索我需要的字段。
当我被拒绝时,我正在测试下面的代码,所以我不知道什么有效 - 下面可能有错别字:/ 任何人都可以提供任何建议或改进。
print ("Get CSS elements from page")
parent_elements_css = driver.find_elements_by_css_selector("*")
driver.quit()
print ("Saving Parent_Elements to CSV")
with open('ReadingEggs_BookReviews_Dump.csv', 'w') as file:
file.write(parent_elements_css)
print ("Open CSV to Parents_Elements")
with open('ReadingEggs_BookReviews_Dump.csv', 'r') as file:
parent_elements_css = file
print ("Find the children of the Parent")
# Print stuff to screen to quickly find the css_selector 'codes'
# A bit brute force ish
for css in parent_elements_css:
print (css.text)
child_elements_span = parent_element.find_element_by_css_selector("span")
child_elements_class = parent_element.find_element_by_css_selector("class")
child_elements_table = parent_element.find_element_by_css_selector("table")
child_elements_tr = parent_element.find_element_by_css_selector("tr")
child_elements_td = parent_element.find_element_by_css_selector("td")
这些其他页面看起来很有趣:
python selenium xpath/css selector
xpath-partial-match-tr-id-with-python-selenium(啊,因为我问过这个:D..但是 Sers 的回答很棒)
我以前的文件保存是使用字典和 json...但由于此错误,我无法在上面使用它:“TypeError:WebElement 类型的对象不是 JSON 可序列化的”。在此之前我没有保存文件。
【问题讨论】:
-
为什么不简单的请求 HTML 并保存呢?
-
您正在寻找将 HTML 源代码保存到文件中?
-
@ozlevka @ Govind Parashar。啊,我不知道这是可能的。我对网页一无所知。如何从页面中获取所有 HTML? PS。我意识到我可以抓取另一个页面/站点来测试我的代码。我明天再试一次;)
标签: python selenium xpath css-selectors