【问题标题】:Python Selenium - Get everything and write to filePython Selenium - 获取所有内容并写入文件
【发布时间】:2019-07-22 11:02:37
【问题描述】:

这里的菜鸟刚刚设法被远程服务器主动拒绝。我怀疑有太多的连接尝试。 ..真的,我不应该每次想尝试一些新代码时都尝试连接,所以这让我想到了这个问题: 那么,我怎样才能从页面上抓取所有内容,并将其保存到文件中...然后离线加载文件以搜索我需要的字段。

当我被拒绝时,我正在测试下面的代码,所以我不知道什么有效 - 下面可能有错别字:/ 任何人都可以提供任何建议或改进。

print ("Get CSS elements from page")
parent_elements_css = driver.find_elements_by_css_selector("*")
driver.quit()

print ("Saving Parent_Elements to CSV")
with open('ReadingEggs_BookReviews_Dump.csv', 'w') as file:
    file.write(parent_elements_css)

print ("Open CSV to Parents_Elements")
with open('ReadingEggs_BookReviews_Dump.csv', 'r') as file:
    parent_elements_css = file

print ("Find the children of the Parent")
# Print stuff to screen to quickly find the css_selector 'codes'
# A bit brute force ish 
for css in parent_elements_css:
    print (css.text)
child_elements_span     = parent_element.find_element_by_css_selector("span")
child_elements_class    = parent_element.find_element_by_css_selector("class")
child_elements_table    = parent_element.find_element_by_css_selector("table")
child_elements_tr       = parent_element.find_element_by_css_selector("tr")
child_elements_td       = parent_element.find_element_by_css_selector("td")

这些其他页面看起来很有趣:

python selenium xpath/css selector

Get all child elements

Locating Elements

xpath-partial-match-tr-id-with-python-selenium(啊,因为我问过这个:D..但是 Sers 的回答很棒)

我以前的文件保存是使用字典和 json...但由于此错误,我无法在上面使用它:“TypeError:WebElement 类型的对象不是 JSON 可序列化的”。在此之前我没有保存文件。

【问题讨论】:

  • 为什么不简单的请求 HTML 并保存呢?
  • 您正在寻找将 HTML 源代码保存到文件中?
  • @ozlevka @ Govind Parashar。啊,我不知道这是可能的。我对网页一无所知。如何从页面中获取所有 HTML? PS。我意识到我可以抓取另一个页面/站点来测试我的代码。我明天再试一次;)

标签: python selenium xpath css-selectors


【解决方案1】:

您可以通过driver.page_source获取整个页面的html。然后,您可以使用漂亮的汤从 html 中读取内容

from bs4 import BeautifulSoup
# navigate to page
html_doc = driver.page_source
soup = BeautifulSoup(html_doc, 'html.parser')
child_elements_span = soup.find_all('span')
child_elements_table = soup.find_all('table')

这是通过 BeautifulSoup https://www.crummy.com/software/BeautifulSoup/bs4/doc/ 解析 html 的好文档

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2023-04-04
    • 2023-04-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多