【问题标题】:Extract value from scraped webpage从抓取的网页中提取价值
【发布时间】:2012-01-19 03:21:00
【问题描述】:

第一次尝试使用 python,在 google 了一天之后,我的老大脑更加难住了。

我使用 pycurl 通过 ntlm 代理和抓取页面记录,然后使用 beautifulsoup 美化结果。

我想从美化输出中提取 3 个值并将它们存储为变量。该页面是动态生成的,因此它们在页面上的位置不断变化。这 3 个标签在页面上只出现一次,并且它们的位置相对于它们各自的值是恒定的。

如何从美化输出中提取 Value1、Value2 和 Value3 并将它们存储为变量。

这3个oneliners是我在python中需要做的。

grep -A 3 "Label1" prettify.txt | tail -n 1 |awk '{打印 $1}'

grep "Label2" prettify.txt | awk '{打印 $3}'

grep -B 4 "Label3" prettify.txt | awk '{print $1}' RS=[ FS=] |尾 -n 1

提取 1

   <b>
    <font color="Red">
     Label1
    </font>
    <font color="blue">
     Value1
    </font>
   </b>
   <br />
   Label2: Value2
   <br />

提取 2

    <li>
     <font color="green">
      [value3]
     </font>
     <font color="red">
      Label3
     </font>
    </li>

【问题讨论】:

  • 有什么问题?你试过什么代码?什么不起作用?
  • 问题:如何从美化输出中提取 Value1、Value2 和 Value3 并将它们存储为变量。
  • 提示:更新问题是预期。该评论没有帮助,因为它只是重复了问题。

标签: python beautifulsoup scraper


【解决方案1】:

我在卷曲页面之前进行了一些骇人听闻的编码,然后在元组中使用了 find 函数,以便从其余内容中删除数据。 如:

resultant_value = result[result.find(beginning_location):result.find(ending_location)]

变量beginning_locationending_location 可以是值的开头和结尾的某些唯一指示符,以便将其剥离并放入变量resultant_value。希望我的 hackish 方法能在某种程度上有所帮助!

【讨论】:

  • 谢谢,看看我能不能让它工作。首先去编程,所以阅读很多东西收效甚微。
  • 祝你好运!如果您需要帮助,请向我发送电子邮件 sbrichards [at] mit.edu,我会尽力帮助您:)
猜你喜欢
  • 1970-01-01
  • 2018-01-14
  • 1970-01-01
  • 1970-01-01
  • 2019-08-06
  • 1970-01-01
  • 2019-12-06
  • 1970-01-01
  • 2020-06-18
相关资源
最近更新 更多