【问题标题】:R, scraping web with xpathSApplyR,使用 xpathSApply 抓取网页
【发布时间】:2014-02-19 00:10:43
【问题描述】:

解析一个网页后,我可以看到这样的xpath..

gethelp.df =htmlTreeParse(url, useInternalNodes = T)
gethelp.df
.
.
....
<div class="lia-message-post-date">
        <a class="lia-link-navigation" id="link_14" href="/t5/Facebook/m-p/3947664">
            <span class="DateTime">
        <span class="local-date">?06-05-2013</span>
        <span class="local-time">09:38 AM</span>
</span>
        </a>
    </div>

我想获取“06-05-2013”​​部分。

到目前为止,我尝试了这些以及其他一些方法,但都不起作用。谁能指出我在这里缺少的东西?

xpathSApply(gethelp.df, "//span[@class='local-time']", xmlGetAttr, "href")
xpathSApply(gethelp.df, "//div[@class='lia-message-post-date']/span", xmlGetAttr, "href")

谢谢!

【问题讨论】:

  • “06-05-2013”​​是一个值而不是一个属性你试过xmlValue吗?
  • 谢谢。你是对的!它是一个值而不是一个属性!

标签: r web-scraping


【解决方案1】:
xpathSApply(gethelp.df, "//span[@class='local-date']", xmlValue)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2023-03-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-09-29
    • 1970-01-01
    相关资源
    最近更新 更多