【发布时间】:2017-10-06 15:19:06
【问题描述】:
我正在尝试向网站发送关键字,但不知道如何进行。
我想从网页中提取所有带有<li> 标签的项目。所以我有 HTML 代码;
<H1> Some header </H1>
<text> Some noise I am not interested in </text>
<li> some text here </li>
<li> some more text here </li>
<li> even more text here </li>
<text> Some more noice I am also not interested in </text>
所以我只对列表<li></li>的项目感兴趣
有人可以为我指出正确的方向吗?
或者,我使用了 readLines 函数并将网页保存为 data_frame,因此我正在考虑尝试在不使用 <li> 命令的情况下删除所有行。
任何想法
【问题讨论】:
-
我喜欢 Python 和 Beautiful Soup 模块
-
你只要连接到网页,然后
soup.find_all('li')返回所有li元素 -
谢谢,但我忘了说我只用 R 编程!对不起,我的坏事。
-
试试
library(rvest); html <- read_html("link"); html %>% html_nodes("li") -
Python 对 R 问题的建议似乎……错了? @Mako212 Esp,因为 R 能够胜任这项任务。
标签: r web-scraping text-mining