【问题标题】:Parsing multiple News articles解析多篇新闻文章
【发布时间】:2014-05-04 09:13:22
【问题描述】:

我已经构建了一个摘要程序,该程序利用解析器一次解析多个网站。我在每篇文章中只提取<p>。

这会抛出很多与文章无关的随机内容。我见过几个可以完美解析任何文章的人。我该怎么做?我正在使用美丽的汤

【问题讨论】:

  • 内容不必在p 标签中,那么您为什么希望它起作用呢?也许您可以参考您尝试定位的网站?
  • 您的问题措辞不当。请重新阅读并编辑您的问题。

标签: python parsing html-parsing beautifulsoup


【解决方案1】:

可能值得您尝试像python-goose 这样的现有软件包,它可以满足您的要求,从网页中提取文章内容。

【讨论】:

    【解决方案2】:

    您的解决方案实际上将针对您要抓取的每个网站页面,因此,在不知道感兴趣的网站的情况下,我唯一真正建议的是检查您要抓取的每个页面的页面源并查看文章是否包含在具有特定属性(唯一的类、id 甚至摘要属性)的某个 html 元素中,然后使用漂亮的汤从该元素中获取内部 html 文本

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-10-03
      • 2014-05-09
      • 2020-09-05
      • 1970-01-01
      • 2016-08-31
      • 1970-01-01
      相关资源
      最近更新 更多