【发布时间】:2013-06-27 23:31:18
【问题描述】:
我正在对大量的着陆页进行比较。我正在尝试提取主标题和号召性用语,但是页面的 HTML 格式当然变化很大。
我开始寻找 H1、H2 等,假设标题标签对应于首要性,但通常情况并非如此。渲染的 font-size* 可能是一个更好的指标,但是这看起来很混乱,并且无法处理使用带有 alt 标签的图像的情况。
什么是使用 Nokogiri 识别 100 个狂野着陆页的主标题的好策略?
*Also- 是否有用于渲染字体大小的巧妙选择器?
【问题讨论】:
-
如果他们在 h1/2 中没有标题,上帝保佑他们的谷歌位置 ;)
标签: ruby xpath html-parsing nokogiri text-parsing