【发布时间】:2020-08-22 21:46:53
【问题描述】:
我正在从表格中抓取图像 url 和文本,我想知道如何为缺少图像的单元格收集任何内容(或至少没有 url)。我不想删除任何行,因为我想按原样复制表格。这是an example 的表格,其中缺少图像和右侧的 html。
我在谷歌表格中使用以下内容:
=importxml(D1,"//div[@class='colsx immagine']/img/@src")
=importxml(D1,"//div[@class='coldx domanda']")
如果图像都在那里(如page),则可以很好地获取每行的图像url和文本。但是,如果缺少任何图像,那么我会为下表中的(错误)图像收集一个 url。如果没有 img url,我想跳过 url 收集。
我刚开始学习 xpath,我怀疑我需要使用 | 或 not 来解决此问题,但需要一些帮助,因为我尝试过的任何方法都不起作用。
谢谢
【问题讨论】:
-
当您说您不想删除行时,您的意思是您希望
IMPORTXML在找不到相应图像时追加空单元格? -
@Iamblichus 是的,就是这样。关键是允许将元素与类似导入的其他表格列对齐,而不管表格单元格内容是否存在。 “......按原样复制表格”。我猜有一些我还不熟悉的简单 xpath 命令
-
我不确定这是
IMPORTXML的预期行为(如果当前元素不存在此 URL,我认为它不应该提供与下面的图像对应的 URL )。我建议您通过在编辑器中选择Help > Report a problem来报告此问题。
标签: xpath google-sheets google-sheets-importxml