【发布时间】:2011-12-31 11:35:26
【问题描述】:
我这辈子都不知道如何使用 TextPipe 完成这项任务。
任务:
提取(剪切)此文本包括开始和结束标记,并得到一个仅包含这些标记和中间文本的文件。
<div><div class="article">`TEXT`<span id="contentBottomLeft"></span>
我定义了一个带有结束和开始标记的限制过滤器,但接下来是什么?这个过滤器需要一个子过滤器,我不明白接下来我需要使用什么确切的过滤器以及如何自定义它。我需要对数千个 HTML 文件重复此提取过程。
非常感谢 TextPipe 的步骤,因为我自己并不是一个程序员。
【问题讨论】:
-
好吧,'谢谢'你没有回答。我知道 HTML,但这就是它在原始 HTML 文件中的显示方式,此外我还需要一些唯一标识符来提取特定的文本。
-
你是说文件已经不平衡了,需要去掉两个虚假的开始标签?我是说我一开始不明白它的相关性;这是对一系列大量下载的 HTML 文件执行的操作,这恰好是我需要的 HTML 文件中的一段文本的唯一起点。为了确保这一点,我包含了“原样”的标签。对于我的目的,双 div 无关紧要。我需要做的就是删除第一个标签之前和最后一个标签之后的所有文本,从而保持上面的字符串与中间的唯一文本。啊啊!因此,“提取(剪切)”是指您希望仅保留出现在该上下文中的文本和标签?完全正确:) 然后在其他一千个文件上运行脚本。
标签: html text tags extraction