【发布时间】:2013-02-10 09:09:10
【问题描述】:
我正在尝试编写一个小的 bash 脚本:
- -wget 每隔 [x] 分钟从 Web 获取一个 html 文件
- - 使用一些 linux 实用程序来查找最近两次更新之间的文件差异
- - 使用 sed 修改检测到新文本的行
我遇到的问题是 HTML 文件使用内联 CSS 格式化表格,但页面的实际代码存储在一长行中。
实际上我需要一个可以扫描单行代码的 Linux 实用程序,找到 每个标签之间的每个文本实例,并将这些实例插入它们自己的行。这应该使扫描文本更容易。我尝试过的每个工具都以每行为基础进行搜索,但由于整个代码都存储在一行中,因此无法满足我的需求。
【问题讨论】: