【发布时间】:2018-06-04 09:06:53
【问题描述】:
我有一个列表,其中包含大约 2000 个不同语言和不同布局的博客。我有两个任务:识别死链接和识别超过 90 天未更新的博客。虽然第一个任务很简单,但第二个任务让我很头疼。
例子:
https://www.adamsmith.org/blog
http://allfinancialmatters.com/(这个90多天没更新了)
我试过了:
- 使用正则表达式提取年份以及前 10 个字符和 10 个字符 之后尝试解析使用 dateparser - 并没有真正起作用
- 使用 javascript:alert(document.lastModified) - 它不适用于动态生成的网站
- 使用 Wayback 机器 - 太不准确了
有人知道如何处理这项任务吗?
我正在使用 Python。
【问题讨论】:
标签: python python-3.x web-scraping internationalization