【发布时间】:2015-08-06 04:29:01
【问题描述】:
我整晚都在寻找,但我仍然不确定如何完成这项工作。我是python新手,所以如果我问一些简单的问题,请先原谅我。
我有三千个 .html 文件(从受信任的网站下载的所有新产品描述)存储在一个文件夹中,现在我想一一清理这些文件(即只保留内容/产品描述和删除标签等),然后将每个内容存储为单个 .txt 文件。
在阅读了这里发布的一些问答之后,我认为我需要使用 lxml 包而不是漂亮的汤,因为所有 .html 文件都来自高度可信的来源。但是,我不知道应该使用 lxml 中的哪个命令/选项,请告诉我吗?
【问题讨论】:
标签: python html beautifulsoup lxml lxml.html