【发布时间】:2014-10-31 21:38:35
【问题描述】:
我有一个库,第三方开发人员可以使用该库从一些特定网站获取信息。该库负责连接到网站、抓取页面、解析必要的信息并将其返回给开发人员。
但是,我在想出一种可接受的方式来处理存储可能格式不正确的HTML 时遇到了问题。由于我在测试时只能考虑这么多事情,因此将来解析可能会失败,如果我能找到一种方法来存储解析失败的HTML 以供将来修复错误,那将很有帮助。
现在我正在使用 Python 的内部日志记录模块来处理我的库中的日志记录。我允许第三方开发人员提供配置字典来配置日志记录输出错误数据的方式。但是,将HTML 打印到控制台甚至文件对我来说并不理想,因为我认为这会使终端或错误日志变得混乱。我考虑将HTML 文件存储在本地硬盘上,但这似乎非常麻烦。
我已确定如何在内部传递HTML。我的计划是通过异常的参数传递它,然后用过滤器捕获它。但是,如何处理它真的很困扰我。
感谢任何有关实现此目的的方法的反馈。
【问题讨论】: