【发布时间】:2010-10-28 19:07:00
【问题描述】:
我有一组半常规格式的文档。行通常用换行符分隔,每行的主要组成部分用空格分隔。一些示例是一组家具组装说明、一组目录、一组食谱和一组银行对账单。
问题是每个集合中的每个样本都与其对等成员不同,这使得正则表达式解析不可行:一个项目的数量可能在项目名称之前或之后,相同的项目在样本之间可能有不同的名称,说明文本或注释可能存在于行之间等。
我使用分类器(神经网络、贝叶斯、GA 和 GP)来处理整个文档或数据集,但没有从文档中提取项目并在上下文中对其进行分类。这可以做到吗?有没有更可行的方法?
【问题讨论】:
标签: parsing classification data-analysis