【发布时间】:2012-09-27 01:56:36
【问题描述】:
我正在寻找一种实用的方法来处理 Talend 中的批处理 ETL 作业的架构略有不同的多个文件之间的元数据规范化。
我有几百个历史报告(每个记录大约 25K 到 200K 条记录),每个 Excel 文件大约有 100 到 150 列。所有文件的大多数列名都相同(98% 重叠),但存在细微的邪恶差异:
- 不同的列顺序
- 不同的列名(有时使用有时不使用缩写)
- 不同的列数
- 有时列在单词之间有空格,有时还有点、破折号或下划线
- 等
除了编写专门的应用程序或通过手动更正它们来强制所有文件,是否有任何好的免费工具或方法可以智能或半自动方式提供文件列名之间的差异和更正?
【问题讨论】:
标签: java excel etl normalize talend