【发布时间】:2015-11-23 10:58:37
【问题描述】:
我在导入一些 CSV/TXT 文件时遇到问题。
在公司,我们从其他来源(公司)接收文件。其中一些文件有时会部分损坏。
例如,一个包含 6 列(id、name、city、state、zipCode、phone)和 200 万行的文件。该文件的前 10.000 行是可以的。但是在文件的中间而不是 6 列,它有 5 甚至 7 列。
似乎有人将几个文件“合并”到这个文件中,并且没有注意列数。因此,当我将其导入 MySql 数据库表时,由于列被破坏,数据变得非常混乱。邮政编码记录显示在字段状态等上。
我想知道如何在将此类文件导入我的数据库之前对其进行扫描,例如计算“;”每行的分隔符。是否会使用正则表达式来完成,或者最好的选择是什么?
我的程序是用 Lazarus/Pascal 编写的。
【问题讨论】: