【问题标题】:c++ Impossible to improve file reading?c ++不可能改善文件阅读?
【发布时间】:2017-09-24 05:41:42
【问题描述】:

我有一个用 C++ 编写的代码读取一个非常大的数据文件(10-20 去)。我读了每一行,它相当长。有什么办法可以提高效率吗?

我知道有一些关于此的帖子,但我的问题并不完全相同......

该文件包含 N 个原子的坐标及其在给定时间的速度。

我的代码:

void Funct(std::string path, float TimeToRead, int nbLines, float x[], float y[], float z[], float vx[], float vy[], float vz[], std::string names[], int index[])
{
    ifstream file(path.c_str());
    if (file)
    {
        /* x,y,z are arrays like float x[nbAtoms] */

        while (time != TimetoRead) {
            /*I Put the cursor at the given time to read before*/
            /*And then read atoms coordinates*/
        }

        for (int i = 0; i < nbAtoms; i++) {
            file >> x[i]; file >> y[i]; /* etc, load all*/
        }
    }
}

int main()
{
    /*Declarations : hidden*/

    for (int TimeToRead = 0; TimeToRead<finalTime; TimeToRead++) {
        Funct(...);
        /*Do some Calculus on the atoms coordinates at one given time */
    }
}

目前我有大约 200 万行,每行有 8 或 9 列数字。 该文件是给定时间的一系列原子坐标。

我必须对每个时间步进行计算,所以我现在为每个时间步调用这个函数(大约 4000 个时间步,并且有大量的原子)。最后是非常昂贵的时间。

我读过某处我可以在内存中保存一行而不是每次都读取文件但是当文件是 20Go 时我不能真正将它全部保存在 RAM 中!

我能做些什么来提高这个阅读量?

非常感谢你

Edit1:我在 Linux 上

编辑2: 要读取的文件包含一个行标题,如:

time= 1
coordinates atom 1
coordinate atom 2
...
...
...
time=2
coordinates atom 1
coordinate atom 2
...
...
...
etc

while 循环只是从一开始就读取每一行,直到他找到 t= TimeToRead

【问题讨论】:

  • 您可以使用内存映射....使用 MapViewOfFile....然后 Windows 内存管理器在您访问它时有效地管理该数据的缓冲和缓存。 stackoverflow.com/questions/10836609/…
  • 至少你不需要每次迭代都打开文件。保持打开状态并在下一次迭代中继续阅读。虽然不会为您节省很多
  • 您似乎每次都在打开文件并遍历它作为起点。也许建立所有起点的索引会为您节省一些执行时间。如果文件包含按时间排序的数据,您还可以将上次光标位置保存为下一个起点。
  • 您的 C++ 程序不太可能使您的硬盘驱动器旋转得更快。您的性能完全受限于系统的 I/O 性能,除了获得更快的硬盘驱动器之外,绝对没有什么可以做的。或者,也许重新设计您尝试做的任何事情,以便您尝试做的任何事情都不再涉及读取 20gb 文件。
  • 文件是否按时间顺序排列?如果是这样,只需保持打开状态并跟踪上次读取的时间戳。下一个时间戳将是文件中的下一个时间戳,或者您必须跳过一些时间戳 - 重新阅读整个内容以到达同一个地方是没有意义的。或者,至少,记住你在哪里(你的最后一个偏移量)并直接在那里寻找。

标签: c++ file


【解决方案1】:

我认为有可能优化(删除)跳行代码(while (time != TimetoRead))

您在每次迭代中打开文件,然后一直跳过大量行。 如果您的文件包含 finalTime 记录,则在第一次迭代时跳过 0 条记录,在第二次迭代时跳过 1 条记录,等等。总共跳过 0+1+2+...(finalTime-1) 条记录,即 (finalTime-1) *(finalTime)/2 :-) 将其与每条记录的行数相乘,您会发现大部分时间可能会浪费在哪里。

解决方案可能是: 将文件打开操作从您的读取方法中提取到周围的代码中。这样您就可以读取一条记录,然后进行微积分,然后当您读取下一条记录时,您不必再次打开文件并跳过所有这些行,因为流将自动在正确的位置继续。

在“伪代码”中应该是这样的:

void Funct(ifstream file, ...)
{
    if (file)
    {
        /* x,y,z are arrays like float x[nbAtoms] */

        for (int i = 0; i < nbAtoms; i++) {
            file >> x[i]; file >> y[i]; /* etc, load all*/
        }
    }
}

int main()
{
    ifstream file(path.c_str());

    for (int TimeToRead = 0; TimeToRead<finalTime; TimeToRead++) {
        Funct(file, ...);
        /*Do some Calculus on the atoms coordinates at one given time */
    }
}

【讨论】:

    猜你喜欢
    • 2020-03-29
    • 1970-01-01
    • 2016-02-14
    • 1970-01-01
    • 2017-04-20
    • 2019-10-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多