【发布时间】:2020-09-23 19:17:09
【问题描述】:
我有这个大文件名 Objects_Population - AllCells.txt 大约 3GB,该文件有 25704373 行和 132 个变量。我想读取文件并根据一个变量拆分行,该变量是名为treatmentsum 的列。在本专栏中,我有不同条件(3S 或 UNS)下的实验性药物治疗,即用“_”链接的字符串。因此拆分会将所有具有相同处理的行放在一起。拆分文件后,我想写出拆分文件并使用处理和给出文件名。
我的代码如下:
#load libraries
library(tidyverse)
library(vroom)
library(dplyr)
library(stringr)
#read in the file, skip the first 9 rows
files<-vroom("Objects_Population - AllCells.txt", delim = "\t",skip = 9,col_names = T)
#split the files based on treatmentsum
splited<- files %>%
group_split(files$treatmentsum)
#write out the splitted files
output<- lapply(splited, function(i){
for (i in 1:length(splited)) {
write.table(splited[[i]][,1:131],file=paste(unique(splited[[i]]$treatmentsum),".txt"), sep="\t", row.names=FALSE)
}
})
因此,当我运行它时,文件读取正确,并且拆分工作正常并且处理按预期吐出,即我得到一个 1092 的列表(显示在环境中),每个列表都包含具有相同处理的行.然而,代码每次写给我 233 个文件后都会死掉。我已经截图了错误,生成的所有文件都是3S,没有生成UNS文件(在右下角文件目录截图中可以看到)。有人可以帮我解决这个问题并让我知道错误的含义吗?
【问题讨论】:
-
尝试在循环中打印出
paste(unique(splited[[i]]$treatmentsum),".txt")的值。您确定每次都提供有效的文件名吗?没有任何形式的reproducible example 很难提供帮助 -
@MrFlick 嗨,对于草率的工作感到抱歉。我不知道如何呈现完整文件,因为最小/采样可能没有涵盖问题。我正在尝试对文件进行子采样,看看是否可行。我按照您的建议打印了名称,按预期打印了 1092 个不同的名称。
-
@MrFlick 仍然无法正常工作。嗯,可以直接给你发消息或者给你发送一个子采样文件来测试吗?
-
@MrFlick 实际上我想我明白了,听我说完。新的 txt 文件名包含“/”(感谢生物学),从我阅读的内容来看,这可能会导致写入时出现问题。所以我 gsub 了 /,它现在正在写入超过 233 个文件。
标签: r file-writing filesplitting txt