【发布时间】:2016-03-15 08:33:49
【问题描述】:
我通过连接到某些 API 的脚本创建了超过 500 000 个 JSON 文档。我想将这些文件导入RethinkDB,但RethinkDB似乎无法大量导入文件,所以我考虑将所有这些文件合并成一个大的JSON文件(比如bigfile.json)。这是它们的结构:
文件 1.json:
{
"key_1": "value_1.1",
"key_2": "value_1.2",
"key_3": "value_1.3",
...
"key_n": "value_1.n"
}
文件 2.json:
{
"key_1": "value_2.1",
"key_2": "value_2.2",
"key_3": "value_2.3",
...
"key_n": "value_2.n"
}
...
文件 n.json:
{
"key_1": "value_n.1",
"key_2": "value_n.2",
"key_3": "value_n.3",
...
"key_n": "value_n.n"
}
我想知道哪个是创建大 JSON 文件的最佳结构(完整地说,每个文件都有一个由 3 个变量组成的特定名称,第一个是时间戳 (YYYYMMDDHHMMSS)),以及哪个命令或脚本(直到现在我只为 bash 编写脚本......)可以让我产生合并。
【问题讨论】:
-
输出文件应该是什么样子?文件名与它有什么关系 - 为什么这很重要?它出现在文件中还是应该出现在文件中?
-
输出将是一个大的 json 文件。我想到了一些看起来像 {"bigfile":[file_1,file_2,...,file_n]} 的东西,但我不知道它是否是大文件的最佳结构(输出将超过 1 giga)。文件名没有出现在文件中,但我想也许我应该让它们出现在大文件中,因为它们部分描述了输入文件。
-
你帮不上什么忙。
yes > file.json生成一个很大的 JSON 文件。 -
好的,抱歉,我编辑了帖子。我认为这很清楚,因为 Rethink 只处理 JSON,并且我想知道“创建大型 JSON 文件的最佳结构”
-
你看
rethinkdb import了吗? rethinkdb.com/docs/importing
标签: json bash rethinkdb bigdata