【发布时间】:2019-12-03 04:25:43
【问题描述】:
我正在尝试写入存储在本地文件系统上的现有 Parquet 文件。但是当多次写入时,前一个会被覆盖而不是被添加。
from datetime import datetime
import os
import pandas as pd
import pyarrow as pa
import pyarrow.parquet as pq
def append_to_parquet_table(dataframe, filename):
full_path = os.path.join('.', filename)
table = pa.Table.from_pandas(dataframe)
writer = pq.ParquetWriter(full_path, table.schema)
writer.write_table(table=table)
def save(passed):
data = {'number': [1234],
'verified': [passed],
'date': datetime.now().strftime("%Y-%m-%d %H:%M:%S")}
data_df = pd.DataFrame(data)
append_to_parquet_table(data_df, 'results.parquet')
save(True)
save(False)
为什么要“更新”第一个数据集而不是写入新的数据集?
【问题讨论】: