如何用Dask DataFrame生成JSON数组格式文件并修改扩展名
解决Dask导出CSV为JSON数组及文件后缀问题
修改后的代码
import dask.dataframe as dd cols=['Name','State'] df=dd.read_csv(r'F:\csvs\stack.csv', low_memory=False, usecols=cols, dtype={'Name':str,'State':str} ) df.to_json(r'F:\csvs\stack.json', orient='records', compression='infer', single_file=True, lines=False)
关键修改说明
- 指定完整.json文件名:直接在输出路径中加上
.json后缀,避免Dask默认生成.part分块文件。 single_file=True:强制将所有数据写入单个文件,而非按分块生成多个.part文件。lines=False:关闭默认的每行一个JSON对象模式,改为生成标准的JSON数组格式,所有对象被方括号包裹、逗号分隔。
注意事项
如果处理的CSV文件超大,生成单个JSON数组可能会占用较多内存。若出现内存不足问题,可考虑分批处理后手动拼接数组,但当前修改适用于原代码能正常运行的数据量场景。
内容的提问来源于stack exchange,提问作者sridharnetha
相关产品推荐
相关产品推荐

