You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Dask DataFrame生成JSON数组格式文件并修改扩展名

解决Dask导出CSV为JSON数组及文件后缀问题

修改后的代码

import dask.dataframe as dd

cols=['Name','State']
df=dd.read_csv(r'F:\csvs\stack.csv', low_memory=False, usecols=cols,
               dtype={'Name':str,'State':str}
)
df.to_json(r'F:\csvs\stack.json', orient='records', compression='infer', 
           single_file=True, lines=False)

关键修改说明

  • 指定完整.json文件名:直接在输出路径中加上.json后缀,避免Dask默认生成.part分块文件。
  • single_file=True:强制将所有数据写入单个文件,而非按分块生成多个.part文件。
  • lines=False:关闭默认的每行一个JSON对象模式,改为生成标准的JSON数组格式,所有对象被方括号包裹、逗号分隔。

注意事项

如果处理的CSV文件超大,生成单个JSON数组可能会占用较多内存。若出现内存不足问题,可考虑分批处理后手动拼接数组,但当前修改适用于原代码能正常运行的数据量场景。

内容的提问来源于stack exchange,提问作者sridharnetha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 14:01:12