You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何解决使用PyArrow写入Arrow数据集时的Too many open files错误

解决方案

1. 先修正ulimit软限制(根因之一)

你当前进程实际生效的打开文件数软限制是1024,配置的高硬限制没有被实际使用:

  • 临时生效(当前会话有效):执行命令 ulimit -Sn 65535 即可将软限制调高到65535
  • 永久生效:修改 /etc/security/limits.conf 文件,添加如下两行:
* soft nofile 65535
* hard nofile 524288

修改后重启终端会话或服务进程生效。如果是通过systemd管理的服务,还需要在service配置文件中添加 LimitNOFILE=65535 配置后重载服务。

2. PyArrow写入参数调整(直接解决文件数管控问题)

关于你询问的动态释放已打开文件的问题:PyArrow 5.0及以上版本原生支持该能力,无需手动处理,只需要在write_dataset中添加max_open_files参数限制同时打开的文件数即可,超过设定阈值后会自动关闭最近最少使用的空闲文件。修改后的代码参考:

import pyarrow as pa
f = 'my_partitioned_big_dataset'
ds = dataset.dataset(f, format='parquet', partitioning='hive')
s = ds.scanner()
# 新增参数控制文件打开数
pa.dataset.write_dataset(
    s.head(827982), 
    'here', 
    format="arrow", 
    partitioning=ds.partitioning,
    max_open_files=512,  # 同时打开的文件数不超过512,超过后自动关闭空闲文件
    min_rows_per_file=1000  # 避免生成过多小文件,减少总打开文件需求
)

额外参数说明:

  • 如果你的分区数特别多,还可以添加use_threads=False关闭多线程写入,避免并发打开大量文件
  • 如果写入数据量很大,可添加max_rows_per_file=100000控制单个文件的最大行数,进一步减少文件总数

3. 可选优化:写入前排序

如果你的数据分区键离散度很高,可以先将待写入数据按分区键排序,让相同分区的数据连续写入,大幅降低同时打开多个分区文件的概率。


内容的提问来源于stack exchange,提问作者safetyduck

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 16:45:03