You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何为pyarrow.csv.write_csv指定文件编码?

在pyarrow中写入CSV时指定编码的方法

pyarrow的WriteOptions确实没有提供直接设置编码的参数,不过可以通过以下两种方式解决:

方法一:用codecs.EncodedFile包装二进制文件对象

通过codecs模块的EncodedFile类,把二进制模式打开的文件对象包装成带指定编码的流,再传给write_csv:

import pyarrow as pa
import pyarrow.csv as csv
import codecs

# 构造示例Arrow表格
sample_table = pa.table({
    "id": [1, 2, 3],
    "content": ["测试文本1", "测试文本2", "测试文本3"]
})

# 以二进制模式打开文件,用EncodedFile指定编码(比如gbk)
with open("output_encoded.csv", "wb") as raw_file:
    encoded_stream = codecs.EncodedFile(raw_file, data_encoding="gbk")
    csv.write_csv(sample_table, encoded_stream)

方法二:借助pandas中转(如果项目已依赖pandas)

如果你的项目本身已经在使用pandas,可以先把Arrow表格转成DataFrame,再用pandas的to_csv直接指定编码:

import pyarrow as pa
import pyarrow.csv as csv
import pandas as pd

sample_table = pa.table({
    "id": [1, 2, 3],
    "content": ["测试文本1", "测试文本2", "测试文本3"]
})

# 转成DataFrame后写入,直接指定编码
df = sample_table.to_pandas()
df.to_csv("output_pandas.csv", encoding="utf-8-sig", index=False)

本质上,pyarrow的write_csv设计是直接操作二进制流,所以编码处理需要通过流包装来实现,而不是在写入选项中配置。

内容的提问来源于stack exchange,提问作者mrgou

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.17 04:12:39