You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何通过AWS Data Wrangler指定Parquet文件版本?

解决Parquet版本不兼容问题:指定AWS Data Wrangler/Pandas写入版本

1. 使用Pandas指定Parquet版本

Pandas的to_parquet方法支持通过引擎参数配置Parquet版本,推荐使用pyarrow引擎(AWS生态下兼容性更好),通过write_kwargs传递版本参数:

import pandas as pd

# 替换为你的数据框和存储路径
df.to_parquet(
    "s3://your-bucket/target-file.parquet",
    engine="pyarrow",
    write_kwargs={"version": "2.0"}
)

如果使用fastparquet引擎,可直接传递version参数:

df.to_parquet(
    "s3://your-bucket/target-file.parquet",
    engine="fastparquet",
    version="2.0"
)

2. 使用AWS Data Wrangler指定Parquet版本

AWS Data Wrangler底层依赖pyarrow,可通过pyarrow_additional_kwargs参数传递Parquet版本配置:

import awswrangler as wr

# 替换为你的数据框和存储路径
wr.s3.to_parquet(
    df=df,
    path="s3://your-bucket/target-path/",
    pyarrow_additional_kwargs={"version": "2.0"}
)

是否需要更换写入工具?

不需要。Pandas和AWS Data Wrangler都原生支持指定Parquet版本,只要配置正确的引擎和版本参数即可适配Teradata NOS。优先尝试上述方案,这两个工具在AWS生态中集成性强,无需额外更换工具。

注意:建议确认Teradata NOS官方支持的Parquet版本范围,若2.0版本仍不兼容,可尝试指定更高版本(如3.0)。

内容的提问来源于stack exchange,提问作者Marc Williams

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.08 03:01:00