如何通过AWS Data Wrangler指定Parquet文件版本?
解决Parquet版本不兼容问题:指定AWS Data Wrangler/Pandas写入版本
1. 使用Pandas指定Parquet版本
Pandas的to_parquet方法支持通过引擎参数配置Parquet版本,推荐使用pyarrow引擎(AWS生态下兼容性更好),通过write_kwargs传递版本参数:
import pandas as pd # 替换为你的数据框和存储路径 df.to_parquet( "s3://your-bucket/target-file.parquet", engine="pyarrow", write_kwargs={"version": "2.0"} )
如果使用fastparquet引擎,可直接传递version参数:
df.to_parquet( "s3://your-bucket/target-file.parquet", engine="fastparquet", version="2.0" )
2. 使用AWS Data Wrangler指定Parquet版本
AWS Data Wrangler底层依赖pyarrow,可通过pyarrow_additional_kwargs参数传递Parquet版本配置:
import awswrangler as wr # 替换为你的数据框和存储路径 wr.s3.to_parquet( df=df, path="s3://your-bucket/target-path/", pyarrow_additional_kwargs={"version": "2.0"} )
是否需要更换写入工具?
不需要。Pandas和AWS Data Wrangler都原生支持指定Parquet版本,只要配置正确的引擎和版本参数即可适配Teradata NOS。优先尝试上述方案,这两个工具在AWS生态中集成性强,无需额外更换工具。
注意:建议确认Teradata NOS官方支持的Parquet版本范围,若2.0版本仍不兼容,可尝试指定更高版本(如3.0)。
内容的提问来源于stack exchange,提问作者Marc Williams
相关产品推荐
相关产品推荐

