AWS Sagemaker使用Parquet Dataset时报AioClientCreator属性缺失错误
故障原因
该报错为Python依赖包版本冲突导致,和SageMaker平台、Parquet数据集本身无关:
SageMaker内置环境默认预装的botocore版本,与你当前环境安装的s3fs依赖的aiobotocore版本不兼容。_register_lazy_block_unknown_fips_pseudo_regions是特定版本botocore中AioClientCreator类的内部方法,当依赖版本差距过大时,就会触发该属性缺失错误。
解决方法
你可以任选以下任一方案解决问题:
- 方案1:安装兼容版本的依赖包
在SageMaker笔记本的单元格中执行以下命令,安装互相兼容的三个依赖版本:
安装完成后重启Jupyter内核,再重新运行原有代码即可正常读取S3上的Parquet文件。!pip install -q "s3fs==2023.6.0" "aiobotocore==2.5.4" "botocore==1.29.161" - 方案2:使用boto3直接读取的替代方案
如果你不想修改现有环境的依赖版本,可以改用boto3拉取S3文件到内存后再读取,无需依赖s3fs,参考代码如下:import boto3 import io import pandas as pd import pyarrow.parquet as pq s3_client = boto3.client('s3') # 替换为你的实际桶名和Parquet文件前缀 bucket_name = 'xx' prefix = 'your_parquet_prefix/' df_list = [] # 遍历前缀下所有Parquet文件 response = s3_client.list_objects_v2(Bucket=bucket_name, Prefix=prefix) for content in response.get('Contents', []): if content['Key'].endswith('.parquet'): obj = s3_client.get_object(Bucket=bucket_name, Key=content['Key']) tmp_df = pq.read_table(io.BytesIO(obj['Body'].read())).to_pandas() df_list.append(tmp_df) # 合并所有数据 df = pd.concat(df_list, ignore_index=True)
内容的提问来源于stack exchange,提问作者user0454457
相关产品推荐
相关产品推荐

