You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AWS Sagemaker使用Parquet Dataset时报AioClientCreator属性缺失错误

故障原因

该报错为Python依赖包版本冲突导致,和SageMaker平台、Parquet数据集本身无关:
SageMaker内置环境默认预装的botocore版本,与你当前环境安装的s3fs依赖的aiobotocore版本不兼容。_register_lazy_block_unknown_fips_pseudo_regions是特定版本botocore中AioClientCreator类的内部方法,当依赖版本差距过大时,就会触发该属性缺失错误。

解决方法

你可以任选以下任一方案解决问题:

  • 方案1:安装兼容版本的依赖包
    在SageMaker笔记本的单元格中执行以下命令,安装互相兼容的三个依赖版本:
    !pip install -q "s3fs==2023.6.0" "aiobotocore==2.5.4" "botocore==1.29.161"
    
    安装完成后重启Jupyter内核,再重新运行原有代码即可正常读取S3上的Parquet文件。
  • 方案2:使用boto3直接读取的替代方案
    如果你不想修改现有环境的依赖版本,可以改用boto3拉取S3文件到内存后再读取,无需依赖s3fs,参考代码如下:
    import boto3
    import io
    import pandas as pd
    import pyarrow.parquet as pq
    
    s3_client = boto3.client('s3')
    # 替换为你的实际桶名和Parquet文件前缀
    bucket_name = 'xx'
    prefix = 'your_parquet_prefix/'
    
    df_list = []
    # 遍历前缀下所有Parquet文件
    response = s3_client.list_objects_v2(Bucket=bucket_name, Prefix=prefix)
    for content in response.get('Contents', []):
        if content['Key'].endswith('.parquet'):
            obj = s3_client.get_object(Bucket=bucket_name, Key=content['Key'])
            tmp_df = pq.read_table(io.BytesIO(obj['Body'].read())).to_pandas()
            df_list.append(tmp_df)
    # 合并所有数据
    df = pd.concat(df_list, ignore_index=True)
    

内容的提问来源于stack exchange,提问作者user0454457

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 09:24:07