导入PandasCursor后用pd.read_excel读取S3文件触发TypeError求助
问题原因与修复方案
原因解释
导入PandasCursor后,pyathena内部封装的S3FileSystem类会覆盖s3fs库提供的同名类。pandas读取S3路径时,会自动尝试实例化S3FileSystem,但pyathena版本的这个类强制要求传入connection参数,而原本s3fs的实现会自动处理AWS认证(无需手动传connection),因此触发参数缺失的类型错误。
修复方案
方案1:显式使用s3fs的文件系统打开文件
手动创建s3fs.S3FileSystem实例,直接打开文件后传给pd.read_excel,绕开pandas自动推断文件系统的逻辑:
import pandas as pd import s3fs from pyathena import connect from pyathena.pandas.cursor import PandasCursor path = "s3://some/path/to/file.xlsx" # 显式初始化s3fs官方的文件系统 fs = s3fs.S3FileSystem() with fs.open(path, 'rb') as file: df = pd.read_excel(file)
方案2:通过storage_options指定正确的文件系统
在read_excel中通过storage_options参数,明确指定使用s3fs的文件系统实现:
import pandas as pd import s3fs from pyathena import connect from pyathena.pandas.cursor import PandasCursor path = "s3://some/path/to/file.xlsx" df = pd.read_excel(path, storage_options={"default_fs": s3fs.S3FileSystem()})
方案3:调整导入顺序(可选)
将s3fs的导入放在PandasCursor之后,强制重新加载正确的S3FileSystem类,但这种方式可靠性较低,不推荐作为长期方案:
import pandas as pd from pyathena import connect from pyathena.pandas.cursor import PandasCursor # 重新导入s3fs,覆盖pyathena的同名类 import s3fs path = "s3://some/path/to/file.xlsx" df = pd.read_excel(path)
内容的提问来源于stack exchange,提问作者TiTo
相关产品推荐
相关产品推荐

