从Google Cloud Storage读取CSV至Pandas DataFrame时遇FileNotFoundError
解决Pandas读取Google Cloud Storage CSV文件的FileNotFoundError问题
嘿,我来帮你搞定这个问题!你碰到的FileNotFoundError,本质是Pandas默认没办法直接识别gs://这种Google Cloud Storage(GCS)的路径格式,得调整下读取方式或者加个依赖就行。下面给你两种实用的解决方案:
方案一:利用已导入的google-cloud-storage库读取字节流
你已经导入了google-cloud-storage,那直接用它把文件内容读到内存里,再传给Pandas就行,不用额外装包:
import pandas as pd import matplotlib.pyplot as plt import seaborn as sns %matplotlib inline from io import BytesIO from google.cloud import storage storage_client = storage.Client() bucket = storage_client.get_bucket('createbucket123') blob = bucket.blob('my.csv') # 把CSV文件内容下载成字节流,再用BytesIO模拟文件对象 csv_content = blob.download_as_bytes() df = pd.read_csv(BytesIO(csv_content))
原理很简单:download_as_bytes()会把GCS上的文件内容下载到本地内存,BytesIO把字节数据包装成Pandas能识别的类文件对象,这样read_csv就能正常解析了。
方案二:安装依赖让Pandas直接支持GS路径
如果不想每次都写字节流的代码,可以装个gcsfs库,它能让Pandas直接识别gs://路径:
- 先安装依赖:
pip install gcsfs
- 然后你的原代码就能正常运行了,不过要确保你的GCS身份认证没问题:
- 如果是本地运行,要设置
GOOGLE_APPLICATION_CREDENTIALS环境变量,指向你的服务账号密钥文件 - 如果是在GCP的虚拟机、Cloud Function等环境运行,默认会自动获取身份认证,不用额外配置
- 如果是本地运行,要设置
额外排查点
- 确认存储桶名称
createbucket123和文件路径my.csv完全正确,没有拼写错误(GCS的路径大小写敏感哦) - 确认运行代码的身份(比如服务账号)拥有该存储桶和文件的读取权限(需要
storage.objects.get权限)
内容的提问来源于stack exchange,提问作者user1838940
相关产品推荐
相关产品推荐

