如何使用Dask读取HTTP(s) octet-stream返回的Parquet文件
问题描述
部分后端接口会以octet-stream格式返回Parquet文件。在Pandas中可以通过如下代码完成读取:
import io import requests import pandas as pd result = requests.get("https://..../file.parquet") df = pd.read_parquet(io.BytesIO(result.content))
我能否在Dask中实现相同的能力?我尝试直接运行以下代码:
import dask.dataframe as dd dd.read_parquet("https://..../file.parquet")
程序抛出了异常(返回结果为类字节对象导致):
File "to_parquet_dask.py", line 153, in <module> main(*parser.parse_args()) File "to_parquet_dask.py", line 137, in main download_parquet( File "to_parquet_dask.py", line 121, in download_parquet dd.read_parquet( File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/dask/dataframe/io/parquet/core.py", line 313, in read_parquet read_metadata_result = engine.read_metadata( File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/dask/dataframe/io/parquet/fastparquet.py", line 733, in read_metadata parts, pf, gather_statistics, base_path = _determine_pf_parts( File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/dask/dataframe/io/parquet/fastparquet.py", line 148, in _determine_pf_parts elif fs.isdir(paths[0]): File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/fsspec/asyn.py", line 88, in wrapper return sync(self.loop, func, *args, **kwargs) File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/fsspec/asyn.py", line 69, in sync raise result[0] File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/fsspec/asyn.py", line 25, in _runner result[0] = await coro File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/fsspec/implementations/http.py", line 418, in _isdir return bool(await self._ls(path)) File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/fsspec/implementations/http.py", line 195, in _ls out = await self._ls_real(url, detail=detail, **kwargs) File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/fsspec/implementations/http.py", line 150, in _ls_real text = await r.text() File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/aiohttp/client_reqrep.py", line 1082, in text return self._body.decode(encoding, errors=errors) # type: ignore UnicodeDecodeError: 'utf-8' codec can't decode byte 0x90 in position 7: invalid start byte
更新
参照@mdurant的回答对fsspec进行调整后,遇到了如下报错:
ValueError: Cannot seek streaming HTTP file
在URL前添加了"simplecache::"前缀后,又出现了新的报错:
Traceback (most recent call last): File "to_parquet_dask.py", line 161, in <module> main(*parser.parse_args()) File "to_parquet_dask.py", line 145, in main download_parquet( File "to_parquet_dask.py", line 128, in download_parquet dd.read_parquet( File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/dask/dataframe/io/parquet/core.py", line 313, in read_parquet read_metadata_result = engine.read_metadata( File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/dask/dataframe/io/parquet/fastparquet.py", line 733, in read_metadata parts, pf, gather_statistics, base_path = _determine_pf_parts( File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/dask/dataframe/io/parquet/fastparquet.py", line 185, in _determine_pf_parts pf = ParquetFile( File "/home/bc30138/Documents/CODE/flexydrive/driver_style/.venv/lib/python3.8/site-packages/fastparquet/api.py", line 127, in __init__ raise ValueError("Opening directories without a _metadata requires" ValueError: Opening directories without a _metadata requiresa filesystem compatible with fsspec
临时解决方案
该方式不够规范也不是最优实现,但目前可以正常运行:
import io import requests import pandas as pd import dask import dask.dataframe as dd @dask.delayed def parquet_from_http(url, token): result = requests.get( url, headers={'Authorization': token} ) return pd.read_parquet(io.BytesIO(result.content)) delayed_download = parquet_from_http(url, token) df = dd.from_delayed(delayed_download, meta=meta)
备注:该方案中必须传入meta参数,否则Dask会两次调用该函数:第一次用于获取元数据,第二次用于执行计算,会发起两次重复请求。
内容的提问来源于stack exchange,提问作者bc30138
相关产品推荐
相关产品推荐

