Azure Machine Learning数据集创建无限挂起问题求助
Azure ML从Datastore创建Dataset无限挂起的解决方案
问题现象
使用Azure Machine Learning从Blob或ADLS数据存储(Datastore)创建File Dataset时,Dataset.File.from_files()方法执行后无限挂起,既无报错信息也无法完成创建;但Datastore.download()方法可正常下载并读取存储中的文件,私有端点配置下的网络连接已验证正常。
已确认信息
- 出站规则已配置为使用私有端点,Azure ML实例可成功解析存储的私有IP
- Blob容器和ADLS容器均出现相同问题,存储中仅包含测试文件
contacts.csv Datastore.download()测试代码执行成功,可正常获取文件列表及内容
解决方案
跳过文件验证步骤
在创建Dataset时添加validate=False参数,避免私有网络环境下的文件验证请求阻塞:import azureml.core from azureml.core import Workspace, Datastore, Dataset ws = Workspace.from_config() datastore = Datastore.get(ws, datastore_name='blobs') data_path = [(datastore, "contacts.csv")] dataset = Dataset.File.from_files(path=data_path, validate=False)升级Azure ML SDK至最新稳定版
旧版本SDK可能存在私有网络下Dataset创建的兼容性问题,执行以下命令升级:pip install --upgrade azureml-core azureml-dataset-runtime检查存储账户防火墙设置
确认存储账户防火墙允许Azure ML服务访问:- 登录Azure门户,进入目标存储账户
- 进入网络安全 > 防火墙和虚拟网络
- 勾选允许受信任的Microsoft服务访问此存储账户(若未开启)
- 确认已将Azure ML工作区所在虚拟网络/私有端点添加到允许列表
尝试创建Tabular Dataset(针对CSV文件)
若处理的是CSV格式文件,可尝试使用Tabular Dataset创建方法,排查是否为File Dataset特定问题:dataset = Dataset.Tabular.from_delimited_files(path=data_path)
补充排查方向
若以上方法无效,可登录Azure门户,进入Azure ML工作区的监控 > 日志页面,搜索Dataset相关操作日志,定位具体阻塞环节。
内容的提问来源于stack exchange,提问作者Evandro Pomatti
相关产品推荐
相关产品推荐

