是否允许通过自定义代码自定义Azure ML Studio数据配置文件?
Azure ML Studio 自定义数据配置文件的实现方法
完全允许通过自定义代码生成并关联自定义的数据配置文件,UI驱动的方法无法满足的自定义需求,可通过Azure ML Python SDK实现,具体操作如下:
计算自定义数据质量指标
借助pandas等数据处理库,根据需求计算个性化的质量指标,比如特定分位数、自定义规则下的异常值占比等,示例代码:import pandas as pd from azure.ai.ml import MLClient from azure.identity import DefaultAzureCredential # 初始化Azure ML客户端 ml_client = MLClient(DefaultAzureCredential(), subscription_id="你的订阅ID", resource_group_name="你的资源组", workspace_name="你的工作区") # 加载目标数据资产 data_asset = ml_client.data.get(name="你的数据资产名称", version="版本号") df = pd.read_csv(data_asset.path) # 计算自定义指标 custom_profile = { "自定义指标": { "95分位数值": df["数值列"].quantile(0.95), "无效邮箱占比": len(df[~df["邮箱列"].str.contains(r"^[\w\-\.]+@([\w-]+\.)+[\w-]{2,}$")]) / len(df), "唯一分类数量": df["分类列"].nunique() }, "标准指标补充": { "整体缺失值占比": df.isnull().sum().sum() / (df.shape[0] * df.shape[1]), "标准差": df["数值列"].std() } }关联自定义配置文件到数据资产
将计算好的指标保存为JSON文件,再通过SDK更新数据资产的元数据,把自定义配置文件关联进去:import json # 保存自定义配置文件到本地 with open("custom_data_profile.json", "w") as f: json.dump(custom_profile, f, ensure_ascii=False) # 更新数据资产属性,添加自定义配置文件关联 data_asset.properties["自定义数据配置文件"] = "custom_data_profile.json" ml_client.data.create_or_update(data_asset)在Studio中查看自定义配置
更新完成后,进入数据资产详情页,在「属性」或「元数据」板块就能看到自定义指标的关联信息;如果需要更直观的可视化展示,也可以将自定义指标集成到Azure ML的笔记本或自定义仪表盘中,直接在Studio内查看。
内容的提问来源于stack exchange,提问作者wantering_otter
相关产品推荐
相关产品推荐

