Azure Synapse Analytics中integration dataset的含义是什么
Azure Synapse 中 Integration Dataset 的定义与差异说明
Integration Dataset 是 Azure Synapse 数据集成模块(底层复用 Azure Data Factory 集成能力)中的工作区级持久化元数据对象,核心作用是封装数据集成作业所需的数据源/数据目标的完整配置,供所有集成类能力直接复用。你在官方文档里没查到单独说明很正常,这个能力是直接从ADF平移到Synapse的,相关概念说明散在ADF的数据集文档里,Synapse侧没有单独整理独立条目。
你在界面看到的导入功能,操作界面参考如下,支持批量导入其他环境导出的数据集配置、兼容的ADF数据集资产,导入后不需要重复做基础配置就能直接用在管线作业里。
它和Synapse里其他同类数据集选项的核心区别如下:
- 适用场景边界:专门服务于管线(Pipeline)、复制活动、映射数据流这类数据集成/移动作业,不直接绑定SQL池、Spark池的交互式分析查询作业。
- 和SQL池挂载的表/外部表数据集的区别:后者是SQL引擎侧的计算实体,仅支持SQL查询、存储过程类作业调用,无法直接作为集成活动的源/汇使用,必须额外做映射配置;Integration Dataset预配置了连接鉴权、对象路径、数据格式、字段Schema规则,导入后可以直接被所有集成活动选中使用。
- 和Spark Notebook中注册的临时数据集的区别:后者绑定Spark会话生命周期,会话释放后就会失效,仅对当前Notebook作业可见;Integration Dataset是工作区全局持久化资产,所有拥有工作区权限的用户都可以在集成作业中调用,一次配置长期生效。
- 和链接服务(Linked Service)的区别:链接服务仅定义和数据源的连接通道(比如存储账号鉴权信息、数据库连接串),不指向具体的数据对象;Integration Dataset是在链接服务的基础上,进一步绑定了具体的表名、文件路径、数据格式、字段Schema规则,是链接服务上层的具象化资产。
内容的提问来源于stack exchange,提问作者user2361290
相关产品推荐
相关产品推荐

