Azure Dataflow规则映射问题:提取Blob中XML特定信息至SQL库
在Azure Dataflow中提取XML随机节点下的目标数据
直接用XPath表达式就能忽略随机命名的节点,精准定位到目标内容,具体操作步骤如下:
- 先在Dataflow里配置好Azure Blob的XML数据源,确保能正常读取到XML文件内容。
- 添加派生列组件,新建一列(比如命名为
ImportantInfo)用来存放提取出的目标数据。 - 在派生列的表达式框里写入以下代码(替换
xmlContent为你实际读取XML的列名):xpath(xmlContent, "/title/category_a/*[1]/object_a/subobject_object_a/p/text()")
表达式逻辑说明:
/title/category_a/*[1]:*匹配任意名称的子节点,[1]指定取category_a下的第一个子节点,直接跳过随机命名的节点。- 后续的
/object_a/subobject_object_a/p/text()是固定路径,精准定位到存放目标内容的<p>标签,提取其文本值。
测试的时候可以先拿单个XML文件验证,确认能稳定提取到IMPORTANT INFORMATION后,再批量处理所有文件即可。
内容的提问来源于stack exchange,提问作者Haenning
相关产品推荐
相关产品推荐

