lxml中查询带命名空间XML元素的合理方案咨询
嘿,这个问题我处理带命名空间的XML文档时也踩过坑!ElementTree默认不支持直接用带前缀的标签名(比如gnc:account)调用iter(),因为它没法自动解析前缀对应的命名空间URI,这就是你最初的代码没输出的原因。
你自己写的函数虽然能解决问题,但确实有点繁琐,这里有两个更简洁合理的方案,不用手动拼接完整URI:
方案1:利用iter()的namespaces参数(Python 3.8+)
从Python 3.8开始,Element.iter()新增了namespaces参数,可以直接传入前缀和URI的映射字典,这样就能直接用前缀+标签名的形式查找元素:
# 先获取根节点的命名空间映射(root是你解析后的根元素) ns_map = root.nsmap # 直接使用带前缀的标签逻辑,同时指定namespaces参数 for account in tree.iter('account', namespaces={'gnc': ns_map['gnc']}): print(account)
这里要注意,iter()的第一个参数是不带前缀的标签名,然后通过namespaces参数把gnc前缀关联到对应的URI。
方案2:使用XPath表达式配合命名空间映射
如果你习惯用XPath,findall()方法支持直接传入命名空间映射,这样可以用更直观的gnc:account语法:
ns_map = root.nsmap # 用XPath的//语法查找所有层级的gnc:account元素 accounts = tree.findall('.//gnc:account', namespaces=ns_map) for account in accounts: print(account)
这种方法兼容性更好,即使是Python 3.8之前的版本也能正常运行。
这两种方法都不用手动拆分前缀和标签名,直接利用ElementTree自带的命名空间映射能力,比你自己写的函数更简洁易读。
内容的提问来源于stack exchange,提问作者quant
相关产品推荐
相关产品推荐

