升级Saxon从10.6到11.4后XML解析器跳过结束标签问题求助
Saxon-HE 11.4处理含空格XML标签时的解析异常解决办法
问题现象
将XML通过Saxon XSLT转换时,Saxon 10.6版本运行完全正常,但升级到Saxon-HE 11.4后,当标签内仅包含空格时,解析器会错误跳过结束标签,将后续其他标签的内容当作该标签的输入;标签为空或包含非空格内容时无此问题。
输入XML示例
<Tag0> <Tag1>sample1</Tag1> <Tag2> </Tag2> <Tag3>sample2</Tag3> </Tag0>
错误转换输出
<Tag0 Tag1="sample1" Tag2=" <Tag2>
 <Tag3>sample2</Tag2>
"/>
使用的XSLT代码
<?xml version="1.0" encoding="UTF-8"?> <xsl:stylesheet version="3.0" xmlns:xsl="http://www.w3.org/1999/XSL/Transform" xmlns:xs="http://www.w3.org/2001/XMLSchema" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:fn="http://www.w3.org/2005/xpath-functions" > <xsl:output method="xml" version="1.0" encoding="UTF-8" indent="yes"/> <xsl:template match="/"> <xsl:element name="{MsgStr}message" namespace="{$msgNamespace}"> <xsl:element name="Tag1" namespace="{$Namespace}"> <xsl:attribute name="Tag2"><xsl:value-of select="*:Tag2"/></xsl:attribute> <xsl:attribute name="Tag3"><xsl:value-of select="*:Tag3"/></xsl:attribute> </xsl:element> </xsl:element> </xsl:template> </xsl:stylesheet>
原因分析
Saxon 11.x版本对空白文本节点的处理规则与10.x版本存在差异。xsl:value-of select="*:Tag2"默认会提取该元素节点下的所有子节点内容,当Saxon错误识别仅含空格的元素边界时,后续的标签节点会被误判为<Tag2>的子节点,导致输出异常。直接使用*:Tag2/text()无效,是因为默认的空白处理可能过滤了该文本节点,或者解析器仍未正确识别元素边界。
解决方案
方案1:精准提取目标文本节点
修改<xsl:attribute>中的select表达式,直接指定提取<Tag2>的第一个文本节点(仅含空格的元素只有一个文本节点):
<xsl:attribute name="Tag2"><xsl:value-of select="*:Tag2/text()[1]"/></xsl:attribute>
如果不需要保留原空格,可使用normalize-space()去除冗余空白:
<xsl:attribute name="Tag2"><xsl:value-of select="normalize-space(*:Tag2)"/></xsl:attribute>
方案2:显式控制空白处理规则
在XSLT的<xsl:stylesheet>节点下添加空白控制指令,强制保留<Tag2>的空白内容:
<xsl:preserve-space elements="Tag2"/>
或者全局去除不必要的空白,同时保留目标元素的空白:
<xsl:strip-space elements="*"/> <xsl:preserve-space elements="Tag2"/>
方案3:调整Saxon配置参数
Saxon 11新增了部分空白解析相关的特性,可通过设置配置参数兼容旧版本行为,例如:
Processor processor = new Processor(false); processor.setConfigurationProperty("http://saxon.sf.net/feature/recognize-unicode-whitespace", false);
该参数会禁用Unicode空白字符的扩展识别,避免边界判断异常。
内容的提问来源于stack exchange,提问作者Khyros12
相关产品推荐
相关产品推荐

