XSLT按pb元素分组提取XML纯文本并包装为page元素
XSLT修改方案
你原有代码保留所有标签的核心原因是subtree模式下的通用节点模板用了<xsl:copy>复制所有匹配到的元素节点,没有做标签剥离、纯文本提取的逻辑。直接替换为如下XSLT 2.0代码即可得到预期输出:
<xsl:stylesheet version="2.0" xmlns:xsl="http://www.w3.org/1999/XSL/Transform" xmlns:tei="http://www.tei-c.org/ns/1.0"> <xsl:output method="xml" encoding="UTF-8" indent="yes"/> <xsl:template match="tei:text/tei:body"> <text xmlns="http://digital.library.ptsem.edu/ptsl" type="ocr" source="tei"> <xsl:for-each-group select="descendant::node()" group-starting-with="tei:pb[@n]"> <page number="{@n}" xmlns="http://digital.library.ptsem.edu/ptsl"> <!-- 排除分页符本身,提取组内所有纯文本 --> <xsl:apply-templates select="current-group()[not(self::tei:pb)]" mode="text-only"/> </page> </xsl:for-each-group> </text> </xsl:template> <!-- 文本节点直接输出内容 --> <xsl:template match="text()" mode="text-only"> <xsl:value-of select="."/> </xsl:template> <!-- 所有元素节点不复制标签,递归处理内部内容 --> <xsl:template match="*" mode="text-only"> <xsl:apply-templates select="node()" mode="text-only"/> </xsl:template> <!-- 可选:如果需要把<lb/>转为空格分隔,取消下面这段注释即可 <xsl:template match="tei:lb" mode="text-only"> <xsl:text> </xsl:text> </xsl:template> --> </xsl:stylesheet>
逻辑说明
- 放弃原有复制节点结构的逻辑,新增
text-only处理模式:遇到元素标签直接跳过,只递归处理标签内部的内容;遇到文本节点直接输出值,从根源上剥离所有TEI原生标签。 - 分组时自动排除
<pb>分页符节点本身,避免分页符的属性等无关内容混入文本。 - 保留了你原有代码中的输出命名空间、外层
<text>节点属性、<page>节点的页码属性设置,输出结构完全符合预期。 - 可选配置项默认注释:如果需要处理原文档中的
<lb/>换行标签,取消对应模板的注释即可把换行标签转为空格,避免前后文本粘在一起。
内容的提问来源于stack exchange,提问作者user2725782
相关产品推荐
相关产品推荐

