You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

XSLT按pb元素分组提取XML纯文本并包装为page元素

XSLT修改方案

你原有代码保留所有标签的核心原因是subtree模式下的通用节点模板用了<xsl:copy>复制所有匹配到的元素节点,没有做标签剥离、纯文本提取的逻辑。直接替换为如下XSLT 2.0代码即可得到预期输出:

<xsl:stylesheet version="2.0" xmlns:xsl="http://www.w3.org/1999/XSL/Transform" xmlns:tei="http://www.tei-c.org/ns/1.0">
<xsl:output method="xml" encoding="UTF-8" indent="yes"/>

<xsl:template match="tei:text/tei:body">
  <text xmlns="http://digital.library.ptsem.edu/ptsl" type="ocr" source="tei">
    <xsl:for-each-group select="descendant::node()" group-starting-with="tei:pb[@n]">
      <page number="{@n}" xmlns="http://digital.library.ptsem.edu/ptsl">
        <!-- 排除分页符本身,提取组内所有纯文本 -->
        <xsl:apply-templates select="current-group()[not(self::tei:pb)]" mode="text-only"/>
      </page>
    </xsl:for-each-group>
  </text>
</xsl:template>

<!-- 文本节点直接输出内容 -->
<xsl:template match="text()" mode="text-only">
  <xsl:value-of select="."/>
</xsl:template>

<!-- 所有元素节点不复制标签,递归处理内部内容 -->
<xsl:template match="*" mode="text-only">
  <xsl:apply-templates select="node()" mode="text-only"/>
</xsl:template>

<!-- 可选:如果需要把<lb/>转为空格分隔,取消下面这段注释即可
<xsl:template match="tei:lb" mode="text-only">
  <xsl:text> </xsl:text>
</xsl:template>
-->
</xsl:stylesheet>

逻辑说明

  • 放弃原有复制节点结构的逻辑,新增text-only处理模式:遇到元素标签直接跳过,只递归处理标签内部的内容;遇到文本节点直接输出值,从根源上剥离所有TEI原生标签。
  • 分组时自动排除<pb>分页符节点本身,避免分页符的属性等无关内容混入文本。
  • 保留了你原有代码中的输出命名空间、外层<text>节点属性、<page>节点的页码属性设置,输出结构完全符合预期。
  • 可选配置项默认注释:如果需要处理原文档中的<lb/>换行标签,取消对应模板的注释即可把换行标签转为空格,避免前后文本粘在一起。

内容的提问来源于stack exchange,提问作者user2725782

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 14:51:11