You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python实现PDF提取文本每句仅首字母大写其余字母小写

句首大写其余小写文本处理方案

实现思路

用正则表达式匹配句子起始位置(字符串开头或. ! ?三种结束符加空白字符后的第一个字符),先将全文本转为小写,再将匹配到的句首字符转为大写即可。

完整代码

步骤1:导入依赖

import re

步骤2:定义文本处理函数

def capitalize_sentences(text):
    # 全文字符统一转小写
    text = text.lower()
    # 匹配句首位置的小写字母,替换为大写
    return re.sub(
        r'(^|[.!?]\s+)([a-z])',
        lambda match: match.group(1) + match.group(2).upper(),
        text
    )

步骤3:整合到原有流程中

在你已经完成的换行、换页符清理逻辑后调用该函数即可:

# 原有特殊字符清理逻辑
text = text.replace('\n', '')
text = text.replace('\x0c', '')
# 新增句首大写处理
text = capitalize_sentences(text)
print(text)

特殊场景说明

如果需要保留GPIC、GRI这类专有名词的大写格式,需要额外补充专有名词匹配逻辑,可以提供更多需求细节后再做调整。

内容的提问来源于stack exchange,提问作者StressedBoi69420

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 05:15:03