Python实现PDF提取文本每句仅首字母大写其余字母小写
句首大写其余小写文本处理方案
实现思路
用正则表达式匹配句子起始位置(字符串开头或. ! ?三种结束符加空白字符后的第一个字符),先将全文本转为小写,再将匹配到的句首字符转为大写即可。
完整代码
步骤1:导入依赖
import re
步骤2:定义文本处理函数
def capitalize_sentences(text): # 全文字符统一转小写 text = text.lower() # 匹配句首位置的小写字母,替换为大写 return re.sub( r'(^|[.!?]\s+)([a-z])', lambda match: match.group(1) + match.group(2).upper(), text )
步骤3:整合到原有流程中
在你已经完成的换行、换页符清理逻辑后调用该函数即可:
# 原有特殊字符清理逻辑 text = text.replace('\n', '') text = text.replace('\x0c', '') # 新增句首大写处理 text = capitalize_sentences(text) print(text)
特殊场景说明
如果需要保留GPIC、GRI这类专有名词的大写格式,需要额外补充专有名词匹配逻辑,可以提供更多需求细节后再做调整。
内容的提问来源于stack exchange,提问作者StressedBoi69420
相关产品推荐
相关产品推荐

