You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

C#全局移除字符串中重复单词与短语的实现方案咨询

清理语音转文本重复内容的可行方案

一、基于规则的文本清理(快速落地)

  • 连续重复单元过滤:用正则表达式匹配不同场景的重复内容,替换为单个单元:
    • 处理连续重复单词(如"I I I"):使用正则\b(\w+)\s+\1+\b,替换为\1
    • 处理带标点分隔的重复(如"I, I I"):使用正则(\b\w+\b)[\s,]*\1+,替换为\1
    • 处理短语重复(如"downtown downtown"):调整正则为(\b[\w\s]+\b)\s+\1+\b,适配多词短语
  • 高频填充词管控:针对"you know"、"like"这类过度使用的填充词:
    • 设定频率阈值,比如当"like"每100词出现超过3次时,移除无实质语义的实例(如句首/句中无关联的"like,")
    • 用正则匹配连续重复的填充词(如(you know,?\s*)+),替换为单个或直接移除

二、NLP模型辅助处理(应对复杂重复)

  • 预训练模型改写:用BERT、GPT系列模型做文本优化,通过明确指令引导模型清理重复:
    输入prompt示例:清理这段文本里的重复单词、冗余短语和过度使用的填充词,保留原意:[你的语音转文本内容]
  • 短语相似度去重:将文本分割为短语单元,计算短语间的余弦相似度,移除相似度超过0.9的重复短语,仅保留首次出现的有效单元

三、结合语音源数据的前置优化(从根源减少重复)

  • 语音停顿与重复发音检测:如果能获取原始语音文件,结合停顿时长(如超过500ms的停顿后重复发音)、音素重复特征,在识别阶段就过滤掉重复的语音片段
  • 个性化重复模式适配:针对特定说话人的重复习惯(如某用户频繁重复"my first"),建立该用户的重复模式库,识别后直接过滤对应重复内容

示例处理效果

原文本:I mean, my first, my, my first, my first weekend down there, we went downtown, downtown Newark
处理后:I mean, my first weekend down there, we went downtown Newark

内容的提问来源于stack exchange,提问作者Andrew Harbert

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 17:35:08