何时在Google Cloud speech to text api中使用增强视频模型?
视频音频增强模型适配场景及相对优势说明
核心设计适配场景
视频增强模型的训练集完全围绕各类视频场景的内嵌音频特征搭建,核心适配范围包含:
- 主流视频平台所有常见压缩规格的内嵌音频,覆盖从短视频平台128kbps以下的高压缩音频,到长视频平台192~320kbps的标准AAC编码音频
- 消费级设备(手机、运动相机、云台相机等)全场景录制的视频音频,包含室内普通对话、户外有风环境、街头嘈杂环境、多人同框对话等常见录制场景
- 视频内容专属的混合音频场景,比如带背景BGM的vlog、带现场环境音的纪实拍摄、多说话人访谈类内容等
相对默认模型、电话通话模型的优势场景
默认通用增强模型适配全品类音频但无场景偏向,电话模型仅针对电话链路窄带(8kHz/16kHz)、AMR类编码的高压缩语音优化,视频增强模型在以下场景表现明显更优:
- 低码率视频压缩音频修复场景:可针对性消除视频专属的二次压缩噪声、齿音失真、低频断层问题,不会出现默认模型适配不足导致的修复后仍有杂音、电话模型过度处理导致的人声机械感问题
- 户外消费级设备录制音频降噪场景:针对风噪、街头人流/交通背景噪的抑制效果比通用模型高30%以上,同时不会像电话模型一样过度抹除人声的高低频细节
- 多说话人视频语音增强场景:对重叠语音的分离表现优于另外两类模型,不会出现默认模型常见的说话人切换时音量跳变、电话模型误消除次要说话人语音的问题
- 混合音轨保留场景:修复人声的同时可以完整保留视频内嵌的BGM、现场环境音效的听感,另外两类模型会优先压缩非人声成分,破坏视频内容的整体音频表现
内容的提问来源于stack exchange,提问作者Rob Allsopp
相关产品推荐
相关产品推荐

