技术问询:如何修正音频转录所得拼写错误的美妆产品名称?
美妆产品名称归一化优化方案
1. 专有词典+模糊匹配方案
- 搭建权威美妆品牌/产品词典:收录官方品牌名(如Fenty Beauty、Joah Beauty)及对应产品线(如Fenty Skin Hydrovisor保湿霜),按品牌、产品类型分层存储。
- 采用编辑距离算法(如Levenshtein距离)计算转录文本与词典条目相似度,设定合理阈值(如编辑距离≤2)触发匹配替换:比如"Finty"与"Fenty"编辑距离为1,"Joa"与"Joah"编辑距离为1,直接完成修正。
- 结合产品类型交叉验证:比如转录文本中的"Moisturizer"对应保湿类产品,匹配词典中Fenty的Skin Hydrovisor系列,进一步确认修正准确性。
2. 音频溯源+发音匹配方案
- 回溯转录对应的音频片段,提取低置信度的品牌发音片段:比如"Finty"尾音与"Fenty"差异极小,"Joah"的尾音/h/可能因弱读被转录遗漏。
- 建立品牌标准发音库:从品牌官网、权威发音词典提取官方发音,将音频片段与发音库做声学特征比对,匹配最接近的正确品牌名。
3. 上下文规则引擎方案
- 梳理美妆品牌与产品类别关联规则:比如黑眼圈遮瑕膏多归属彩妆品牌,Joah Beauty是知名彩妆品牌,无"Joa Beauty"相关产品;保湿霜对应Fenty Skin系列,无"Finty Skin Hydrovisor"产品。
- 构建规则触发修正:当出现「Moisturizer + 近似Fenty拼写」时,替换为Fenty;出现「近似Joah拼写 + Beauty + Concealer」时,替换为Joah。
4. 行业小样本微调大模型方案
- 收集美妆领域常见转录错误-正确名称对(如Finty→Fenty、Joa→Joah等),用这批小样本数据微调GPT-3或美妆领域预训练模型(如美妆BERT),让模型学习行业品牌拼写规律,提升针对性修正能力。
内容的提问来源于stack exchange,提问作者Ankesh
相关产品推荐
相关产品推荐

