为何Hugging Face语音识别模型输出概率数远多于字词数?
Wav2Vec2西班牙语语音转写概率的含义解析
我用Wav2Vec2-large-XLSR-53西班牙语模型做语音转写,转写完成后得到了概率输出列表,但列表里的元素数量远多于转写结果的单词数和字符数,想知道每个概率代表什么?
示例数据
| audio_file | transcription | probabilities | n_words | n_chars | n_probabilities |
|---|---|---|---|---|---|
| 1191045604182503424 | ... | [0.8018453121185303, ...] | 265 | 1974 | 39331 |
| 1192339651618648064 | ... | [0.5861434936523438, ...] | 243 | 1454 | 28877 |
| 1192530643797860352 | ... | [0.9996742010116577, ...] | 153 | 902 | 17935 |
| 1192571268513566720 | ... | [0.7634865045547485, ...] | 77 | 471 | 9357 |
| 1192910076517986304 | ... | [0.9717265367507935, ...] | 20 | 200 | 3995 |
概率含义解析
这些概率对应的是模型对音频中每个声学帧的预测置信度,具体原因如下:
- Wav2Vec2这类语音模型会先把输入音频分割成大量细小的声学帧(每帧通常为20-30毫秒),帧的数量由音频时长和帧移参数决定,一段普通长度的音频会生成几千甚至上万帧。
- 模型会先对每个声学帧单独做预测,再通过CTC(连接时序分类)算法把这些帧级的预测结果合并、去重,最终得到连贯的文本序列。
- 正因为帧的数量远多于最终转写的字符或单词数,所以概率列表的元素数量会比转写结果的字符数、单词数多很多。
内容的提问来源于stack exchange,提问作者Alberto Agudo Dominguez
相关产品推荐
相关产品推荐

