FastText能否实现字符级文本分类?求参数配置示例
FastText字符级分类参数配置示例
要实现FastText的字符级文本分类,核心是配置字符n-gram相关参数——关键是启用minn和maxn(默认值均为0,代表不使用字符n-gram),以下是具体配置示例和参数说明:
字符级分类示例代码
# 启用字符n-gram的FastText训练代码 model = fasttext.train_supervised( input="training_fasttextFormat.csv", lr=0.1, epoch=50, loss='hs', wordNgrams=1, # 仅需纯字符级时设为1;如需结合词n-gram可调整 dim=200, minn=2, # 最小字符n-gram长度 maxn=5, # 最大字符n-gram长度 bucket=2000000 # 存储字符n-gram的哈希桶数量,默认值足够多数场景 ) print(model.test('testing_fasttextFormat.csv'))
关键参数说明
minn:字符n-gram的最小长度,设为大于0的值即可启用字符级特征,例如设为2时,模型会提取"ab"这类双字符组合maxn:字符n-gram的最大长度,例如设为5时,模型会提取最长5个字符的组合(如"abcde")bucket:用于存储低频字符n-gram的哈希桶数量,默认2000000可应对大多数场景,若字符集特殊可适当调整wordNgrams:如需同时结合词级n-gram特征,可设为大于1的值;仅需纯字符级时保持1即可
其他相关参数补充
以下是字典类可选参数的说明,可按需调整:
minCount:单词的最小出现次数,默认1minCountLabel:标签的最小出现次数,默认0t:单词采样阈值,默认0.0001label:数据集中标签的前缀,默认__label__
内容的提问来源于stack exchange,提问作者Feng Chen
相关产品推荐
相关产品推荐

