You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

FastText能否实现字符级文本分类?求参数配置示例

FastText字符级分类参数配置示例

要实现FastText的字符级文本分类,核心是配置字符n-gram相关参数——关键是启用minn和maxn(默认值均为0,代表不使用字符n-gram),以下是具体配置示例和参数说明:

字符级分类示例代码

# 启用字符n-gram的FastText训练代码
model = fasttext.train_supervised(
    input="training_fasttextFormat.csv",
    lr=0.1,
    epoch=50,
    loss='hs',
    wordNgrams=1,  # 仅需纯字符级时设为1;如需结合词n-gram可调整
    dim=200,
    minn=2,  # 最小字符n-gram长度
    maxn=5,  # 最大字符n-gram长度
    bucket=2000000  # 存储字符n-gram的哈希桶数量,默认值足够多数场景
)
print(model.test('testing_fasttextFormat.csv'))

关键参数说明

  • minn:字符n-gram的最小长度,设为大于0的值即可启用字符级特征,例如设为2时,模型会提取"ab"这类双字符组合
  • maxn:字符n-gram的最大长度,例如设为5时,模型会提取最长5个字符的组合(如"abcde")
  • bucket:用于存储低频字符n-gram的哈希桶数量,默认2000000可应对大多数场景,若字符集特殊可适当调整
  • wordNgrams:如需同时结合词级n-gram特征,可设为大于1的值;仅需纯字符级时保持1即可

其他相关参数补充

以下是字典类可选参数的说明,可按需调整:

  • minCount:单词的最小出现次数,默认1
  • minCountLabel:标签的最小出现次数,默认0
  • t:单词采样阈值,默认0.0001
  • label:数据集中标签的前缀,默认__label__

内容的提问来源于stack exchange,提问作者Feng Chen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.02 08:49:55