You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

波斯语社交媒体情感分类(二元/多分类)词典法实现问题咨询

1 二元分类逻辑调整

可以直接调整,修改case_when的兜底规则即可,将正负词数量相等的场景按照你的需求划归为积极或消极类别,完全去掉中性分类,参考代码如下:

Raw_data_on_posts %>% 
  mutate(p_count = str_count(post, str_c(Dictionary$positive, collapse = '|')), 
         n_count = str_count(post, str_c(Dictionary$negative, collapse = '|'))) %>% 
  mutate(label = case_when(
    p_count > n_count ~ 'positive',
    # 相等场景可根据业务需求调整归属,此处示例归为消极,需积极可直接替换值
    TRUE ~ 'negative'
  )) %>% 
  select(post, label)

如果需要更灵活的规则,也可以增加差值阈值判断,比如仅当正负词数量差大于等于1时才归为对应类别,其余场景按倾向性划归。

2 波斯语分类结果异常排查

你遇到的绝大多数内容被判为中性的核心原因是情感词完全匹配失败,导致p_count和n_count都为0,触发了原逻辑的中性兜底规则,和英文测试集效果不一致可按以下顺序排查:

  • 确认编码配置:波斯语使用UTF-8编码,读取数据时需要手动指定编码避免乱码,比如读取Excel文件时使用read_excel(文件路径, locale = locale(encoding = "UTF-8")),读取csv文件时使用read_csv(文件路径, locale = locale(encoding = "UTF-8"))。
  • 验证匹配有效性:取1个明确收录在你的情感词典中的波斯语词汇,和1条包含该词汇的帖子内容,运行str_detect(帖子内容, 目标词汇)测试返回值,如果返回FALSE说明字符匹配失败,需要检查词典和帖子内容的字符格式是否统一(比如是否存在变音符号差异、手写体和印刷体差异、特殊符号未转义等问题)。
  • 优化匹配逻辑:你当前使用的是正则模糊匹配,未对波斯语文本做分词,作为黏着语的波斯语很容易出现长词包含短情感词的误匹配,或者词形变化导致的漏匹配,建议先对帖子内容做分词、归一化处理(去掉变音符号、统一数字/字符写法)后再做情感词计数。

内容的提问来源于stack exchange,提问作者nesta13

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 11:36:03