You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

情感分析文本预处理阶段词汇归一化代码运行结果不符问题求助

问题根因
  • 原代码直接遍历输入的文本字符串,是按单个字符迭代匹配,没有先拆分出独立单词,完全不符合匹配逻辑
  • 原函数返回的是列表类型,不是归一化后的完整字符串,和预期输出格式不符
修正后代码
import pandas as pd

# 初始化俚语映射表与测试数据
slang = pd.DataFrame({'before': ['knp', 'dmna', 'drpd'], 'after': ['kenapa', 'di mana', 'dari pada']})
df = pd.DataFrame({'data': ['kamu knp sayang', 'drpd sedih mending bermain']})
                  
# 生成映射字典
normalisasi = {}
for index, row in slang.iterrows():
    normalisasi[row['before']] = row['after']

# 归一化处理函数
def normalized_term(document):
    # 拆分文本为独立单词
    word_list = document.split()
    # 替换匹配到的俚语
    replaced_list = [normalisasi.get(word, word) for word in word_list]
    # 拼接为完整字符串返回
    return ' '.join(replaced_list)

df['normal'] = df['data'].apply(normalized_term)
# 输出结果
print(df)
运行输出结果
data                      normal
0             kamu knp sayang          kamu kenapa sayang
1  drpd sedih mending bermain  dari pada sedih mending bermain
拓展适配说明

如果你的输入文本存在俚语和标点附着的情况(比如knp?、dmna!),可以先对文本做标点清洗,或者改用正则全词匹配的方案实现替换。

内容的提问来源于stack exchange,提问作者caeruleum

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 22:24:07