如何修改Python文本分类脚本以从CSV读取数据替代内置DataFrame?
你的理解是正确的,原代码中的DataFrame是手动构造的硬编码数据,仅需替换构造DataFrame的对应行代码为CSV读取逻辑即可,修改后的完整代码如下:
import pandas as pd d = {'men': ['men', 'boy'], 'women': ['women', 'girl', 'lady']} def classify(text): gender = 'None of any' for i in d: if any(j in text for j in d[i]): gender = i return gender # 替换原硬编码逻辑为读取CSV,引号内替换为你实际的CSV文件路径 df = pd.read_csv("你的CSV文件路径.csv") # 分类逻辑和原代码完全一致 df['cat'] = df['text'].apply(lambda x: classify(x)) # 打印结果预览 print(df) # 若需要将分类后的完整数据导出为新CSV,保留下方代码即可 df.to_csv("分类结果.csv", index=False, encoding='utf-8-sig')
注意事项
- 请确保你的CSV文件中存在名为
text的列,用于存储待分类的文本内容;如果你的CSV中文本列的名称不是text,需要将df['text'].apply(...)中的text替换为你实际使用的列名 - 如果CSV和Python脚本存放在同一个文件夹下,
pd.read_csv的参数直接写CSV文件名即可,否则需要填写完整的文件路径 - 若读取CSV时出现编码报错,可以尝试给
pd.read_csv增加编码参数,例如pd.read_csv("你的文件.csv", encoding='gbk')或者pd.read_csv("你的文件.csv", encoding='utf-8')
内容的提问来源于stack exchange,提问作者sdevlin123
相关产品推荐
相关产品推荐

