如何用Pandas删除CSV文件评论中的图标并解决分割失效问题
解决方案
1. 修正CSV读取编码
你看到的✅是UTF-8编码的勾选符号(✓)被错误解码导致的乱码,Excel导出CSV常用utf-8-sig或cp1252编码,试试用这两种编码读取文件:
import pandas as pd # 尝试UTF-8带BOM编码 df = pd.read_csv('你的文件路径.csv', encoding='utf-8-sig') # 若上述无效,尝试Windows默认编码 # df = pd.read_csv('你的文件路径.csv', encoding='cp1252')
编码修正后再执行你的split逻辑,通常能正常识别|分隔符。
2. 直接清理特殊字符后分割
如果编码调整仍无效,直接移除勾选符号(包含Unicode原符号和乱码形式)后再分割:
import pandas as pd import re df = pd.read_csv('你的文件路径.csv') # 匹配并移除所有相关特殊字符,再分割取评论内容 df['reviews'] = df['reviews'].apply(lambda x: re.sub(r'[\u2713✅]', '', x).split('|')[1].strip())
3. 编码转译修复乱码
✅本质是UTF-8字符被用Latin-1解码导致的,可通过编码转译还原正确字符后处理:
df['reviews'] = df['reviews'].apply(lambda x: x.encode('latin-1').decode('utf-8').split('|')[1].strip())
内容的提问来源于stack exchange,提问作者GSandro_Strongs
相关产品推荐
相关产品推荐

