You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Pandas删除CSV文件评论中的图标并解决分割失效问题

解决方案

1. 修正CSV读取编码

你看到的✅是UTF-8编码的勾选符号(✓)被错误解码导致的乱码,Excel导出CSV常用utf-8-sig或cp1252编码,试试用这两种编码读取文件:

import pandas as pd
# 尝试UTF-8带BOM编码
df = pd.read_csv('你的文件路径.csv', encoding='utf-8-sig')
# 若上述无效,尝试Windows默认编码
# df = pd.read_csv('你的文件路径.csv', encoding='cp1252')

编码修正后再执行你的split逻辑,通常能正常识别|分隔符。

2. 直接清理特殊字符后分割

如果编码调整仍无效,直接移除勾选符号(包含Unicode原符号和乱码形式)后再分割:

import pandas as pd
import re

df = pd.read_csv('你的文件路径.csv')
# 匹配并移除所有相关特殊字符,再分割取评论内容
df['reviews'] = df['reviews'].apply(lambda x: re.sub(r'[\u2713✅]', '', x).split('|')[1].strip())

3. 编码转译修复乱码

✅本质是UTF-8字符被用Latin-1解码导致的,可通过编码转译还原正确字符后处理:

df['reviews'] = df['reviews'].apply(lambda x: x.encode('latin-1').decode('utf-8').split('|')[1].strip())

内容的提问来源于stack exchange,提问作者GSandro_Strongs

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.04 09:00:55