You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何移除Pandas DataFrame中的Unicode字符、表情符号及换行回车符

解决Pandas DataFrame清理特殊字符、换行回车及表情符号的问题

问题根源

你之前用str.encode('ascii', 'ignore').str.decode('ascii')无效,大概率是两个原因:

  • DataFrame里存在NaN值,导致字符串方法无法批量生效
  • 换行、回车这类ASCII控制字符不在encode/decode的处理范围内,还有部分特殊Unicode符号可能没被完全过滤

实用解决方案

直接用正则表达式结合自定义函数,覆盖所有你要清理的内容:

步骤1:导入依赖

import pandas as pd
import re

步骤2:读取数据

data = '../data/data.csv'
df = pd.read_csv(data)

步骤3:定义清理函数

这个函数会处理缺失值、移除控制字符、过滤非ASCII符号(包括表情、特殊Unicode标点),最后整理空格:

def clean_description(text):
    # 处理空值
    if pd.isna(text):
        return ''
    # 移除换行、回车、制表符等控制字符
    text = re.sub(r'[\n\r\t]', ' ', text)
    # 过滤所有非ASCII字符(含表情、特殊标点如’、―、•)
    text = re.sub(r'[^\x00-\x7F]+', '', text)
    # 合并多余空格并去除首尾空格
    text = re.sub(r'\s+', ' ', text).strip()
    return text

步骤4:应用到DataFrame列

df['description'] = df['description'].apply(clean_description)

简化版方案(如果不需要复杂处理)

如果只是想快速过滤非ASCII+处理空值,也可以这样写:

# 先填充空值,再过滤非ASCII,最后清理换行和空格
df['description'] = df['description'].fillna('')\
    .str.encode('ascii', 'ignore').str.decode('ascii')\
    .str.replace(r'[\n\r]', ' ', regex=True)\
    .str.strip()

效果验证

拿你提供的示例数据测试,比如带表情的行(6138)、带特殊标点的行(2307),清理后都会去掉所有非ASCII符号、换行回车,只保留纯英文和基础标点。

内容的提问来源于stack exchange,提问作者Sharhad Bashar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.11 00:12:07