如何修改Python函数实现Pandas DataFrame特殊字符批量替换为ASCII
解决方案
修改后支持DataFrame的函数实现
提前将固定的翻译映射提取到函数外部,避免重复创建提升性能,同时新增输入类型判断,兼容DataFrame批量处理和原有的单字符串处理逻辑:
import pandas as pd # 全局固定翻译映射,仅生成一次 strange='ŮôῡΒძěἊἦëĐᾇόἶἧзвŅῑἼźἓʼnἐÿἈΌἢὶЁϋυŕŽŎŃğûλВὦėἜŤŨîᾪĝžἙâᾣÚκὔჯᾏᾢĠфĞὝŲŊŁČῐЙῤŌὭŏყἀхῦЧĎὍОуνἱῺèᾒῘᾘὨШūლἚύсÁóĒἍŷöὄЗὤἥბĔõὅῥŋБщἝξĢюᾫაπჟῸდΓÕűřἅгἰშΨńģὌΥÒᾬÏἴქὀῖὣᾙῶŠὟὁἵÖἕΕῨčᾈķЭτἻůᾕἫжΩᾶŇᾁἣჩαἄἹΖеУŹἃἠᾞåᾄГΠКíōĪὮϊὂᾱიżŦИὙἮὖÛĮἳφᾖἋΎΰῩŚἷРῈIJἁéὃσňİΙῠΚĸὛΪᾝᾯψÄᾭêὠÀღЫĩĈμΆᾌἨÑἑïოĵÃŒŸζჭᾼőΣŻçųøΤΑËņĭῙŘАдὗპŰἤცᾓήἯΐÎეὊὼΘЖᾜὢĚἩħĂыῳὧďТΗἺĬὰὡὬὫÇЩᾧñῢĻᾅÆßшδòÂчῌᾃΉᾑΦÍīМƒÜἒĴἿťᾴĶÊΊȘῃΟúχΔὋŴćŔῴῆЦЮΝΛῪŢὯнῬũãáἽĕᾗნᾳἆᾥйᾡὒსᾎĆрĀüСὕÅýფᾺῲšŵкἎἇὑЛვёἂΏθĘэᾋΧĉᾐĤὐὴιăąäὺÈФĺῇἘſგŜæῼῄĊἏØÉПяწДĿᾮἭĜХῂᾦωთĦлðὩზკίᾂᾆἪпἸиᾠώᾀŪāоÙἉἾρаđἌΞļÔβĖÝᾔĨНŀęᾤÓцЕĽŞὈÞუтΈέıàᾍἛśìŶŬȚijῧῊᾟάεŖᾨᾉςΡმᾊᾸįᾚὥηᾛġÐὓłγľмþᾹἲἔбċῗჰხοἬŗŐἡὲῷῚΫŭᾩὸùᾷĹēრЯĄὉὪῒᾲΜᾰÌœĥტ' ascii_replacements='UoyBdeAieDaoiiZVNiIzeneyAOiiEyyrZONgulVoeETUiOgzEaoUkyjAoGFGYUNLCiIrOOoqaKyCDOOUniOeiIIOSulEySAoEAyooZoibEoornBSEkGYOapzOdGOuraGisPngOYOOIikoioIoSYoiOeEYcAkEtIuiIZOaNaicaaIZEUZaiIaaGPKioIOioaizTIYIyUIifiAYyYSiREIaeosnIIyKkYIIOpAOeoAgYiCmAAINeiojAOYzcAoSZcuoTAEniIRADypUitiiIiIeOoTZIoEIhAYoodTIIIaoOOCSonyKaAsSdoACIaIiFIiMfUeJItaKEISiOuxDOWcRoiTYNLYTONRuaaIeinaaoIoysACRAuSyAypAoswKAayLvEaOtEEAXciHyiiaaayEFliEsgSaOiCAOEPYtDKOIGKiootHLdOzkiaaIPIIooaUaOUAIrAdAKlObEYiINleoOTEKSOTuTEeiaAEsiYUTiyIIaeROAsRmAAiIoiIgDylglMtAieBcihkoIrOieoIYuOouaKerYAOOiaMaIoht' translator = str.maketrans(strange, ascii_replacements) def removeAccents(input_data): # 传入参数为DataFrame时批量处理 if isinstance(input_data, pd.DataFrame): processed_df = input_data.copy() # 仅处理字符串类型列,跳过数字、日期等非字符串列 str_columns = processed_df.select_dtypes(include=['object', 'string']).columns for col in str_columns: processed_df[col] = processed_df[col].str.translate(translator) return processed_df # 传入参数为字符串时沿用原有逻辑 else: return input_data.translate(translator)
使用示例
# 构造测试DataFrame test_df = pd.DataFrame({ '文本列1': ['Ůôῡ测试内容', 'Ἂἦë特殊字符'], '数字列': [123, 456], # 数字列不会被修改 '文本列2': ['Đᾇό样例文本', 'Βძě测试数据'] }) # 直接传入DataFrame调用即可得到处理后结果 result_df = removeAccents(test_df) print(result_df)
注意事项
- 原有单字符串调用逻辑
removeAccents("待处理字符串")完全兼容,无需修改历史代码 - 采用Pandas原生向量化操作实现,比逐行apply性能高,适合大批量数据处理
- 自动跳过非字符串类型列,不会改动数字、日期、布尔值等类型的数据
内容的提问来源于stack exchange,提问作者dingaro
相关产品推荐
相关产品推荐

