You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

利用正则清理DataFrame冗余文本,处理多格式日期遇阻求助

处理含冗余文本的多格式日期DataFrame方案

方案1:优化正则匹配,精准提取日期模式

如果之前的正则未覆盖全常见日期格式,可以扩展表达式匹配多模式(年-月-日、年/月/日、中文年月日等),提取后统一格式。

示例代码:

import pandas as pd
import re

# 模拟原始数据
df = pd.DataFrame({
    'raw_date': [
        "2023年10月5日 订单创建",
        "Created on 05/10/2023",
        "2023-10-05 下午3点",
        "日期:2023.10.05",
        "2023/10/05 付款完成",
        "生成于 2023-10-05"
    ]
})

# 覆盖多格式的正则表达式
date_pattern = r'(\d{4}[-/.年]\d{1,2}[-/.月]\d{1,2}日?|\d{1,2}[-/.]\d{1,2}[-/.]\d{4})'

def extract_date(text):
    match = re.search(date_pattern, str(text))
    if match:
        raw_match = match.group(1)
        # 统一转换为YYYY-MM-DD格式
        if '年' in raw_match:
            return raw_match.replace('年', '-').replace('月', '-').replace('日', '')
        else:
            parts = re.split('[-/.]', raw_match)
            if raw_match[-4:].isdigit():
                return f"{parts[2]}-{parts[1].zfill(2)}-{parts[0].zfill(2)}"
            else:
                return raw_match.replace('/', '-').replace('.', '-')
    return None

df['cleaned_date'] = df['raw_date'].apply(extract_date)
print(df)

方案2:结合文本清理+自动日期解析

先用简单正则移除非日期相关冗余字符,再用dateutil.parser自动识别格式,最后统一输出。

示例代码:

import pandas as pd
from dateutil import parser
import re

df = pd.DataFrame({
    'raw_date': [
        "2023年10月5日 订单创建",
        "Created on 05/10/2023",
        "2023-10-05 下午3点",
        "日期:2023.10.05",
        "2023/10/05 付款完成",
        "生成于 2023-10-05"
    ]
})

# 移除非日期相关字符
def clean_text(text):
    return re.sub(r'[^\d\-/.年日月]', '', str(text))

df['cleaned_text'] = df['raw_date'].apply(clean_text)

# 解析并统一日期格式
def parse_date(text):
    try:
        text = text.replace('年', '-').replace('月', '-').replace('日', '')
        dt = parser.parse(text)
        return dt.strftime('%Y-%m-%d')
    except:
        return None

df['final_date'] = df['cleaned_text'].apply(parse_date)
print(df)

方案3:分格式针对性处理

如果已知数据中存在固定的几种日期格式,可以分情况匹配,避免复杂正则的误匹配问题。

示例代码:

import pandas as pd
import re

df = pd.DataFrame({
    'raw_date': [
        "2023年10月5日 订单创建",
        "Created on 05/10/2023",
        "2023-10-05 下午3点",
        "日期:2023.10.05",
        "2023/10/05 付款完成",
        "生成于 2023-10-05"
    ]
})

def process_date(text):
    text = str(text)
    # 匹配中文年月日
    cn_match = re.search(r'(\d{4})年(\d{1,2})月(\d{1,2})日', text)
    if cn_match:
        return f"{cn_match.group(1)}-{cn_match.group(2).zfill(2)}-{cn_match.group(3).zfill(2)}"
    # 匹配YYYY-MM/./DD格式
    ymd_match = re.search(r'(\d{4})[-/.](\d{1,2})[-/.](\d{1,2})', text)
    if ymd_match:
        return f"{ymd_match.group(1)}-{ymd_match.group(2).zfill(2)}-{ymd_match.group(3).zfill(2)}"
    # 匹配MM/DD/YYYY格式
    mdY_match = re.search(r'(\d{1,2})[-/.](\d{1,2})[-/.](\d{4})', text)
    if mdY_match:
        return f"{mdY_match.group(3)}-{mdY_match.group(1).zfill(2)}-{mdY_match.group(2).zfill(2)}"
    return None

df['processed_date'] = df['raw_date'].apply(process_date)
print(df)

额外验证技巧

可以用pd.to_datetime过滤无效日期:

df['valid_date'] = pd.to_datetime(df['processed_date'], errors='coerce')

内容的提问来源于stack exchange,提问作者Romi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.05 15:35:20