You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用正则从聊天记录字符串中提取指定范围的用户名?

正确实现代码

直接使用带负向预查逻辑的正则匹配即可,完整代码如下:

import re

s = "(2021-07-29 01:00:00 AM BST)  \n---  \npeter.j.matthew has joined the conversation  \n\n  \n(2021-07-29 01:00:00 AM BST)  \n---  \njohn cheung has joined the conversation  \n\n  \n\n(2021-07-29 01:11:19 AM BST)  \n---  \nallen.p.jonas  \nHi, james  \n\n  \n(2021-07-30 12:51:16 AM BST)  \n---  \nkarren wenda  \nhow're you ? \n\n  \n\n---  \n\n* * *"

# 匹配分隔线后的用户名,排除入会通知条目
names_list = re.findall(r'---\s*\n([^\n]+)\n(?!\s*has joined the conversation)', s, re.DOTALL)
print(names_list)

运行输出结果:

['allen.p.jonas', 'karren wenda']
正则逻辑说明
  • ---\s*\n:匹配块分隔线---及后续的空白、换行符
  • ([^\n]+):捕获分隔线后第一行的完整内容,即为用户名
  • (?!\s*has joined the conversation):负向预查规则,过滤掉后续带入会标记的条目
  • re.DOTALL:让.符号可以匹配换行符,确保负向预查可以跨换行校验内容
原有正则错误原因
  1. 没有加入入会消息的过滤逻辑,无法自动排除入会通知条目
  2. \D+规则会匹配所有非数字内容,会把后续发言内容也纳入匹配结果,无法准确定位用户名
  3. 手动指定的空格、[\S\n]类匹配规则适配性差,无法兼容字符串里的换行、空白差异

内容的提问来源于stack exchange,提问作者new_learner

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 09:06:05