You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python实现从字符串列表提取话题标签并保留空项

提取推文中的话题标签(Python新手友好方案)

嘿,作为Python新手完全不用慌,这个需求其实挺典型的,咱们简单几步就能搞定!

首先,核心思路是用正则表达式精准匹配推文中的话题标签——毕竟话题标签都是以#开头的,规则很明确。下面直接上可运行的代码,我会一步步给你解释:

import re

def extract_hashtags(tweet):
    # 匹配所有以#开头的话题标签(支持字母、数字、下划线,符合常见格式)
    return re.findall(r'#\w+', tweet)

# 你的示例推文数据
sample_tweets = ["This is a string that needs processing #ugh #yikes", "this string doesn't have hashtags", "this is another one #hooray"]

# 生成对应话题标签列表
result = [extract_hashtags(tweet) for tweet in sample_tweets]

print(result)

代码解释:

  • re.findall(r'#\w+', tweet):这个正则表达式会扫描整条推文,找出所有以#开头、后面跟着一个或多个字母/数字/下划线的内容,正好对应标准的话题标签格式。
  • 列表推导式[extract_hashtags(tweet) for tweet in sample_tweets]:遍历你的推文列表,给每条推文调用提取函数,自动生成对应的结果列表——没有话题标签的推文自然返回空列表,完全符合你要和原数据关联的需求。

运行这段代码后,输出就是你想要的:

[['#ugh', '#yikes'], [], ['#hooray']]

小补充:

如果你的实际数据里有带特殊字符的话题标签(比如#hello-world这种带连字符的),可以把正则改成r'#\S+',这样会匹配所有#开头且后面不跟空格的内容,兼容性更广~

内容的提问来源于stack exchange,提问作者lespaul

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 08:57:51