如何修改R代码抓取含表情符号的Twitter推文用于情感分析?
仅抓取含表情符号的Twitter推文的R代码修改方案
核心思路
要自动筛选出包含表情符号的推文,需借助正则表达式匹配Unicode表情符号范围,先抓取足够多的候选推文,再过滤出符合要求的内容,最终提取100条满足「含表情+文本」条件的结果。
修改后的完整代码
get_token() # 连接Twitter API # 先抓取500条含"uber"关键词的英文候选推文(避免直接抓100条不够筛选) Uber_candidates <- search_tweets("uber", n = 500, lang = "en") # 定义匹配主流Unicode表情符号的正则表达式 emoji_regex <- "[\U0001F600-\U0001F64F\U0001F300-\U0001F5FF\U0001F680-\U0001F6FF\U0001F1E0-\U0001F1FF\U00002500-\U00002BEF\U00002702-\U000027B0\U0001F900-\U0001F9FF\U0001FA70-\U0001FAFF]" # 筛选:包含表情符号 + 文本内容非空 Uber_with_emojis <- Uber_candidates[grepl(emoji_regex, Uber_candidates$text) & nchar(Uber_candidates$text) > 0, ] # 提取前100条符合要求的推文 Uber_final <- head(Uber_with_emojis, 100)
关键说明
- 扩大候选抓取量:设置
n=500是因为直接抓取100条可能无法凑齐足够的带表情推文,先抓更多候选再筛选更稳妥 - 表情正则覆盖:正则表达式包含了笑脸、手势、食物、旗帜、符号等绝大多数常见表情符号的Unicode范围
- 双重筛选:同时校验"含表情"和"文本非空",确保每条结果都符合你需要的格式
内容的提问来源于stack exchange,提问作者M. Talha Bin Asif
相关产品推荐
相关产品推荐

