如何将PDF提取的新闻稿列表转为含ID、日期、文本的R数据框
把OTS新闻稿列表转为结构化数据框的R方案
- 先将
str_extract_all返回的嵌套列表扁平化,得到单条新闻稿的向量:
# 替换成你实际存储提取结果的列表对象名 news_raw <- unlist(your_extracted_list)
- 用正则分组匹配拆分字段:
借助stringr包的str_match,一次性捕获OTS编号、正文、日期三个部分:
library(stringr) # 正则分组分别对应id、正文、日期 match_result <- str_match(news_raw, "(OTS\\d{4})([\\s\\S]*?)(\\d{6} [A-Za-z]{3} \\d{2})") # 转换为数据框并命名字段 news_df <- data.frame( id = match_result[,2], date = match_result[,4], text = match_result[,3], stringsAsFactors = FALSE )
- 可选的清洗优化:
- 清理正文里的多余换行和空格:
news_df$text <- str_squish(news_df$text)- 把日期转为标准日期格式(根据实际日期格式调整
format参数):
# 示例:适配"150324 MAR 24"这类格式的日期转换 news_df$date <- as.Date(news_df$date, format = "%d%m%y %b %y")
内容的提问来源于stack exchange,提问作者feder80
相关产品推荐
相关产品推荐

