You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将PDF提取的新闻稿列表转为含ID、日期、文本的R数据框

把OTS新闻稿列表转为结构化数据框的R方案
  • 先将str_extract_all返回的嵌套列表扁平化,得到单条新闻稿的向量:
# 替换成你实际存储提取结果的列表对象名
news_raw <- unlist(your_extracted_list)
  • 用正则分组匹配拆分字段:
    借助stringr包的str_match,一次性捕获OTS编号、正文、日期三个部分:
library(stringr)

# 正则分组分别对应id、正文、日期
match_result <- str_match(news_raw, "(OTS\\d{4})([\\s\\S]*?)(\\d{6} [A-Za-z]{3} \\d{2})")

# 转换为数据框并命名字段
news_df <- data.frame(
  id = match_result[,2],
  date = match_result[,4],
  text = match_result[,3],
  stringsAsFactors = FALSE
)
  • 可选的清洗优化:
    • 清理正文里的多余换行和空格:
    news_df$text <- str_squish(news_df$text)
    
    • 把日期转为标准日期格式(根据实际日期格式调整format参数):
    # 示例:适配"150324 MAR 24"这类格式的日期转换
    news_df$date <- as.Date(news_df$date, format = "%d%m%y %b %y")
    

内容的提问来源于stack exchange,提问作者feder80

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.24 15:24:24