You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言如何统计数据框单元格内逗号分隔的双词物种学名的出现频次

解决方案

你可以直接使用tidyr的separate_rows拆分物种列后统计,完全不需要调用文本挖掘相关包,逻辑更简单:

  1. 加载依赖包
library(dplyr)
library(tidyr)
  1. 数据处理代码
result <- df1 %>%
  # 按`, `分割单个单元格内的多个物种,拆分为独立行
  separate_rows(Spp, sep = ", ") %>%
  # 按物种名分组统计出现频次
  count(Spp, name = "Freq") %>%
  # 按频次降序排列,匹配你需要的输出顺序
  arrange(desc(Freq))
  1. 输出结果
    打印result即可得到你要求的格式:
# A tibble: 3 × 2
  Spp              Freq
  <chr>           <int>
1 Genus1 species1     3
2 Genus1 species2     2
3 Genus2 species1     1

如果你坚持要用语料库方案实现,需要自定义词典,将所有完整的Genus species学名加入分词词典,避免被拆分为单个单词,不过对这种结构化的逗号分隔数据来说没必要用该方案。


内容的提问来源于stack exchange,提问作者tassones

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 03:06:03