R语言如何统计数据框单元格内逗号分隔的双词物种学名的出现频次
解决方案
你可以直接使用tidyr的separate_rows拆分物种列后统计,完全不需要调用文本挖掘相关包,逻辑更简单:
- 加载依赖包
library(dplyr) library(tidyr)
- 数据处理代码
result <- df1 %>% # 按`, `分割单个单元格内的多个物种,拆分为独立行 separate_rows(Spp, sep = ", ") %>% # 按物种名分组统计出现频次 count(Spp, name = "Freq") %>% # 按频次降序排列,匹配你需要的输出顺序 arrange(desc(Freq))
- 输出结果
打印result即可得到你要求的格式:
# A tibble: 3 × 2 Spp Freq <chr> <int> 1 Genus1 species1 3 2 Genus1 species2 2 3 Genus2 species1 1
如果你坚持要用语料库方案实现,需要自定义词典,将所有完整的Genus species学名加入分词词典,避免被拆分为单个单词,不过对这种结构化的逗号分隔数据来说没必要用该方案。
内容的提问来源于stack exchange,提问作者tassones
相关产品推荐
相关产品推荐

