求R语言中与Stata的codebook命令等价的工具及变量取值查询方法
R中替代Stata
codebook 命令的方案 在R里有不少能实现类似Stata codebook功能的工具,也有专门快速获取变量取值、编码的函数,具体如下:
1. 接近codebook的等价工具
- memisc包的
codebook()函数:这是最贴近Statacodebook的实现,可输出变量基本信息、取值分布、缺失值占比等完整汇总。用法示例:# 安装并加载包 install.packages("memisc") library(memisc) # 对目标数据框生成codebook codebook(your_dataframe) - summarytools包的
dfSummary()函数:生成的汇总信息更直观美观,支持文本、HTML等多种输出格式,包含取值频率、描述性统计量等内容:install.packages("summarytools") library(summarytools) dfSummary(your_dataframe)
2. 快速获取变量取值与编码的函数
基础R原生函数
table():直接统计变量各取值的频数,若为因子变量,会同步显示编码对应的标签:table(your_dataframe$target_var)str():查看变量结构,可快速识别变量类型,因子变量会展示其水平(编码标签)及部分样本取值:str(your_dataframe$target_var)unique():提取变量的所有唯一取值,适合快速排查变量的取值范围:unique(your_dataframe$target_var)
tidyverse生态工具
dplyr::count():按变量取值分组统计频数,可无缝结合其他数据清洗操作:library(dplyr) your_dataframe %>% count(target_var)forcats::fct_count():专为因子变量设计,统计各水平的频数,同时保留因子的编码与标签对应关系:library(forcats) fct_count(your_dataframe$target_factor_var)
内容的提问来源于stack exchange,提问作者DataDonkey
相关产品推荐
相关产品推荐

