使用Quanteda的textstat_simil计算语料库语义相关性的技术咨询
我来帮你把这段关于Quanteda计算语义相关性的内容整理好啦~
使用Quanteda的
textstat_simil计算文本语义相关性 我正在用Quanteda工具包中的textstat_simil函数,来计算文本语料库中的语义相关性,这个函数主要用于分析语料中特征(比如词汇)之间的相似度。
可直接运行的示例代码
下面是经过修正(补全了缺失的闭合括号)的完整可运行代码:
# compute term similarities pres_dfm <- dfm(data_corpus_inaugural, remove_punct = TRUE, remove = stopwords("english")) (s1 <- textstat_simil(pres_dfm, c("fair", "health", "terror"), method = "cosine", margin = "features")) head(as.matrix(s1, 10)) as.list(s1, n=8)
代码逻辑拆解
- 第一步:用
dfm()构建文档特征矩阵,处理的是内置的就职演说语料库,同时去除标点符号和英文停用词 - 第二步:调用
textstat_simil(),指定要分析的目标词汇为"fair", "health", "terror",采用余弦相似度(cosine)算法,基于特征维度(也就是词汇层面)计算相似度 - 结果输出:可以用
as.matrix()将结果转换为矩阵格式查看,或者用as.list()转成列表格式,指定显示前n个最相似的结果
内容的提问来源于stack exchange,提问作者Marina Santini
相关产品推荐
相关产品推荐

