You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Quanteda的textstat_simil计算语料库语义相关性的技术咨询

我来帮你把这段关于Quanteda计算语义相关性的内容整理好啦~

使用Quanteda的textstat_simil计算文本语义相关性

我正在用Quanteda工具包中的textstat_simil函数,来计算文本语料库中的语义相关性,这个函数主要用于分析语料中特征(比如词汇)之间的相似度。

可直接运行的示例代码

下面是经过修正(补全了缺失的闭合括号)的完整可运行代码:

# compute term similarities
pres_dfm <- dfm(data_corpus_inaugural, remove_punct = TRUE, remove = stopwords("english"))
(s1 <- textstat_simil(pres_dfm, c("fair", "health", "terror"), method = "cosine", margin = "features"))
head(as.matrix(s1, 10))
as.list(s1, n=8)

代码逻辑拆解

  • 第一步:用dfm()构建文档特征矩阵,处理的是内置的就职演说语料库,同时去除标点符号和英文停用词
  • 第二步:调用textstat_simil(),指定要分析的目标词汇为"fair", "health", "terror",采用余弦相似度(cosine)算法,基于特征维度(也就是词汇层面)计算相似度
  • 结果输出:可以用as.matrix()将结果转换为矩阵格式查看,或者用as.list()转成列表格式,指定显示前n个最相似的结果

内容的提问来源于stack exchange,提问作者Marina Santini

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 08:22:44