You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言tm包stemCompletion函数词干补全异常求助

关于R语言tm包stemCompletion函数词干补全失败的问题

我在使用R语言tm包中的stemCompletion函数对词干化后的VCorpus进行词干补全时遇到问题,此前该函数可正常运行,但现在即使是过去的数据集也无法使用。

我的输入是经过预处理(tolower、removePunctuation、stripWhitespace、removeNumber、removeWords、stemDocument)的VCorpus,所有步骤均正常,直到执行stemCompletion环节。

以下是部分代码及输出:

# Load Data
Data <- read.csv("AMAZON_FASHION_5.csv", header=TRUE, sep = ";", dec = ",", colClasses = "character", fill = TRUE)

# View Data
View(Data)

Data <- data.frame(Data)

# Define Corpus
Data$reviewText <- iconv(Daten$reviewText, "WINDOWS-1252", sub="byte")
Text <- VCorpus(VectorSource(Daten$reviewText))
writeLines(strwrap(as.character(Text[[69]])))

输出:
was terribly disappointed the pants were way too large in the legs my husband looked
like he was wearing blown up clown pants

预处理步骤(省略具体代码)

# Create a PlainTextDocument
Text <- tm_map(Text, PlainTextDocument)

# Create a copy of object "Text" to use later as a dictionary for stemming completion
Text.copy <- Text

# Stem document 
Text_stemmed <- tm_map(Text, stemDocument, language = "english")

# Show comment Nr.69
writeLines(strwrap(as.character(Text_stemmed[[69]])))

输出:
terribl disappoint pant way larg leg husband look like wear blown clown pant

Text_comp <- stemCompletion(Text_stemmed, dictionary=Text.copy, type = "prevalent")
# Show comment Nr.69
writeLines(strwrap(as.character(Text_comp[[69]])))

输出:
character(0)

执行stemCompletion后,第69条评论输出为character(0);若不执行PlainTextDocument转换,输出为69,且返回的Text_comp为字符型,无法调用meta、inspect等函数,报错提示:

Error in UseMethod("meta", x) : 
  no applicable method for 'meta' applied to an object of class "character"

我还尝试了Zhao提出的改进stemCompletion方法,但仍未得到预期结果。恳请各位帮忙排查问题原因。


内容的提问来源于stack exchange,提问作者d4rkneo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 14:45:26