R语言tm包stemCompletion函数词干补全异常求助
关于R语言tm包stemCompletion函数词干补全失败的问题
我在使用R语言tm包中的stemCompletion函数对词干化后的VCorpus进行词干补全时遇到问题,此前该函数可正常运行,但现在即使是过去的数据集也无法使用。
我的输入是经过预处理(tolower、removePunctuation、stripWhitespace、removeNumber、removeWords、stemDocument)的VCorpus,所有步骤均正常,直到执行stemCompletion环节。
以下是部分代码及输出:
# Load Data Data <- read.csv("AMAZON_FASHION_5.csv", header=TRUE, sep = ";", dec = ",", colClasses = "character", fill = TRUE) # View Data View(Data) Data <- data.frame(Data) # Define Corpus Data$reviewText <- iconv(Daten$reviewText, "WINDOWS-1252", sub="byte") Text <- VCorpus(VectorSource(Daten$reviewText)) writeLines(strwrap(as.character(Text[[69]])))
输出:
was terribly disappointed the pants were way too large in the legs my husband looked
like he was wearing blown up clown pants
预处理步骤(省略具体代码)
# Create a PlainTextDocument Text <- tm_map(Text, PlainTextDocument) # Create a copy of object "Text" to use later as a dictionary for stemming completion Text.copy <- Text # Stem document Text_stemmed <- tm_map(Text, stemDocument, language = "english") # Show comment Nr.69 writeLines(strwrap(as.character(Text_stemmed[[69]])))
输出:
terribl disappoint pant way larg leg husband look like wear blown clown pant
Text_comp <- stemCompletion(Text_stemmed, dictionary=Text.copy, type = "prevalent") # Show comment Nr.69 writeLines(strwrap(as.character(Text_comp[[69]])))
输出:
character(0)
执行stemCompletion后,第69条评论输出为character(0);若不执行PlainTextDocument转换,输出为69,且返回的Text_comp为字符型,无法调用meta、inspect等函数,报错提示:
Error in UseMethod("meta", x) : no applicable method for 'meta' applied to an object of class "character"
我还尝试了Zhao提出的改进stemCompletion方法,但仍未得到预期结果。恳请各位帮忙排查问题原因。
内容的提问来源于stack exchange,提问作者d4rkneo
相关产品推荐
相关产品推荐

