使用tidytext对古腾堡项目弗洛伊德著作做情感分析的技术问询
弗洛伊德著作文本挖掘与情感分析实现
我看你正在基于古腾堡项目的弗洛伊德著作做文本挖掘和情感分析,这段代码的逻辑很扎实,我帮你整理成规范格式,同时拆解下关键环节:
# 加载所需R包 library(dplyr) library(tidytext) library(gutenbergr) # 从古腾堡项目下载指定的弗洛伊德著作,同时获取标题元数据 freud_books <- gutenberg_download( c(14969, 15489, 34300, 35875, 35877, 38219, 41214), meta_fields = "title" ) # 将文本转换为tidy格式(分词处理) tidy_books <- freud_books %>% unnest_tokens(word, text) # 结合Bing情感词典,按书籍标题和每80行的索引统计情感词数量 f_sentiment <- tidy_books %>% inner_join(get_sentiments("bing"), by = "word") %>% count(title, index = line %/% 80, sentiment)
关键步骤说明:
- 包加载:
dplyr负责数据清洗与转换,tidytext提供文本挖掘的tidy工具集,gutenbergr是直接从古腾堡项目获取公共领域书籍的便捷接口 - 书籍下载:通过书籍的古腾堡ID列表批量获取弗洛伊德著作,
meta_fields = "title"确保我们能关联每段文本对应的书籍名称 - 文本分词:
unnest_tokens把原始长文本拆分成单个词汇,转换成适合后续分析的tidy数据结构 - 情感统计:使用经典的Bing情感词典(区分正面/负面情感),并以每80行为一个分析窗口(
index = line %/% 80),统计不同书籍、不同窗口下的情感词数量,方便后续观察情感趋势
内容的提问来源于stack exchange,提问作者Ricardo Silva
相关产品推荐
相关产品推荐

