基于TMDb电影数据集的探索性数据分析(EDA)可视化优化技术求助
基于TMDb电影数据集的探索性数据分析(EDA)可视化优化技术求助
我正在英国的大学读硕士,毕业论文的Python项目用到了Kaggle上的TMDb电影数据集(包含93万+条电影数据,有标题、预算、票房、类型、热度、评论、关键词等字段)。
更新说明:数据清洗已经搞定了,但现在卡在探索性数据分析(EDA)的可视化环节——这个504MB的大内存数据集,直接生成的图表完全没法看!我对Python的matplotlib和seaborn很熟悉,之前用这段代码画类型的计数图:
plt.figure(figsize=(20,16)) sns.countplot(x = 'Genres', data=df2) plt.xlabel('Genres', fontsize=14) plt.ylabel('Frequency', fontsize=14) plt.show()
结果出来的图是这样的:
有没有大佬能教教我怎么针对这个数据集的不同部分,生成清晰简洁的单变量、双变量和多变量可视化图表?比如我想做这些分析的可视化:
- 按数量统计最热门的电影类型/制作公司
- 票房、预算、热度TOP的电影
- 出品/发行电影最多的国家
还有其他相关的可视化技巧也可以!麻烦大家了,非常感谢!
备注:内容来源于stack exchange,提问作者Nike Cage 675
相关产品推荐
相关产品推荐

