You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何拆分DataFrame多值genre列并绘制电影类型频次柱状图

电影类型拆分统计实现方案

两种处理路径均可实现需求,日常分析场景下优先选择DataFrame阶段处理,无需适配不同SQL方言差异,调试和后续可视化调整更灵活。

DataFrame阶段拆分(Python pandas 实现)

  • 核心逻辑:先按分隔符拆分多值字符串为列表,再将列表展开为独立行,最后做频次统计与绘图
  • 完整可运行代码:
import pandas as pd
import matplotlib.pyplot as plt

# df 为你通过SQL查询得到的原始DataFrame
# 拆分多类型字段并展开为独立行,拆分时直接去除分隔符前后空格,避免类型名重复
genre_df = df.assign(
    genre = df['genre'].str.split(', ')
).explode('genre')

# 统计各类型出现频次
genre_stats = genre_df['genre'].value_counts().reset_index()
genre_stats.columns = ['movie_genre', 'frequency']

# 绘制柱状图
plt.figure(figsize=(12, 6))
plt.bar(genre_stats['movie_genre'], genre_stats['frequency'])
plt.xticks(rotation=45, ha='right')
plt.xlabel('电影类型')
plt.ylabel('出现频次')
plt.title('各类型电影出现频次统计')
plt.tight_layout()
plt.show()

SQL阶段拆分(MySQL 8.0+ 实现)

如果需要直接从数据库层输出拆分后的统计结果,可以用递归CTE完成字符串拆分,示例代码如下:

WITH RECURSIVE genre_cte AS (
    SELECT
        -- 提取第一条类型值
        TRIM(SUBSTRING_INDEX(genre, ',', 1)) AS single_genre,
        -- 记录拆分后剩余的字符串
        TRIM(SUBSTRING(genre, LENGTH(SUBSTRING_INDEX(genre, ',', 1)) + 2)) AS rest_str
    FROM your_movie_table
    UNION ALL
    SELECT
        TRIM(SUBSTRING_INDEX(rest_str, ',', 1)) AS single_genre,
        TRIM(SUBSTRING(rest_str, LENGTH(SUBSTRING_INDEX(rest_str, ',', 1)) + 2)) AS rest_str
    FROM genre_cte
    WHERE rest_str != ''
)
-- 聚合统计各类型频次
SELECT single_genre, COUNT(*) AS count
FROM genre_cte
GROUP BY single_genre
ORDER BY count DESC;

注意:不同SQL方言的字符串拆分语法差异较大,PostgreSQL可以直接用unnest(string_to_array(genre, ', '))实现拆分,Spark SQL用explode(split(genre, ', ')),跨数据库迁移时需要调整语法。

内容的提问来源于stack exchange,提问作者Alejandro Harrison

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 21:12:19