You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python DataFrame:如何为重复VideoID存储多组viewerCount为字典/序列?

嘿,这个需求很常见,尤其是处理时序性的直播数据时,我来给你几个实用的解决方案!

首先先还原你的初始DataFrame,方便后续演示:

import pandas as pd

# 模拟你提供的初始数据
data = [
    {"VideoID": 123, "long": -1.1, "lat": 1.1, "viewerCount": 25},
    {"VideoID": 123, "long": -1.1, "lat": 1.1, "viewerCount": 20}
]
df = pd.DataFrame(data)
1. 基础方案:将viewerCount聚合为列表

最直接的方式是通过groupby按VideoID + 经纬度分组(因为同一直播的经纬度应该不会变化,一起分组能保证行的唯一性),然后把每组的viewerCount收集成列表:

# 聚合后的DataFrame,每行对应唯一的VideoID
aggregated_df = df.groupby(['VideoID', 'long', 'lat'], as_index=False).agg(
    viewer_counts=('viewerCount', list)
)

运行后得到的结果是:

VideoIDlonglatviewer_counts
123-1.11.1[25, 20]

这样就实现了不重复存储VideoID,同时把所有观看次数按时间顺序(因为你是每30秒新增数据,所以列表里的顺序就是数据采集的顺序)保存下来。

2. 进阶方案:存储为时间-观看次数的字典

如果后续需要追溯每次刷新的时间,建议给每条数据加上时间戳,然后把观看次数和时间对应成字典,这样查询更直观:

# 模拟带时间戳的新增数据
data_with_time = [
    {"VideoID": 123, "long": -1.1, "lat": 1.1, "viewerCount": 25, "timestamp": "2024-05-20 10:00:00"},
    {"VideoID": 123, "long": -1.1, "lat": 1.1, "viewerCount": 20, "timestamp": "2024-05-20 10:00:30"}
]
df_with_time = pd.DataFrame(data_with_time)

# 聚合为{时间: 观看次数}的字典结构
aggregated_with_dict = df_with_time.groupby(['VideoID', 'long', 'lat'], as_index=False).agg(
    viewer_history=('viewerCount', lambda x: dict(zip(df_with_time.loc[x.index, 'timestamp'], x)))
)

得到的结果里viewer_history列会是:{"2024-05-20 10:00:00":25, "2024-05-20 10:00:30":20},非常适合后续做时序分析。

3. 处理每30秒的新增数据

你需要每30秒刷新并新增数据,这里有两种高效的处理方式:

方式一:合并后重新聚合(适合数据量不大的场景)

每次拿到新数据后,先和原数据合并,再重新执行聚合操作,简单省心:

# 模拟新获取的30秒后的数据
new_data = [{"VideoID": 123, "long": -1.1, "lat": 1.1, "viewerCount": 30}]
df_new = pd.DataFrame(new_data)

# 合并新旧数据
df = pd.concat([df, df_new], ignore_index=True)

# 重新聚合得到最新结果
aggregated_df = df.groupby(['VideoID', 'long', 'lat'], as_index=False).agg(
    viewer_counts=('viewerCount', list)
)

方式二:直接更新已有行(适合数据量大的场景)

如果数据量很大,重新聚合效率不高,可以直接找到对应VideoID的行,追加新的观看次数;如果是新的VideoID,直接新增一行:

# 假设新数据的信息
new_video_id = 123
new_long = -1.1
new_lat = 1.1
new_viewer_count = 30

# 判断VideoID是否已存在
if new_video_id in aggregated_df['VideoID'].values:
    # 找到对应行并追加观看次数
    row_idx = aggregated_df[aggregated_df['VideoID'] == new_video_id].index[0]
    aggregated_df.loc[row_idx, 'viewer_counts'].append(new_viewer_count)
else:
    # 新增一行数据
    new_row = pd.DataFrame({
        'VideoID': [new_video_id],
        'long': [new_long],
        'lat': [new_lat],
        'viewer_counts': [[new_viewer_count]]
    })
    aggregated_df = pd.concat([aggregated_df, new_row], ignore_index=True)

内容的提问来源于stack exchange,提问作者Shaikh Batmann

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 08:38:32