筛选数据后Groupby仍统计原DataFrame中已删除股票代码问题求助
问题解决:Groupby计算ATR时出现无关Symbol空值
问题场景
拥有2016-2022年大规模股票分钟数据DataFrame,筛选2020年1月1日至12日的子集后,按symbol分组计算ATR指标时,结果Series中出现原DataFrame存在但子集内无数据的Symbol(如AACI),对应值为空,导致Series长度与子集不符,无法开展后续分析。
核心原因
- 部分Symbol在筛选后的子集中数据量不足ATR计算所需的周期(21),
ta.atr返回全空Series,最终被保留在结果中 - 日期筛选逻辑可能存在漏洞,导致无关Symbol的行未被完全过滤
解决方法
1. 验证筛选结果准确性
先确认子集是否真的不包含多余Symbol,排查日期筛选是否正确:
# 查看筛选后存在的所有Symbol print(df['symbol'].unique()) # 确认筛选后的日期范围是否符合预期 print(f"筛选后日期范围:{df['date'].min()} 至 {df['date'].max()}")
若发现日期筛选错误,需检查timestamp的时区处理,确保dt.date转换正确:
# 若timestamp带时区,先统一转换为UTC或本地时区 df['timestamp'] = df['timestamp'].dt.tz_convert('UTC') df['date'] = df['timestamp'].dt.date
2. 过滤空值结果
计算ATR后直接删除空值行,只保留有效Symbol的指标数据:
file_loc = 'Data\minute_data_2016-22_grp_.feather' df = pd.read_feather(file_loc) df['date'] = df['timestamp'].dt.date start = datetime.strptime("2020-01-01", '%Y-%m-%d').date() end = datetime.strptime("2020-01-12", '%Y-%m-%d').date() df = df.loc[(df['date'] >= start) & (df['date'] <= end)] df.reset_index(inplace=True, drop=True) # 计算ATR并过滤空值行 atr = df.groupby(['symbol']).apply(lambda x: ta.atr(x.high, x.low, x.close, 21)).reset_index(0,drop=True).rename('ATRr_21') atr = atr.dropna()
3. 提前过滤数据量不足的分组
在分组计算前,先筛选出数据量满足ATR周期要求的Symbol,从源头避免空值生成:
file_loc = 'Data\minute_data_2016-22_grp_.feather' df = pd.read_feather(file_loc) df['date'] = df['timestamp'].dt.date start = datetime.strptime("2020-01-01", '%Y-%m-%d').date() end = datetime.strptime("2020-01-12", '%Y-%m-%d').date() df = df.loc[(df['date'] >= start) & (df['date'] <= end)] df.reset_index(inplace=True, drop=True) # 筛选出数据量≥21的Symbol,再过滤原DataFrame valid_symbols = df.groupby('symbol').filter(lambda x: len(x) >=21)['symbol'].unique() df = df[df['symbol'].isin(valid_symbols)] # 计算ATR atr = df.groupby(['symbol']).apply(lambda x: ta.atr(x.high, x.low, x.close, 21)).reset_index(0,drop=True).rename('ATRr_21')
内容的提问来源于stack exchange,提问作者Tate
相关产品推荐
相关产品推荐

