Cassandra使用IN()查询带索引列失败,需Allow Filtering问题咨询
问题原因及解决办法
你遇到的问题核心在于Cassandra的查询规则和本地二级索引(LSI)的工作机制,具体原因如下:
主表存储结构的限制
你的表主键是((cid), stop_id),这意味着同一个cid分区内的行是按stop_id排序存储的,date属于非主键列,在分区内是无序分布的。当执行where cid = ? and date in (...)时,Cassandra需要扫描该cid分区内的所有行,逐一校验date是否符合条件——这种分区内全量扫描过滤的操作,Cassandra默认会阻止,因为如果分区数据量过大,会带来严重的性能开销,所以要求你添加ALLOW FILTERING来确认你知晓该风险。本地二级索引未被自动调用
你创建的LSI((cid), date)理论上可以优化这个查询,但Cassandra的查询优化器不会自动选择用它来执行聚合查询(sum(rate))。原因是这个LSI仅存储cid、date和对应的主键stop_id,要计算sum(rate),Cassandra需要先通过索引找到符合条件的stop_id,再回主表读取对应的rate值,这个过程需要额外的IO操作,优化器会默认选择主表扫描的路径,因此依然要求ALLOW FILTERING。
可行的解决办法
- 添加
ALLOW FILTERING:如果你的cid分区数据量不大,性能可以接受,直接在查询末尾加上该语句即可执行:select sum(rate) from trip_stops where cid = aa9e4310-e439-423c-86e5-53ddd7c74609 and date in ('2019-01-01', '2019-01-02') ALLOW FILTERING; - 修改表结构:把
date加入聚类列,重新设计主键为((cid), date, stop_id),这样同一个cid分区内的行按date+stop_id排序,查询时可以直接定位到指定date的行,不需要索引也不需要ALLOW FILTERING:create table trip_stops ( cid uuid, stop_id uuid, rate float, date date, primary key ((cid), date, stop_id) ); - 强制使用索引:先给索引命名,再用
USE INDEX语法明确指定查询使用该LSI:-- 给索引命名 CREATE INDEX trip_stops_cid_date_idx ON trip_stops ((cid), date); -- 查询时指定索引 select sum(rate) from trip_stops USE INDEX (trip_stops_cid_date_idx) where cid = aa9e4310-e439-423c-86e5-53ddd7c74609 and date in ('2019-01-01', '2019-01-02');
内容的提问来源于stack exchange,提问作者lkqWRHL23O
相关产品推荐
相关产品推荐

