SQL Server中两个查询的差异解析:为何Group by结果行数更少?
两个SQL查询的差异分析及结果行数不同的原因
先把两个查询贴出来方便对比:
查询1:
SELECT distinct(Invalid_Emails), [leads_id] FROM [dbo].[InvalidEmails_stg] ORDER BY LEADS_ID DESC
查询2:
select invalid_emails, max(leads_id) as id from invalidEmails_stg group by invalid_emails having count(*) < 2 order by id desc
核心差异点
数据筛选逻辑完全不同
- 查询1的
distinct(Invalid_Emails)是个容易混淆的写法——SQL里的DISTINCT是作用在所有选中字段的组合上,不是只针对括号里的Invalid_Emails。它的实际效果是返回Invalid_Emails和leads_id的所有唯一组合,不管某个邮箱在表中出现多少次。哪怕同一个邮箱对应10个不同的leads_id,这10个组合都会被保留。 - 查询2是按
Invalid_Emails分组,然后通过having count(*) < 2只保留那些在表中仅出现过1次的邮箱。每个符合条件的邮箱只会返回一行(因为分组后每组一行),直接排除了所有出现2次及以上的邮箱。
- 查询1的
返回结果的范围差异
- 查询1的结果集包含所有邮箱与线索ID的唯一配对,覆盖了所有出现过的邮箱(不管出现次数)。
- 查询2的结果集只包含“仅出现一次”的邮箱,相当于从查询1的结果里剔除了那些对应多个线索ID的邮箱(以及它们的所有行),所以行数必然更少。
字段处理与排序细节
- 查询1直接返回原始的
leads_id,并按这个字段降序排序。 - 查询2对每个分组取
max(leads_id)并命名为id(对于仅出现一次的邮箱来说,这个值和原始leads_id一致,但逻辑上是分组聚合后的结果),然后按这个别名排序。
- 查询1直接返回原始的
为什么第二个查询行数更少?
简单来说,查询2多了一层关键过滤:having count(*) < 2。这个条件会把所有在表中出现2次及以上的Invalid_Emails全部排除,而查询1并没有这个限制——哪怕一个邮箱对应多个leads_id,只要每个组合唯一就会被保留。所以查询2的结果是查询1结果的一个子集,行数自然更少。
内容的提问来源于stack exchange,提问作者MCO
相关产品推荐
相关产品推荐

