You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

SQL Server中两个查询的差异解析:为何Group by结果行数更少?

两个SQL查询的差异分析及结果行数不同的原因

先把两个查询贴出来方便对比:

查询1:

SELECT distinct(Invalid_Emails), [leads_id] FROM [dbo].[InvalidEmails_stg] ORDER BY LEADS_ID DESC

查询2:

select invalid_emails, max(leads_id) as id from invalidEmails_stg group by invalid_emails having count(*) < 2 order by id desc

核心差异点

  • 数据筛选逻辑完全不同

    • 查询1的distinct(Invalid_Emails)是个容易混淆的写法——SQL里的DISTINCT是作用在所有选中字段的组合上,不是只针对括号里的Invalid_Emails。它的实际效果是返回Invalid_Emails和leads_id的所有唯一组合,不管某个邮箱在表中出现多少次。哪怕同一个邮箱对应10个不同的leads_id,这10个组合都会被保留。
    • 查询2是按Invalid_Emails分组,然后通过having count(*) < 2只保留那些在表中仅出现过1次的邮箱。每个符合条件的邮箱只会返回一行(因为分组后每组一行),直接排除了所有出现2次及以上的邮箱。
  • 返回结果的范围差异

    • 查询1的结果集包含所有邮箱与线索ID的唯一配对,覆盖了所有出现过的邮箱(不管出现次数)。
    • 查询2的结果集只包含“仅出现一次”的邮箱,相当于从查询1的结果里剔除了那些对应多个线索ID的邮箱(以及它们的所有行),所以行数必然更少。
  • 字段处理与排序细节

    • 查询1直接返回原始的leads_id,并按这个字段降序排序。
    • 查询2对每个分组取max(leads_id)并命名为id(对于仅出现一次的邮箱来说,这个值和原始leads_id一致,但逻辑上是分组聚合后的结果),然后按这个别名排序。

为什么第二个查询行数更少?

简单来说,查询2多了一层关键过滤:having count(*) < 2。这个条件会把所有在表中出现2次及以上的Invalid_Emails全部排除,而查询1并没有这个限制——哪怕一个邮箱对应多个leads_id,只要每个组合唯一就会被保留。所以查询2的结果是查询1结果的一个子集,行数自然更少。

内容的提问来源于stack exchange,提问作者MCO

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.14 08:31:01