Impala中实现prompt列与对应answer列拼接生成对话文本的异常问题排查
咱们先理清楚你的场景:你有一张Impala数据表,结构和数据如下:
| prompt | answer | step_timestamp |
|---|---|---|
| hi Lary | 2022-04-04 10:00:00 | |
| how are you? | 2022-04-04 10:02:00 | |
| how is your pet? | I am fine | 2022-04-04 10:05:00 |
| what is your hobby? | my pet is good | 2022-04-04 10:15:00 |
| ok thanks | football | 2022-04-04 10:25:00 |
你的需求是让每行的answer匹配上一行的prompt,最终拼接成连贯的对话文本,预期结果是:
hi Lary, how are you?I am fine. how is your pet?my pet is good. what is your hobby? football. ok thanks
但你写的SQL执行后出现了重复的片段,比如how is your pet?I am fine.重复出现,这显然不符合预期。
你的SQL问题分析
咱们拆解一下你原来的SQL,几个关键错误导致了异常:
Lead函数分区错误
在lead(answer) over(PARTITION BY call_id,step_timestamp order by step_timestamp asc)这里,你把step_timestamp也加入了分区。这意味着每个时间戳的行都是独立分区,lead()根本取不到下一行的answer(因为每个分区只有一行),这完全违背了你的匹配逻辑。Row_Number分区逻辑错误
ROW_NUMBER() OVER (PARTITION BY tall,call_id ORDER BY step_timestamp ASC)里,你用拼接后的tall作为分区字段,这会把相同拼接内容的行归为一组,再取rn=1,这会过滤掉正确的行,同时可能保留重复的错误片段。Group By语法问题
你的外层GROUP BY call_id,call_ani,但SELECT里并没有call_ani,这在Impala里会触发语法错误,而且完全没必要加入这个字段。
正确的Impala SQL实现方案
我们可以通过行号标记+Lead函数来精准匹配prompt和对应的answer,然后按照顺序拼接成对话。这里提供两种简洁的实现方式:
方案一:使用Lead函数直接关联匹配
WITH dialog_steps AS ( SELECT call_id, prompt, -- 取当前行的下一行answer作为匹配的内容 LEAD(answer) OVER (PARTITION BY call_id ORDER BY step_timestamp ASC) AS matched_answer, -- 标记行号和总行数,用于处理首尾行 ROW_NUMBER() OVER (PARTITION BY call_id ORDER BY step_timestamp ASC) AS rn, COUNT(*) OVER (PARTITION BY call_id) AS total_rows FROM db.table ) SELECT call_id, GROUP_CONCAT( CASE -- 第一行prompt单独加逗号分隔 WHEN rn = 1 THEN CONCAT(prompt, ', ') -- 中间行:prompt + 匹配的answer,加句号分隔 WHEN rn < total_rows AND matched_answer IS NOT NULL AND matched_answer != '' THEN CONCAT(prompt, matched_answer, '. ') -- 最后一行prompt直接保留 ELSE prompt END ORDER BY rn SEPARATOR '' ) AS dialog_text FROM dialog_steps GROUP BY call_id;
方案二:通过行号关联上下行
如果你更倾向于显式关联上下行,也可以用这种方式:
WITH numbered AS ( SELECT call_id, prompt, answer, step_timestamp, ROW_NUMBER() OVER (PARTITION BY call_id ORDER BY step_timestamp ASC) AS rn, COUNT(*) OVER (PARTITION BY call_id) AS total_rows FROM db.table ), dialog_parts AS ( -- 处理第一行prompt SELECT call_id, CONCAT(prompt, ', ') AS part, rn FROM numbered WHERE rn = 1 UNION ALL -- 关联上一行prompt和当前行answer SELECT n_prev.call_id, CONCAT(n_prev.prompt, n_curr.answer, '. ') AS part, n_prev.rn + 0.5 AS rn -- 保证排序在上下行之间 FROM numbered n_prev JOIN numbered n_curr ON n_prev.call_id = n_curr.call_id AND n_curr.rn = n_prev.rn + 1 AND n_curr.answer IS NOT NULL AND n_curr.answer != '' UNION ALL -- 处理最后一行prompt SELECT call_id, prompt AS part, total_rows + 1 AS rn FROM numbered WHERE rn = total_rows ) SELECT call_id, GROUP_CONCAT(part ORDER BY rn SEPARATOR '') AS dialog_text FROM dialog_parts GROUP BY call_id;
这两种方案都会按照你的需求,将answer匹配到上一行的prompt,拼接出连贯的对话文本,不会出现重复片段。
内容的提问来源于stack exchange,提问作者DrGenius

