You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

图像叠加注意力权重显示异常的技术问题排查请求

图像注意力权重叠加可视化问题排查

用户代码

h = 16
fig, ax = plt.subplots(ncols=3, nrows=1, figsize=(15, 5))

for i, q_id in enumerate(sorted_indices[0]):
    logit = itm_logit[:, q_id, :]
    prob = torch.nn.functional.softmax(logit, dim=1)
    name = f'{prob[0, 1]:.3f}_query_id_{q_id}'
    
    # Attention map
    attention_map = avg_cross_att[0, q_id, :-1].view(h, h).detach().cpu().numpy()
    
    # Image
    raw_image_resized = raw_image.resize((596, 596))
    
    ax[0].set_title(name)
    ax[0].imshow(attention_map, cmap='viridis')
    ax[0].axis('off')
    
    ax[1].set_title(caption)
    ax[1].imshow(raw_image_resized)
    ax[1].axis('off')
    

    ax[2].set_title(f'Overlay: {name}')
    ax[2].imshow(raw_image_resized)
    ax[2].imshow(attention_map, cmap='viridis', alpha=0.6)  
    ax[2].axis('off')
    

    ax[0].set_aspect('equal')
    ax[1].set_aspect('equal')
    ax[2].set_aspect('equal')
    
    plt.tight_layout()
    plt.savefig(f"./att_maps/{name}.jpg")
    plt.show()
    break

问题描述

尝试在第三个坐标轴上将注意力权重叠加在图像上方,观察注意力聚焦区域,但运行代码后仅实现简单重叠,达不到预期的精准叠加可视化效果。

问题原因及解决建议

  • 尺寸不匹配导致错位:你的注意力图是16×16的小尺寸,而图像被resize到596×596,直接叠加时Matplotlib会把小尺寸的注意力图拉伸填充整个坐标轴,导致注意力权重和图像的像素区域完全不对应,看起来就是模糊色块重叠。
    解决:把注意力图resize到和图像相同的尺寸,确保每个注意力权重对应到图像的对应区域。示例代码:

    from skimage.transform import resize
    # 将注意力图缩放至图像尺寸,保留注意力分布的空间对应关系
    attention_map_resized = resize(attention_map, (596, 596), mode='reflect', anti_aliasing=True)
    # 之后用这个缩放后的图进行叠加
    ax[2].imshow(raw_image_resized)
    ax[2].imshow(attention_map_resized, cmap='viridis', alpha=0.6)
    
  • 注意力图未做归一化处理:如果注意力权重的数值范围不在0-1之间,或者分布过于集中,叠加后要么几乎看不到注意力效果,要么局部过亮无法区分细节。
    解决:对注意力图做归一化,将数值映射到0-1区间:

    # 归一化注意力图
    attention_map = (attention_map - attention_map.min()) / (attention_map.max() - attention_map.min())
    
  • 插值方式导致细节丢失:小尺寸注意力图放大时,默认的插值方式可能会让注意力分布变得模糊,看起来像简单重叠而非精准聚焦。
    解决:使用更合适的插值方式,比如用skimage的resize指定anti_aliasing=True,或者用PIL resize时指定resample=Image.BICUBIC,让注意力图放大后保留更清晰的分布细节。

内容的提问来源于stack exchange,提问作者Park Bo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 03:03:27