You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于CUB/CudaSDK无性能损耗地并行排序图像分块

多图像分块的大尺寸直方图生成优化思路

问题背景

将图像按参数tile_x、tile_y划分为网格分块(例如tile_x=2、tile_y=2时分为2×2网格),分块尺寸通常在32×32到256×256之间,单CUDA Block无法处理这类规模的分块。需要为每个分块生成无法放入共享内存的大尺寸直方图,优先考虑排序/压缩类实现方案。

现有方案的局限性

  • 使用CUDA Thrust的多数组并行排序方案时,必须执行两次排序操作,性能损耗极大,无法满足效率需求。
  • CUB的设备排序及直方图实现,暂不支持多段数据的同时排序,无法直接适配多图像分块的并行处理场景。

理想解决方案方向

优先寻求以下两类方案:

  1. 支持多段数据并行排序的cub::DeviceRadixSort::SortKeys实现,能够同时处理多个图像分块的排序需求,进而基于排序结果生成直方图。
  2. 无需手动实现带解耦回溯的基数排序的底层原语,且为非单Block级的直方图/排序方案,确保能高效处理大尺寸分块的计算任务。

内容的提问来源于stack exchange,提问作者Krupip

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.11 09:54:49