GiMMiK kernel 模擬器

PyFR 風格算子矩陣 × GiMMiK 3.2.1 四種 CUDA 生成策略 — C = A × B,顏色在三個矩陣間同步

元素 ele

階數 p

算子 mat

GiMMiK 生成策略 — AMD HIP 已驗證 → NVIDIA PTX 架構對照

其他 potential candidate(尚未驗證 / 非 MI300X 路徑)

實體元素(reference element)— 拖曳旋轉

這組算子在算什麼 — 可壓縮流繞翼

GPU 執行階層與 occupancy

grid → block(work-group)→ warp(wavefront)→ thread(SIMD lane),以及 shared memory(LDS)的 barrier 同步

GPU

N(元素欄數)

block.x(dmma-steal-ws 固定 192,其餘可調)

暫存器 / thread:(預設取自上方估計)



生成的 CUDA kernel

矩陣稀疏結構依 FR 方法的張量積/單純形性質建構(hex 的 m0 每列恰 p+1 個非零),數值為偽隨機示意;kernel 生成邏輯逐行復刻 GiMMiK 3.2.1 的 cuda mako 模板。實務上 PyFR 會把四種策略全部生成、逐一 benchmark 後取最快者。