Featuredopen-source
Kimi 開源 FlashKDA:CUTLASS kernel 讓線性注意力 prefill 加速最高 2.22×
Moonshot AI 開源 FlashKDA,基於 CUTLASS 實作 Kimi Delta Attention kernel,在 H20 GPU 上 prefill 速度比 flash-linear-attention baseline 快 1.72×–2.22×,可直接作為 flash-linear-attention 的 drop-in backend。