Featuredllm
FlashQLA:Qwen 把線性注意力推進 DGX Spark 的 2-3× 加速 kernel
Qwen 在 2026-04-29 開源 FlashQLA——基於 TileLang 的 GDN linear attention kernel,forward 2-3×、backward 2× 加速,原生支援 H100 / H200 / DGX Spark。重點不是又一個 kernel,是 Qwen 把它整個模型家族下注的線性注意力,推到「能在你的桌上電腦跑 agent」的工程位置。