FeaturedNous Research
Lighthouse Attention:Nous Research 的 17 倍訓練加速,但只在訓練時
Nous Research 發布 Lighthouse Attention,在 512K 上下文預訓練裡比標準 attention 快 17.3 倍,1M token 也跑得動。但這套技巧只活在訓練端——快結束前會被卸掉,部署的模型還是用 vanilla attention。這篇拆它為什麼這樣設計、跟 MoBA/NSA 差在哪、誰會真的用。
Tag · long-context/
所有以「long-context/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
Nous Research 發布 Lighthouse Attention,在 512K 上下文預訓練裡比標準 attention 快 17.3 倍,1M token 也跑得動。但這套技巧只活在訓練端——快結束前會被卸掉,部署的模型還是用 vanilla attention。這篇拆它為什麼這樣設計、跟 MoBA/NSA 差在哪、誰會真的用。