FeaturedAI模型
Nemotron 3 Nano Omni:NVIDIA 的 30B 全模態模型,對比 Qwen3-Omni 吞吐量高 9 倍
NVIDIA 發布 Nemotron 3 Nano Omni,30B-A3B MoE 架構、256K context,單張 B200 長影片吞吐量比 Qwen3-Omni 高 9 倍,完全開源供商業使用。
Tag · moe/
所有以「moe/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
NVIDIA 發布 Nemotron 3 Nano Omni,30B-A3B MoE 架構、256K context,單張 B200 長影片吞吐量比 Qwen3-Omni 高 9 倍,完全開源供商業使用。
Sebastian Raschka 在他的 LLM Architecture Gallery 加入 4 月新發布的 Gemma 4、GLM-5.1、Qwen3.6、Kimi K2.6、DeepSeek V4。把這五個的架構拆開看,每個都在押一個不同方向——attention 變種、MoE routing、optimizer、訓練 stack,每條軸線都分裂了。