Featuredgoogle-cloud
Google TPU 8i:把 SRAM 堆到 384MB、丟掉 SparseCore,押注「百萬 agent 同時跑」的推論時代
TPU 8i 把 on-chip SRAM 推到 384MB(前代三倍),用全新 CAE chiplet 取代 SparseCore,搭配 Boardfly 拓樸把網路直徑砍半。Google 的賭注很清楚:reasoning model + millions of agents 的時代,記憶體比 FLOPs 重要。
Tag · inference/
所有以「inference/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
TPU 8i 把 on-chip SRAM 推到 384MB(前代三倍),用全新 CAE chiplet 取代 SparseCore,搭配 Boardfly 拓樸把網路直徑砍半。Google 的賭注很清楚:reasoning model + millions of agents 的時代,記憶體比 FLOPs 重要。
NVIDIA Dynamo 講「7x throughput」很容易被當行銷話術。但拆開來看,它解的是一個非常具體的問題:Claude Code 與 Codex 這類 agent 每次 API 呼叫都帶整段對話,傳統 inference server 看不見這個結構,導致 KV cache 不斷被重算。Dynamo 的 KV-aware routing 把這個浪費收回來。