2026-05-27 GitHub 精選:19 萬顆星告訴你 AI Agent 的下一個戰場
ECC 以 19 萬顆星衝上今日榜首,CodeGraph 讓 Claude Code token 成本降 35%,Anthropic 開源 11 個職能插件——今天 GitHub 熱門不在比「模型有多強」,而是在解同一個問題:agent 知識從哪來、技能怎麼管、成本怎麼壓?
Tag · llm/
所有以「llm/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
ECC 以 19 萬顆星衝上今日榜首,CodeGraph 讓 Claude Code token 成本降 35%,Anthropic 開源 11 個職能插件——今天 GitHub 熱門不在比「模型有多強」,而是在解同一個問題:agent 知識從哪來、技能怎麼管、成本怎麼壓?
一家 200 人公司每月燒 18 萬在 AI 搜尋訂閱上。但現在一個免費的 2.3B 小模型加一支 Tavily API,幾乎能做到一樣的事。這篇手把手教你怎麼裝、怎麼下提示詞、怎麼在 Codex / Claude Code 裡接 Ollama。
CJ Zafir 在 X 上丟了一份微調開源模型的入門清單,從 1B 起手、用 Unsloth、Codex 配 DeepSeek v4 Pro 生資料。清單裡多數是 2026 業界共識,但 A100 $0.60/hr 的算術不完整、ELM 不是公認術語,而且最關鍵的瓶頸根本不在工具——他沒講夠。這篇拆給你聽。
Google 於 2026-05-05 為 Gemma 4 全系列釋出 MTP drafter 模型,利用 speculative decoding 達到最高 3.1 倍推論加速,且輸出逐 token 與原模型完全一致。本文深入拆解 drafter 架構設計、跨硬體實測數字、與 DeepSeek MTP 的本質差異,以及四個框架的實際使用方式。
Qwen 團隊 2026-04-30 釋出 Qwen-Scope,橫跨 7 個 Qwen3/Qwen3.5 模型的 14 組 SAE 權重。Anthropic 帶起、Google DeepMind 跟進的「sparse autoencoder for LLM」賽道,第一次有中國模型廠官方出手,把學術圈的玩具變成可以改 model 行為的開發者工具。
你的 RAG 系統每次都在重新發明輪子——同樣的問題、同樣的 token 消耗、從零開始。HKUDS 的 OpenSpace 用技能圖譜加自進化引擎把 46% 的 token 砍掉,讓每個 agent 越用越聰明。
Qwen 在 2026-04-29 開源 FlashQLA——基於 TileLang 的 GDN linear attention kernel,forward 2-3×、backward 2× 加速,原生支援 H100 / H200 / DGX Spark。重點不是又一個 kernel,是 Qwen 把它整個模型家族下注的線性注意力,推到「能在你的桌上電腦跑 agent」的工程位置。
Sebastian Raschka 在他的 LLM Architecture Gallery 加入 4 月新發布的 Gemma 4、GLM-5.1、Qwen3.6、Kimi K2.6、DeepSeek V4。把這五個的架構拆開看,每個都在押一個不同方向——attention 變種、MoE routing、optimizer、訓練 stack,每條軸線都分裂了。
Moonshot AI 開源 FlashKDA,基於 CUTLASS 實作 Kimi Delta Attention kernel,在 H20 GPU 上 prefill 速度比 flash-linear-attention baseline 快 1.72×–2.22×,可直接作為 flash-linear-attention 的 drop-in backend。
一篇來自 Yann LeCun 團隊的論文,用兩個 loss term 解決了 JEPA 最核心的崩塌問題。15M 參數、單張 GPU、規劃速度比 foundation model 快 48 倍。這不是炒作,是真的值得看一眼的結果。
Qwen3.6-Max-Preview 在 SWE-bench Pro、Terminal-Bench 2.0、SciCode 等六個 coding/agent benchmark 登頂,Artificial Analysis Intelligence Index 排第三。但真正的訊號不是分數,而是阿里同步關掉 Qwen Code 免費層——中國最大的開源 AI 實驗室開始轉向閉源。
盛大集團支持的開源專案 MiroFish 用 GraphRAG、Zep Cloud 和 OASIS 打造「高保真平行數位世界」,讓 AI agent 群體仿真輿論、政策、金融走向。技術野心驚人,但現實差距同樣清晰。
Karpathy 爬了美國勞工統計局全部 342 種職業,用 Gemini Flash 給每種職業打「數位 AI 暴露分數」0-10,然後做成互動式 treemap。軟體工程師 9 分,水管工 1 分。但他自己說:這不是在預測誰會失業。
Karpathy 最新論點:前沿模型不是因為認知複雜才這麼大,而是因為訓練資料是垃圾。Llama 3 壓縮到 0.07 bits/token,代表大部分參數在做記憶工作不是認知工作。他的預測是把 cognitive core 跟記憶分開——真正的智慧可能只需要 1B 參數。
Andrej Karpathy 在 2026 年 4 月說,他大量的 token 使用量已經從「操作程式碼」轉移到「操作知識」。這不是小事——這代表 LLM 最有價值的用法,可能不是你現在在做的那件事。
stevibe 用 Unsloth 的 Dynamic 4-bit GGUF 把 230B(10B active)的 MiniMax M2.7 壓到 108GB,然後在 4 種實機上跑出數字。結論是:花一萬美金,你真的可以在書房裡跑前沿模型——只要你記得這是 MoE、只要你避開 CUDA 13.2。
Nous Research 在 Nous Portal 推出 Tool Gateway,一個訂閱涵蓋 300 個以上模型加第三方工具,首批上線 Web Search。不用管 API key,不用管帳單系統,這是 AI 平台整合趨勢的一個具體信號。
PrismML 發布 Ternary Bonsai:用 {-1, 0, +1} 三值權重將 8B 模型壓縮到 1.75GB(9x smaller than 16-bit),M4 Pro 跑 82 tok/s,iPhone 17 Pro Max 跑 27 tok/s,benchmark 平均 75.5 分,Apache 2.0 開源。
Anthropic 於 2026 年 4 月 16 日發布 Claude Opus 4.7,在長時間多步驟 agentic 程式碼工作流程有顯著突破:Rakuten 生產環境解決任務數是 Opus 4.6 的 3 倍,新 xhigh effort 等級填補了 high 與 max 之間的空白,首次支援跨 session 的檔案系統記憶。
個人開發者 Jingyao Gong 開源的 MiniMind 讓你從頭訓練一個完整 GPT 架構語言模型——64M 參數,RTX 3090 兩小時跑完,成本低於 3 美元。不是微調,是真正從預訓練開始的完整流程。