2026 年 5 月 GitHub 精選:值得關注的 AI Agent、本地 LLM 與遊戲開發專案
本週從 X 討論中整理出目前最受關注的 GitHub 專案,涵蓋本地 LLM、AI Agent 框架,以及適合 indie 開發者的遊戲工具。
Tag · local-llm/
所有以「local-llm/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
本週從 X 討論中整理出目前最受關注的 GitHub 專案,涵蓋本地 LLM、AI Agent 框架,以及適合 indie 開發者的遊戲工具。
Michael-A-Kuykendall/shimmy 是一個 Python-free 的 Rust 本機推理伺服器,主打 OpenAI API 相容、GGUF 模型、自動模型發現與單一 binary。GitHub 頁面目前顯示 5.2k stars,latest release 為 2026-01-10 的 v1.9.0。
一家 200 人公司每月燒 18 萬在 AI 搜尋訂閱上。但現在一個免費的 2.3B 小模型加一支 Tavily API,幾乎能做到一樣的事。這篇手把手教你怎麼裝、怎麼下提示詞、怎麼在 Codex / Claude Code 裡接 Ollama。
Redis 創辦人 Salvatore Sanfilippo(antirez)發布 ds4,一個專為 DeepSeek V4 Flash 打造的本地推論引擎。128GB M3 Max 跑出 26.68 tok/s generation speed,KV cache 移到 SSD,全用 C + Metal 寫成。284B MoE 模型、1M context,第一次在筆電上真正「可用」。
Nemotron 3 Nano Omni(30B-A3B MoE)2026-04-28 發布,256K context,影片/音頻/圖片/文字全支援。接上 Hermes Agent 跑在 DGX Spark 上,NVFP4 量化達到 56.96 tok/s。這篇拆解這個組合的技術細節和成本算術。
Google 於 2026-05-05 為 Gemma 4 全系列釋出 MTP drafter 模型,利用 speculative decoding 達到最高 3.1 倍推論加速,且輸出逐 token 與原模型完全一致。本文深入拆解 drafter 架構設計、跨硬體實測數字、與 DeepSeek MTP 的本質差異,以及四個框架的實際使用方式。
Nous Research 的 Hermes Agent 在 2026-04-30 宣布原生支援 LM Studio——自動發現本地模型、按需載入、依模型套用對應的 reasoning level。這不是又一個 provider 接口,是把 GUI 派的本地 LLM 使用者直接拉進 agent 工作流。
Google Gemma 4 E2B 透過 WebGPU 在瀏覽器本地執行,搜尋歷史、讀取頁面、管理分頁——資料不上雲。這件事技術上是怎麼做到的?限制在哪裡?
Alibaba 發布 Qwen3.6-27B:Apache 2.0、dense、SWE-bench Verified 77.2,在 coding benchmark 超越自家 397B MoE。兩天後 HuggingFace CTO Julien Chaumond 在 MacBook Pro 上用 llama.cpp 跑出「非常接近 Opus」的實測體感。這是 2026 開源 coding agent 逼近閉源的拐點之一。
用 Gemma 4 + Haystack 搭一個本地 Agent:丟地圖進去辨識城市、抓即時天氣、查 GitHub repo——不送一個 token 到雲端。核心技巧是 SearchableToolset 動態工具發現,讓 context 不爆炸。
stevibe 用 Unsloth 的 Dynamic 4-bit GGUF 把 230B(10B active)的 MiniMax M2.7 壓到 108GB,然後在 4 種實機上跑出數字。結論是:花一萬美金,你真的可以在書房裡跑前沿模型——只要你記得這是 MoE、只要你避開 CUDA 13.2。