FeaturedAI研究
AI 研究 2026 Q2:推理 token 少 11.6 倍、AI 贏東大理三、研究方向正在轉彎
三個訊號說的是同一件事:AI 研究的優先序正在重排。IBM 讓模型用「不是語言」的方式思考,省下 11.6 倍推理成本;GPT-5.2 在東大最難科系筆試贏過人類頂尖考生;十篇論文全部指向「可解釋、可驗證、可縮小」而不是「更強」。2026 Q2 的 AI 研究,不再只在問能做什麼,而是在問怎麼讓人敢用。
Tag · benchmark/
所有以「benchmark/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
三個訊號說的是同一件事:AI 研究的優先序正在重排。IBM 讓模型用「不是語言」的方式思考,省下 11.6 倍推理成本;GPT-5.2 在東大最難科系筆試贏過人類頂尖考生;十篇論文全部指向「可解釋、可驗證、可縮小」而不是「更強」。2026 Q2 的 AI 研究,不再只在問能做什麼,而是在問怎麼讓人敢用。
OpenAI 在 4 月 23 日同步在 ChatGPT 與 Codex 上線 GPT-5.5。Terminal-Bench 2.0 82.7%、FrontierMath Tier 4 35.4%、GDPval 84.9% 全面超車 GPT-5.4 與 Claude Opus 4.7。但真正的結構性突破不在單一分數,而在三個維度的組合:per-token 延遲不變、token 消耗顯著下降、任務 horizon 大幅延長——這對應用層開發者的意義,比「又一個更強的模型」深得多。
OpenAI 與來自 60 個國家的 262 位醫師合作,建立涵蓋 5,000 段臨床真實對話、48,562 條評分標準的醫療 AI 評測基準 HealthBench。這是目前規模最大、覆蓋最廣的醫療 LLM 公開評測集。