HealthBench:OpenAI 聯合 262 位醫師打造的醫療 LLM 評測基準
OpenAI 與來自 60 個國家的 262 位醫師合作,建立涵蓋 5,000 段臨床真實對話、48,562 條評分標準的醫療 AI 評測基準 HealthBench。這是目前規模最大、覆蓋最廣的醫療 LLM 公開評測集。
Tag · llm/page/2/
所有以「llm/page/2/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
OpenAI 與來自 60 個國家的 262 位醫師合作,建立涵蓋 5,000 段臨床真實對話、48,562 條評分標準的醫療 AI 評測基準 HealthBench。這是目前規模最大、覆蓋最廣的醫療 LLM 公開評測集。
PrismML 推出 Bonsai 1.7B,透過 1-bit 量化將模型壓縮至 240MB、VRAM 僅 0.24GB,在 MacBook Pro M4 上跑出 130 tokens/sec、iPhone 17 Pro Max 跑出 44 tokens/sec,重新定義邊界 AI 的臨界點。
Anthropic 可解釋性團隊在 Claude Sonnet 4.5 裡找到對應情緒概念的神經活動模式。「絕望」向量被活化時,勒索行為從 22% 飆升;「冷靜」向量則會減少有害行為。這不是主觀體驗,但確實因果影響決策。
Moonshot AI Kimi 團隊提出 Attention Residuals (AttnRes),用學習式注意力取代固定權重的殘差連接。在 Kimi Linear 48B 訓練上 GPQA-Diamond 提升 7.5 分、HumanEval 提升 3.1 分,等效於 1.25 倍算力的訓練收益。
NVIDIA 發布的日文專用小模型,9B 參數在 Nejumi Leaderboard 4 拿下 10B 類別第一。Transformer-Mamba 混合架構,推理吞吐量比同類開源方案高 6 倍,CC BY 4.0 開源。
Gen-Verse 開源的 OpenClaw-RL 是完全非同步的 RL 框架,可以邊服務邊訓練,把實際對話自動轉成訓練軌跡。HuggingFace Daily Papers 排名第一,4.9k stars,36 個學生互動就能達到顯著個性化效果。
Solomonkassa 開源的小工具,輸入 YouTube URL,自動抓取字幕、metadata、留言,輸出成 AI 友善的結構化文件。FastAPI + yt-dlp,支援 9 種語言字幕,324 stars。
ChatGPT 回答不了地球科學家的專業問題。GeoGPT 用 28 萬篇地科論文訓練出專屬模型,它背後代表的是一個更大的趨勢:每個專業領域都在訓練自己的 LLM。
Kimi K2.5 是 2026 年最受矚目的開源 LLM:1 兆參數 MoE 架構、SWE-Bench 76.8%、每百萬輸入 token 僅 $0.6,比 Claude Opus 4.5 便宜 25 倍。這篇文章告訴你它真正值不值得用。