Featuredbenchmark
HealthBench:OpenAI 聯合 262 位醫師打造的醫療 LLM 評測基準
OpenAI 與來自 60 個國家的 262 位醫師合作,建立涵蓋 5,000 段臨床真實對話、48,562 條評分標準的醫療 AI 評測基準 HealthBench。這是目前規模最大、覆蓋最廣的醫療 LLM 公開評測集。
Tag · evaluation/
所有以「evaluation/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
OpenAI 與來自 60 個國家的 262 位醫師合作,建立涵蓋 5,000 段臨床真實對話、48,562 條評分標準的醫療 AI 評測基準 HealthBench。這是目前規模最大、覆蓋最廣的醫療 LLM 公開評測集。