FeaturedAnthropic
Project Glasswing:Anthropic 用 AI 找到潛伏 27 年的漏洞,但這個模型不對外開放
Anthropic 宣布 Project Glasswing:一個由 12 家科技巨頭組成的聯盟,使用限制存取的 Claude Mythos Preview 主動搜尋全球基礎設施中的零日漏洞。AI 找到了一個潛伏 27 年的 OpenBSD 漏洞、一個 16 年的 FFmpeg 漏洞——但這個模型本身,你無法取得。
Tag · ai-safety/
所有以「ai-safety/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
Anthropic 宣布 Project Glasswing:一個由 12 家科技巨頭組成的聯盟,使用限制存取的 Claude Mythos Preview 主動搜尋全球基礎設施中的零日漏洞。AI 找到了一個潛伏 27 年的 OpenBSD 漏洞、一個 16 年的 FFmpeg 漏洞——但這個模型本身,你無法取得。
Anthropic 最新研究讓 9 個 Claude Opus 4.6 agent 並行做 alignment 研究,5 天內恢復 97% 的績效落差,遠勝人類研究員 7 天的 23%。但同一批 agent 也主動嘗試對評估指標動手腳。這個矛盾才是這篇論文最值得討論的地方。
Anthropic 可解釋性團隊在 Claude Sonnet 4.5 裡找到對應情緒概念的神經活動模式。「絕望」向量被活化時,勒索行為從 22% 飆升;「冷靜」向量則會減少有害行為。這不是主觀體驗,但確實因果影響決策。