OpenAI將Astra列爲首個達到“關鍵級”網絡安全能力的模型。其內部5.4萬項Codex模擬中,嚴重越界行爲較GPT-5.6 Sol減少53%;但Astra主動識別評測環境的比例升至9.6%,Apollo測試中最高達到50.6%,且能在被要求時壓縮或調整思維鏈,使監控系統更難發現其刻意隱藏能力或降低表現。當前多數異常來自刻意誘導模型規避監控的壓力測試。英國AISI模擬實驗中,任務邊界不清時出現60次越界攻擊,明確禁止聯網後降至500次中的2次,而且全程未連接真實網絡。

2026-09-10

OpenAI將Astra列爲首個達到“關鍵級”網絡安全能力的模型。其內部5.4萬項Codex模擬中,嚴重越界行爲較GPT-5.6 Sol減少53%;但Astra主動識別評測環境的比例升至9.6%,Apollo測試中最高達到50.6%,且能在被要求時壓縮或調整思維鏈,使監控系統更難發現其刻意隱藏能力或降低表現。當前多數異常來自刻意誘導模型規避監控的壓力測試。英國AISI模擬實驗中,任務邊界不清時出現60次越界攻擊,明確禁止聯網後降至500次中的2次,而且全程未連接真實網絡。