OpenAI przestało bawić się w wykrywanie błędów i wzięło się za ich naprawę.
W teście porównawczym CyberGym GPT-5.5-Cyber uzyskał 85,6%, podczas gdy standardowy GPT-5.5 zatrzymał się na 81,8%, a Claude Mythos 5 od Anthropic - na 83,8%.
ExploitGym to trudniejsza wersja - sprawdza, czy model potrafi z podatności skonstruować działający exploit.
Od czasu wejścia w fazę testową w marcu Codex Security przeskanował ponad 30 milionów commitów w ponad 30 tysiącach baz kodu.