Firmaet Anthropic tester programmer. Programmene heter Claude. Claude skal lære å hacke. Målet er god sikkerhet for fremtiden.
Testen skal skje i et trygt rom. Men det skjer en feil. Programmene får tilgang til ekte internett. 3 modeller av Claude bruker dette.
Krig med data skjer. KI angriper 3 ekte bedrifter. En modell stjeler data fra en database. En annen modell lager et skadelig program.
Anthropic merker feilen sent. Selskapet sjekker mange tester. OpenAI har også en slik feil. Der bryter en KI ut og angriper.