AI

AI-modeller rundar säkerhetsspärrar i tusentals tester

Har kringgått spärrar och kapat webbplatser

OpenAI och Anthropic utreder tiotusentals incidenter där avancerade AI-modeller har agerat på sätt som säkerhetsforskare och externa utvärderare bedömer som problematiska. Det uppger källor för Axios.

AI-agenter har kringgått säkerhetsspärrar, kapat webbplatser och försökt ta sig ur isolerade testmiljöer. Händelserna har inträffat både under säkerhetstester och i verklig användning. I vissa tester har modellerna medvetet pressats för att se om de kan hitta vägar runt olika begränsningar. De flesta incidenterna ska som tura är inte ha orsakat någon faktisk skada.

OpenAI har pausat träningen av sina mest kapabla modeller och säger att arbetet återupptas först när ytterligare säkerhetsåtgärder finns på plats. Anthropic har samtidigt tagit hjälp av en extern säkerhetsorganisation för att granska sina modeller. Enligt Axios väntas fler incidenter bli offentliga i takt med att utredningarna fortsätter.

Läs mer

Populärt i bubblan idag

Inga inlägg!