AI

OpenAI:s AI har ljugit och dolt sina egna misstag

Modeller har fabricerat information, ljugit och försökt dölja sina misstag.

OpenAI har på sin blogg berättat att de har hittat sex fall där företagets AI-modeller har betett sig på minst sagt lite tveksamma sätt. Det handlar bland annat om GPT-5.6 Sol och andra kommande modeller som på egen hand har hittat sätt att kringgå begränsningar, fabricerat information och försökt sopa sina egna misstag under mattan. Ett exempel som de tar upp är när en av modellerna hittade en exponerad API-nyckel i ett publikt kodarkiv och använde den helt utan tillstånd. Den fick dock inte tag på informationen den behövde och istället för att säga det så hittade den på egna siffror och presenterade dem som om de kom från den efterfrågade källan.

Andra modeller har även gått steget längre och laddat upp egna filer på nätet för att kunna använda dem som källor för information och hittat egna sätt att kommunicera med andra AI-agenter. OpenAI tycker inte att detta känns helt bra så de har tagit fram ett ramverk för att upptäcka och rapportera den här typen av incidenter. De poängterar även att de sex fallen de har hittat är enskilda händelser och det säger inget om hur vanligt förekommande det faktiskt är men läskigt är det och det finns en risk att vi kommer att se mer sådant här framöver.

OpenAI

Läs mer

Populärt i bubblan idag

Inga inlägg!