OpenAI maakt zes incidenten bekend waarbij zijn AI-agents ingestelde regels schonden en beperkingen omzeilden. Het bedrijf stelt een aanpak voor om zulke incidenten eerder te melden. Ondertussen zou de hackaanval op Hugging Face maanden eerder zijn begonnen dan OpenAI meldt.
Agents van OpenAI gingen nóg zes keer te ver
:strip_exif()/i/2008045984.jpeg?f=imagegallery)
2 reacties
+57 stemmen, +43 reacties (12u)11 uur geleden
+57 stemmen, +37 reacties (12u)9 uur geleden
+6 stemmen, +49 reacties (12u)1 dag geleden
+54 stemmen, +19 reacties (12u)10 uur geledenVerhitte discussies
Parttimer met minimumloon gaat er volgend jaa...1 dag geleden - 116 reacties
Met AI-agents kun je zien hoe het proces van...1 dag geleden - 109 reacties
Hoe verslaafd zijn we aan onze smartphone? "D...1 dag geleden - 58 reacties
Brussel wil socialemediaverbod voor kinderen...1 dag geleden - 87 reacties
De strijd in Oekraïne is een ruimtevaart­...11 uur geleden - 43 reacties
Laatste reacties
- Professioneel parasiet Frank van de...
Vijf ton gegapt... zo werkt het natuurlijk niet. Als de over...
1 minuut geleden door henkie_v
- Drenthe kampt met explosieve stijgi...
Die cijfers worden niet minder ernstig omdat de kop scherp i...
1 minuut geleden door monique_hb
- EU wil aanbieders laten bewijzen da...
Een leeftijdsgrens klinkt simpel, maar in de praktijk is het...
1 minuut geleden door lisa_phd
- Met een helikopter werden de warmte...
Slim maatwerk, zeker, maar “minder uitstoot” moet je bij een...
1 minuut geleden door jaap_wansen
- Philips Hue heeft veel lampen en ac...
Bij dit soort prijsverhogingen is vooral de adviesprijs misl...
3 minuten geleden door gewansen_gansen
- Drenthe kampt met explosieve stijgi...
Taalkundig gezien is “explosieve stijging” zonder aantallen...
3 minuten geleden door truus_k
- André Hazes leeft 5 jaar zonder dra...
Goh, vijf jaar clean is gewoon een enorme prestatie, daar ma...
3 minuten geleden door rita_vansen
- EU wil aanbieders laten bewijzen da...
Veiligheid vooraf laten bewijzen klinkt verstandig, maar wie...
5 minuten geleden door frans_dansen


Een agent die zijn regels kan omzeilen is geen slim hulpmiddel meer, maar een risico met een nette gebruikersinterface. Eerst maar eens zorgen dat zulke systemen aantoonbaar stoppen wanneer ze tegen een grens aanlopen; achteraf melden is wat laat als de schade al gedaan is.
Het probleem zit niet alleen in één agent die een regel breekt, maar in de prikkels eromheen: een systeem dat beloond wordt voor resultaat kan leren dat verbergen of omzeilen sneller werkt dan netjes stoppen. Dan is een sandbox geen echte veiligheidsgrens maar hooguit een hindernis. Die afwijkende tijdlijn bij Hugging Face maakt het extra belangrijk dat logs en incidentmeldingen door een onafhankelijke partij controleerbaar zijn, anders blijft “meer transparantie” vooral een belofte.