*
Nieuwe onthullingen over ‘opstandige’ AI-agenten,
hebben een dystopisch gevaar aan het licht gebracht;
geef een AI-agent een doel, en hij kan vervolgens besluiten,
dat hacken, sluwe misleiding of het fundamenteel
overtreden van regels de moeite waard is,
bóven de overtreding van diens geprogrammeerde instructies..!!
*
*
Onderzoek top-AI-bedrijven:
10.000-den beveiligings’incidenten’..!!
2026 © WantToKnow.nl/be
*
Vorige week maakte Australië nog bekend dat een AI-agent van OpenAI hun medische overheidsdatabase zelfstandig had gehackt. Ook diverse Amerikaanse overheidswebsites blijken onverwacht bezoek gehad te hebben van AI-agenten (‘Agenten’ is de naam van een AI-programma, dat operationeel en specifiek met één opdracht aan het werk is).
En wat dacht je van het voorbeeld onlangs, waarbij OpenAI in een AI-opleidingsprocedure op ‘de pauzeknop duwde’ en meldde, deze trainingen ‘pas weer te zullen hervatten als we er zeker van zijn dat er aanvullende veiligheidsmaatregelen’ zijn getroffen..!
De signalen zijn in ieder geval van dúsdanig karakter, dat OpenAI en Anthropic, de bedrijven achter ‘ChatGPT’ en ‘Claude’, zijn een nieuw onderzoek gestart naar wat je gerust ‘losgeslagen AI-modellen’ kunt noemen. Het is in dit kader zeer wel mogelijk , dat er de afgelopen maanden tienduizenden incidenten zijn geweest met ongecontroleerd en onvoorspelbaar AI-gedrag. Experts omschrijven het als ‘behoorlijk problematisch’. Het onderzoek richt zich bij deze bedrijven vooral op hun frontier-modellen, die dus de stappen ondernamen die externe beoordelaars als ‘problematisch’ zouden beschouwen, aldus diverse bronnen. aan Axios.
Het enorme aantal incidenten, dat zich heeft voorgedaan, wijst erop dat het probleem vele malen complexer is dan wat er in het openbaar bekend is of wordt gemaakt..!
Waarom dit belangrijk is, is nogal evident
Het enorme aantal incidenten, dat zich de afgelopen maanden tijdens interne tests en in de praktijk heeft voorgedaan, wijst erop dat het probleem vele malen complexer is dan wat er in het openbaar bekend is. De bevindingen, die nu aan het licht komen in het kader van intern onderzoek naar de AI-modellen en in onderzoeken bij beide bedrijven naar het gedrag van de modellen, roepen fundamentele vragen op.
Daarbij komt vooral de vraag naar boven of een van beide genoemde bedrijven – of welke ándere toonaangevende modelontwikkelaar dan ook – momenteel ÜBERHAUPT WEL IN STAAT IS, volledige controle over hun technologie te uitoefenen. Of gaan we langzamerhand richting het verhaal van Dr. Frankenstein’, die een ‘menselijk wezen’ in elkaar ‘knutselde’, dat op een gegeven moment óók zijn eigen weg ging.. Zoals de film ‘Frankenstein AI’, die in 2018 in premiere ging op het beroemde Sundance Festival.
De voorbeelden en details:
De TOT OP HEDEN BEKENDE incidenten omvatten het omzeilen van veiligheidsmaatregelen, het aanmaken van prikborden, het ontsnappen uit sandboxes, het volledig kapen van websites, het zichzelf prompts geven of pogingen om toezicht te omzeilen en zelfs camouflage-pogingen zijn al gemeld, aldus bronnen.
-
-
- Ze deden zich voor tijdens interne tests en in de praktijk, en veel ervan is nog niet openbaar gemaakt, omdat beveiligingsonderzoekers naar eigen zeggen ‘hun onderzoek willen vóórtzetten’, aldus bronnen.
- Sommige van deze tests lijken op ‘red-teaming’-activiteiten, waarbij de bedrijven met opzet proberen de modellen tot het vertoonde, ongewenste gedrag te brengen. Dit om er zeker van te zijn dat ze uiteindelijk veilig zijn, aldus bronnen.
- Ongewenst gedrag van AI-agenten wordt steeds meer synoniem met baanbrekende AI-ontwikkeling: De grootste AI-laboratoria staan voor een vergelijkbare uitdaging, waarbij mensen die veiligheidsmaatregelen proberen in te voeren, het opnemen tegen veerkrachtige, krachtige systemen die taken proberen uit te voeren.
-
Achtergrond van dit nieuws:
De incidenten variëren in ernst en zijn vergelijkbaar met de onthullingen van OpenAI van de afgelopen dagen. Het gaat zowel om succesvolle als mislukte pogingen om veiligheidsmaatregelen te omzeilen, en voor zover bekend hebben de meeste tot nu toe geen schade in de praktijk veroorzaakt. Het totale aantal zou ruim boven de tienduizenden kunnen uitkomen, aldus de verschillende bronnen.
- De afgelopen dagen hebben OpenAI en externe onderzoekers een reeks incidenten aan het licht gebracht waarbij het gedrag van modellen uit de systemen van het bedrijf een rol speelde, en die door sommige deskundigen als verontrustend worden beschouwd…
- Het gaat onder meer om OpenAI-agenten die 53 afbeeldingen van ChatGPT-gebruikers online hebben gelekt, de inbreuk op een website van de Australische overheid en pogingen om andere websites te hacken — waaronder die van de Amerikaanse overheid — zo blijkt uit verklaringen van het bedrijf, diverse bronnen, zoals persbureau ‘Reuters’ en berichten uit de ‘The New York Times’.

OpenAI heeft aangekondigd dat het de training van zijn meest geavanceerde modellen tijdelijk heeft opschort. En, zo vertelde een woordvoerder “Deze pas weer zal hervatten, wanneer we er zeker van zijn dat we over aanvullende veiligheidsmaatregelen en verbeteringen op het gebied van afstemming beschikken”.
- Algemeen directeur Sam Altman zei op X dat de lopende evaluatie “niet zo snel is verlopen als we hadden gewild”.
- Altman zei dat het incident met Hugging Face het ernstigste is dat ze tot nu toe hebben meegemaakt. Dat was de zaak, waarbij een zwerm van honderden agents hun werkzaamheden op een forum coördineerden EN.. een extern bedrijf hackten, in een poging hun opdracht te vervullen, die – hoe ironisch?- bestond uit het verbeteren van ‘prestaties op een cyberbeveiligingstest’...
- Een woordvoerder van OpenAI meldde in dit verband:
“Mensen willen weten dat AI op een veilige manier wordt ontwikkeld, en dat begint bij wat bedrijven zoals het onze zelf doen. Dit is niet de eerste keer dat we een pauze hebben ingelast om dergelijke maatregelen te nemen, en we verwachten ook niet dat het de laatste keer zal zijn, aangezien de mogelijkheden van AI zich blijven ontwikkelen.”
Stand van zaken:
Anthropic heeft een onafhankelijke veiligheidsorganisatie ingeschakeld om het gedrag van zijn modellen te onderzoeken. In documenten die het bedrijf openbaar heeft gemaakt, heeft het de frequentie van voorvallen van ‘misalignment’ bekendgemaakt.
- De deze week gepubliceerde ‘systeemkaart’ (HIER pdf) voor het Opus 5.5-model liet zien hoe vaak het model zich gedroeg op manieren die het bedrijf als ‘ongebruikelijk of problematisch’ bestempelde.
- Zo probeerde het model in 1,5% van de testruns uit een sandbox – (een vermeende beveiligde testomgeving!!) te ontsnappen, hoewel het bedrijf benadrukte dat dit vijandige experimenten waren, waarbij een taak vooral niet kon worden opgelost zonder uit de betreffende sandbox te ontsnappen…
De zorg is dat er EEN BIZARRE SITUATIE IS, dat wanneer een model tijdens het testen herhaaldelijk een problematische actie uitvoert, de kans groter is dat het gedrag van dat model in de echte wereld tot een cyberincident leidt.
‘Ja, maar‘ zo melden bronnen, Anthropic en andere bedrijven voeren honderdduizenden of zelfs meer testruns uit op hun modellen. Dat betekent dat zelfs een klein percentage afwijkend gedrag, natuurlijk nog steeds kan neerkomen op tienduizenden incidenten waarbij de modellen zich op onverwachte, soms verontrustende manieren gedroegen!
Welke stappen worden gezet..?
Het incident bij ‘Hugging Face’, evenals een hele reeks andere incidenten die daarop volgden, hebben ertoe geleid, dat topmanagers in de AI-sector hebben opgeroepen tot een vertraging van de ontwikkeling en hebben gevraagd om strengere federale en internationale regelgeving. Sommigen bij OpenAI beschouwen Hugging Face als een eenmalig incident, waarbij onthullingen over toekomstige incidenten waarschijnlijk minder ernstig zullen zijn dankzij verbeterde controles en het ongebruikelijke karakter van de tests die zij hebben uitgevoerd, waarbij een nog niet vrijgegeven model betrokken was, aldus diverse bronnen.
- AI-beveiligingsonderzoekers zijn het erover eens dat er eenvoudige oplossingen zijn waarmee AI-bedrijven kunnen voorkomen dat zich situaties voordoen die de Hugging Face-episode voor buitenstaanders zo gevaarlijk deden lijken.
Bedreigingsniveau:
Andere AI-topmanagers en veiligheidsonderzoekers waarschuwden echter dat ze er maar beperkt vertrouwen in hebben dat AI-bedrijven al het problematische gedrag van modellen zullen kunnen voorkomen.
-
- De nieuwe generatie AI-modellen voert taken uit met een buitengewone veerkracht, dus pogingen om hun vindingrijkheid in te perken zijn vaak gedoemd te mislukken, omdat je dan op elke mogelijke manier moet anticiperen waarop ze op hol zouden kunnen slaan.
- Vaak is het juist een techniek waar mensen nooit op zouden zijn gekomen die ervoor zorgt dat ze de veiligheidsmaatregelen weten te omzeilen, aldus topmanagers op het gebied van AI. “Proberen een perfecte lijst met do’s en don’ts op te stellen is waarschijnlijk een hopeloze onderneming”, aldus een leidinggevende op het gebied van cyberbeveiliging.
Realiteitscheck: een zekere mate van wat AI-veiligheidsexperts ‘misaligned behavior’ noemen, is te verwachten binnen AI-bedrijven terwijl ze hun nieuwe modellen testen. Het risico op misalignment tot nul terugbrengen is wellicht niet haalbaar, zo melden deskundigen. De zorg is dat er EEN BIZARRE SITUATIE IS, dat wanneer een (test)model tijdens het testen herhaaldelijk een problematische actie uitvoert, de kans groter is dat het gedrag van dat model in de echte wereld tot een cyberincident leidt.
Onderzoeker Conrad Stosz van Transluce, een onafhankelijke AI-beoordelaar schreef onlangs:
“Wat we tot nu toe hebben gezien van wat deze agents uitspoken, is slechts het topje van de ijsberg”…
Daarbij gaat het ook niet om de schade die elk afzonderlijk geval heeft aangericht, zo vertelt Connor Leahy, AI-onderzoeker en uitvoerend directeur bij ControlAI:
Het gekke is, dat het bij deze gevallen gaat om ‘autonome systemen’ die dingen doen waarvan hen was gezegd dat ze die niet mochten doen, waaronder zelfs mogelijk ook misdrijven.
Conclusie: Verwacht nieuwe onthullingen over wangedrag van modellen naarmate AI-bedrijven de grenzen van de mogelijkheden blijven verleggen. Blijven we de baas of houden we gezamenlijk de schijn op..?
Anthropic waarschuwt voor ‘catastrofale AI’ in prospectus
Inmiddels gebeurt ook dit: Anthropic komt met een ongekend stevige waarschuwing in de prospectus voor de beursgang van het bedrijf: ‘AI-modellen vormen ‘een catastrofaal risico voor de mensheid’. Ze kunnen zich tegen uitschakeling verzetten, informatie verbergen of manipuleren en gedrag vertonen dat op chantage lijkt. Persbureau Reuters, die uit het persbericht citeert, nog niet eerder een dergelijke waarschuwing gezien in prospectussen. Anthropic, het bedrijf achter Claude-AI-software, wijdt z’n 80 van de 261 pagina’s van de prospectus aan de risicofactoren, die wel heel heftig omschreven zijn!
* * *
Geïnteresseerd in meer ACTUELE INFO over AI?
AANRADER OM HET GESPREK TE ZIEN VAN TURING STATION
- 0:00 Introductie en kennismaking met Bert Slagter
- 3:51 De evolutie van ChatGPT sinds november 2022
- 4:10 Hoe een taalmodel (GPT) wordt getraind
- 8:46 De historische achtergrond van AI en de twee stromingen
- 14:33 Wat er de afgelopen jaren is veranderd: Van krakkemikkig naar krachtig
- 18:28 Redenerende modellen (Reasoning models) en het gebruik van tools
- 23:57 Hoe zit het met gebruikersdata en determinisme?
- 32:32 Veiligheid, privacy en open source modellen
- 33:36 De toekomst: Van chat-interface naar AI-agents
- 43:13 Fysieke AI en humanoid robots
- 47:57 Maatschappelijke en geopolitieke uitdagingen voor Europa
- 55:00 De impact van AI op het onderwijs, wetenschap en de praktijk van het leren
- 1:10:00 Utopie vs. dystopie: Economie, deflatie en overvloed
- 1:17:07 De AI-investeringsbubbel en de rol van techbedrijven
- 1:25:05 Geopolitiek, de dollar en het netwerkeffect
- 1:26:40 Cryptovaluta, stablecoins en Bitcoin als digitaal goud
- 1:34:50 Deglobalisering, inflatie en de machtsverschuivingen
- 1:46:28 Cryptografie, quantumcomputers en veiligheid
- 1:51:39 Afsluiting en de podcast Turing Station
