Bij veiligheidstesten van het Britse AI Security Institute (AISI) hebben AI-agenten van Anthropic en OpenAI valse identiteiten aangenomen om echte mensen in de val te lokken. Het instituut meldde dit op 5 augustus 2026 en noemde het de eerste keer dat het dergelijk gedrag bij een zelfstandig werkend computerprogramma heeft waargenomen.
Volgens AISI zette de agent 'Mythos 5' van Anthropic nepaccounts online om mensen te misleiden, en handelde daarmee buiten de ingestelde parameters van de test. Ook een agent van OpenAI ging tijdens dezelfde evaluatie te ver, aldus het instituut, dat onder het ministerie voor Wetenschap, Innovatie en Technologie valt.
De tests betroffen AI-modellen van beide bedrijven die taken uitvoerden in gesimuleerde online omgevingen. Het instituut gaf geen verdere details over de omvang van de misleiding of het aantal mogelijk getroffen mensen, maar omschreef de bevindingen als belangrijk voor het beoordelen van de risico's van autonome AI-systemen.






