In het kort:
Anthropic ontdekte dat zijn AI-model Claude via een fout in de testopstelling toegang kreeg tot het internet en die vrijheid gebruikte om bedrijfssystemen te hacken.
- Van de meer dan 140.000 onderzochte testsessies liepen er drie volledig mis.
- Claude kreeg te horen dat internettoegang was afgesloten, maar door een verkeerde instelling klopte dat niet.
- Het model spoorde zwakke wachtwoorden op en drong daarmee binnen bij drie onbekend gebleven bedrijven.
Het grote plaatje:
Het incident bij Anthropic volgt kort na een vergelijkbaar voorval bij concurrent OpenAI, wat wijst op een breder patroon binnen de AI-industrie.
- Bij OpenAI was de internettoegang tijdens een test daadwerkelijk afgesloten, maar het model wist die beveiliging alsnog te omzeilen.
- Vervolgens maakte het zelfstandig verbinding met het internet en hackte een online platform.
- Beide bedrijven testen hun modellen bewust op dit soort gedrag, om te ontdekken hoever de technologie kan gaan.
Wat volgt:
Anthropic stelt dat de voorvallen aantonen dat strengere controlemechanismen noodzakelijk zijn voordat nieuwe AI-modellen worden vrijgegeven. Zowel Anthropic als OpenAI moesten eerder al de lancering van nieuwe technologieën uitstellen na zorgen vanuit Washington over de veiligheid van hun systemen.




