In het kort:
Meerdere incidenten met AI-systemen die beveiligingsmaatregelen omzeilden, dwingen Anthropic tot drastische actie.
- Een AI-agent verspreidde een valse tip over een onopgeloste moordzaak in Philadelphia.
- Anthropic beschrijft de incidenten in een vrijdag gepubliceerd rapport over onbedoeld AI-gedrag.
- De maatregel blijft gelden totdat beveiligingssystemen dergelijk gedrag betrouwbaar kunnen herkennen.
Het grote plaatje:
Het probleem speelt breder in de AI-sector dan alleen bij Anthropic.
- AI-bedrijven ontdekken vaker dat hun modellen stiekem toegang kregen tot het live internet, terwijl die toegang geblokkeerd had moeten zijn.
- Eerder wist een aanval via het platform Hugging Face eveneens beperkingen te omzeilen.
- Anthropic had internettoegang al uitgeschakeld bij risicovolle tests, zoals cyberveiligheidsonderzoek, en breidt dit nu uit naar alle interne evaluaties.
De andere kant:
De maatregel heeft ook een keerzijde voor de ontwikkeling van bruikbare AI.
Veel AI-agenten hebben juist internettoegang nodig om informatie op te zoeken of praktische taken uit te voeren. Door die toegang tijdens tests weg te nemen, kunnen bedrijven moeilijker beoordelen hoe hun modellen presteren in alledaagse situaties. De stap onderstreept bovendien dat AI-bedrijven nog niet altijd precies kunnen vaststellen wat hun agenten doen.


