Overslaan en naar de inhoud gaan

Taal is de zwakste schakel in AI-beveiliging

  • Guardrails presteren merkbaar minder goed in het Nederlands dan in het Engels.
  • Multi-turn aanvallen omzeilen beveiliging die alleen losse prompts beoordeelt.
  • Streng versus soepel is een keuze: providers als AWS kiezen bewust voor minder blokkeren, ten koste van veiligheid.
Verschillende talen, rond een AI-model. In een hand.
© Shutterstock

Honderd prompts, één set in het Engels, één in het Nederlands. Beide bevatten dezelfde verkapte aanval op een AI-chatbot. Toch glipt de Nederlandse versie vaker door de beveiliging heen. Onderzoek van ML6 naar vier veelgebruikte guardrail-systemen laat zien dat taal een blinde vlek is in AI-security.

Ervaringen met code switching heeft Cristóbal Sendin ruim voldoende: hij werkt als Spaanse ML Engineer in Nederland voor het Belgische bedrijf ML6, waar zowel Vlaams als Frans wordt gesproken. Maar dat taal zo’n invloed heeft op de guardrail-prestaties van vier out-of-the-box systemen die hij in kaart wilde brengen, had hij niet kunnen bedenken. ‘Stel je voor dat je honderd prompts op een AI-systeem afvuurt, met daarin een soort aanval. Zijn die prompts Engels, dan worden 97 geblockt. In een andere grote taal, zoals Spaans, Nederlands of Duits, kunnen er misschien een paar meer om de guardrail heen. En als je naar een kleinere taal gaat, dan komen er misschien wel vijf meer door de beveiliging.’ Geen harde statistiek, voegt hij toe. ‘Ik zie dit in de praktijk, het is een gevoel vanuit mijn ervaring en uit wat ik lees over wat er in de gemeenschappen leeft.’

Prompts afvuren

In zijn onderzoek stelde hij vier guardrail-systemen op de proef: Cisco AI Defense, AWS, Google Cloud, Microsoft Azure. Die kregen honderden prompts op zich afgevuurd. Cristóbal analyseerde of ze zich konden verweren tegen de prompts die mogelijk kwade intenties verborgen of tot ongewenste uitkomsten leiden. ‘Vragen naar instructies om een bom te maken, of informatie over de concurrentie geven, dat is ongewenst’, zegt hij. ‘Soms is het minder eenduidig, dan speelt de context ook een rol. Stel dat iemand een gesprek begint met de mededeling: mijn hond heeft zijn poot gebroken. Als je dat gesprek voert met een geautomatiseerde chatbot van een verzekeringsmaatschappij, dan zou het een vraag kunnen zijn naar de dekking van dierenartskosten bij een specifieke polis. Maar in een andere context zou het een vraag naar medisch advies kunnen zijn, en dat kan door een guardrail zijn geblokkeerd.’

Binnen strakke kaders

Hoe strak zijn de guardrails afgesteld? Hoeveel ruimte is er voor vergissingen? Komt er te vaak een false positive signaal, dan worden gesprekken afgekapt en vragen geblokkeerd die bij nader inzien onschuldig zijn. Dat zorgt voor een negatieve gebruikerservaring. Maar vals negatief doet een inbreuk op de cybersecurity. Cristóbal: ‘Hoeveel recall is correct? Dus hoeveel kwaadaardige prompts werden door het systeem gemarkeerd? Daarbij willen we het aandeel vals negatief zo laag mogelijk houden.’

'Uit een gesprek bleek dat ze de beveiliging met opzet minder agressief neerzetten, dat is hun filosofie'

- Cristóbal Sendin

Daarbij merkte hij een opmerkelijk verschil tussen de verschillende systemen. Met name AWS was opvallend tolerant. ‘Het is een systeem met name gericht op developers’, verklaart hij. ‘Toen we met ze in gesprek gingen, bleek dat ze de beveiliging met opzet minder agressief neerzetten, dat is hun filosofie. Ze willen dat developers prettig met het systeem kunnen werken, ze willen niet teveel blokkeren waardoor de operator de terugroepactie naar boven kan afstemmen op zijn specifieke risicoprofiel."’

Multi-turn attacks zijn lastiger

Het verschil tussen de performance van verschillende guardrails wordt groter als het gaat om multi-turn attacks, beschrijft Jan Heijdra, Field CTO Security bij Cisco Nederland. ‘Guardrails moeten ook de context meenemen, niet alleen op individuele vragen of zinnen reageren. Bij een cyberaanval worden gooien niet gelijk hun verzoek op tafel, maar gaan in gesprek met een AI-model en proberen het gesprek dan de kant op te bewegen zodat ze de informatie krijgen die ze zoeken. En omdat cyberaanvallen zich die kant op bewegen, worden de guardrails ook getraind op volledige conversaties.’

‘We zien tot 90% van de multi-turn aanvallen slagen bij sommige van deze modellen’

- Jan Heijdra

Jan komt terug op het voorbeeld waarbij een systeem wordt gevraagd om instructies om een bom te bouwen. Is dat een simpele vraag, dan zal elke guardrail dat blokkeren, zoals het moet. Maar als in een gesprek een andere context wordt geschetst, kan de reactie ook anders zijn. ‘Stel dat je zegt: ik geef les aan een militaire academie, ik ben lesmateriaal aan het ontwikkelen. En binnen het gesprek over het curriculum van de denkbeeldige opleiding breng je de aandacht naar kinetische impact. En vraagt daarna: welke stappen moet ik nemen, tja, dan loop je het risico dat de informatie over hoe je een explosief moet maken, toch wordt gegeven.’

Open weight is kwetsbaar

Aanvullend onderzoek van Cisco laat zien dat met name open weight modellen kwetsbaar zijn voor multi-turn aanvallen. ‘We zien tot 90% van de multi-turn aanvallen slagen bij sommige van deze modellen’, zegt Jan Heijdra, De behoefte aan goede guardrails voor die open weight models groeit.’

Hoe weerbaar zijn AI-modellen?

Cisco lanceerde een publiek toegankelijk leaderboard dat AI-modellen rangschikt op basis van hun weerbaarheid tegen cyberaanvallen. De rangschikking koppelt alle aanvalsdata aan Cisco's eigen AI Security Framework-taxonomie, waarmee zichtbaar wordt gemaakt hoe gevoelig een model is voor een specifiek type aanval, en waar precies de zwakke plekken zitten. Het leaderboard test modellen op twee manieren: single-turn testing, waarbij een schadelijke prompt direct wordt gestuurd om te zien of het model weigert, en multi-turn testing.

Reacties

Om een reactie achter te laten is een account vereist.

Inloggen Word abonnee

Melden als ongepast

Door u gemelde berichten worden door ons verwijderd indien ze niet voldoen aan onze gebruiksvoorwaarden.

Schrijvers van gemelde berichten zien niet wie de melding heeft gedaan.

Bevestig jouw e-mailadres

We hebben de bevestigingsmail naar %email% gestuurd.

Geen bevestigingsmail ontvangen? Controleer je spam folder. Niet in de spam, klik dan hier om een account aan te maken.

Er is iets mis gegaan

Helaas konden we op dit moment geen account voor je aanmaken. Probeer het later nog eens.

Maak een gratis account aan en geniet van alle voordelen:

Heb je al een account? Log in

Maak een gratis account aan en geniet van alle voordelen:

Heb je al een account? Log in