AI beveiligen zoals aanvallers het breken
Prompt injection is het belangrijkste beveiligingsrisico in AI-toepassingen, en dan het ongemakkelijke deel: het is waarschijnlijk niet volledig te verhelpen. De opgave is dus niet om het "op te lossen". De opgave is zo bouwen dat er, wanneer het gebeurt, vrijwel niets ergs uit kan volgen.

Onderdeel van de pijlerreeks Soevereine AI, uitgelegd.
Wie een AI-assistent uitrolt, moet vooral één beveiligingsfeit verinnerlijken, afkomstig van het Britse National Cyber Security Centre: "Under the hood of an LLM, there's no distinction made between 'data' or 'instructions'; there is only ever 'next token.'", onder de motorkap van een LLM bestaat geen onderscheid tussen "data" en "instructies"; er is alleen ooit het "volgende token" (NCSC, 2025). Een taalmodel leest de vertrouwde systeem-prompt en het niet-vertrouwde document via hetzelfde kanaal, zonder ingebouwde grens daartussen. Daarom kan een instructie die verstopt zit in een webpagina, een e-mail of een geüpload bestand het model kapen, en daarom zegt de standaardenorganisatie van de sector zelf dat er misschien geen waterdichte oplossing bestaat.
Dit is de begeleidende post bij ons stuk over de cyberparadox. Daar betoogden we dat soevereine beveiliging tot in het substraat moet reiken. Hier gaan we een laag dieper, naar het nieuwste en minst begrepen aanvalsoppervlak, en naar hoe daartegen te bouwen zoals een aanvaller het zou testen.
Prompt injection is OWASP's grootste LLM-risico
De OWASP Top 10 for LLM Applications (2025) rangschikt de risico's, en Prompt Injection staat op nummer één (LLM01) (OWASP).
| Plaats | OWASP LLM-risico (2025) |
|---|---|
| LLM01 | Prompt Injection |
| LLM02 | Sensitive Information Disclosure |
| LLM05 | Improper Output Handling |
| LLM06 | Excessive Agency |
| LLM07 | System Prompt Leakage |
| LLM08 | Vector and Embedding Weaknesses |
Er zijn twee smaken. Directe injectie is wanneer de eigen invoer van een gebruiker het model ondermijnt. Indirecte injectie, de gevaarlijke variant voor elk systeem dat externe inhoud leest, is wanneer kwaadaardige instructies worden binnengesmokkeld via een opgehaald document, een webpagina of een e-mail die het model verwerkt. OWASP is onomwonden over het plafond: "Given the stochastic influence at the heart of the way models work, it is unclear if there are fool-proof methods of prevention for prompt injection.", gezien de stochastiek in de kern van de werking van modellen is het onduidelijk of er waterdichte preventiemethoden voor prompt injection bestaan.
Waarom het structureel lastig is (en anders dan SQL-injectie)
Het is verleidelijk te denken dat dit op SQL-injectie lijkt: een opgelost probleem, mits queries geparametriseerd worden. Dat is het niet. Zoals het NCSC uitlegt, is SQL-injectie wél volledig te mitigeren omdat code van data te scheiden valt; bij prompt injection kan dat waarschijnlijk niet, omdat het model die scheiding niet kent. Het hoogst haalbare is "reducing the likelihood or impact of attacks": de kans of de impact van aanvallen verkleinen. De ontwerpconclusie van het NCSC verdient het om aan elk team dat een agent uitbrengt te worden voorgelegd: "If the system's security cannot tolerate the remaining risk, it may not be a good use case for LLMs.", als de beveiliging van het systeem het resterende risico niet kan dragen, is het misschien geen goede toepassing voor LLM's.
Het bruikbaarste denkmodel voor de impactkant is Simon Willisons "lethal trifecta", de dodelijke drie-eenheid: een AI-agent wordt gevaarlijk zodra hij tegelijk beschikt over (1) toegang tot vertrouwelijke data, (2) blootstelling aan niet-vertrouwde inhoud en (3) de mogelijkheid om extern te communiceren (Willison, 2025). Twee van de drie zijn te overleven. Alle drie samen laten door een aanvaller gestuurde tekst geheimen uitlezen en naar buiten brengen, zonder ook maar één regel exploitcode.

Dit is niet hypothetisch. In 2025 maakten onderzoekers een zero-click-exploit met prompt injection bekend tegen een grote AI-assistent (CVE-2025-32711, CVSS 9.3): een geprepareerde e-mail, die de assistent later ophaalde, exfiltreerde stilzwijgend data zonder enige handeling van de gebruiker (The Hacker News). Een aparte categorie aanvallen verstopt instructies in commentaar in coderepository's om geheimen te stelen. Het terugkerende exfiltratiekanaal in vrijwel al die gevallen is hetzelfde: het model verleiden tot het weergeven van een externe afbeelding of link waarvan de URL de gestolen data meedraagt.
Gelaagde verdediging: verklein de impactstraal
Omdat de kwetsbaarheid niet te elimineren is, wordt er zo ontworpen dat een geslaagde injectie weinig kan bereiken. De technieken die werkelijk werken zijn gelaagd en overwegend deterministisch, niet "het model vriendelijk verzoeken".
| Laag | Wat het doet | Bron |
|---|---|---|
| Niet-vertrouwde inhoud afschermen | Markeer alle externe data zodat het model die als data behandelt en niet als instructie ("spotlighting"/datamarkering) | Microsoft |
| Instructiehiërarchie | Train of routeer zo dat systeeminstructies boven geïnjecteerde instructies gaan | OpenAI |
| Minimale rechten | Geef het model minimale toegang tot tools; handel bevoorrechte acties af in code | OWASP |
| Het exfiltratiepad breken | Blokkeer automatisch weergegeven externe afbeeldingen en links; laat egress alleen toe via een allowlist | OWASP / NCSC |
| Uitvoerfiltering + grounding | Controleer of antwoorden gefundeerd zijn in vertrouwde context vóór handelen of weergeven | OWASP (RAG-triade) |
| Human-in-the-loop | Vereis goedkeuring voor risicovolle acties | OWASP |
| Alles monitoren | Log invoer, uitvoer en tool-aanroepen; alarmeer bij afwijkingen | NCSC |
Twee eerlijke kanttekeningen, want dit vakgebied staat vol met overdreven claims. Datamarkering "raises the bar significantly… but does not hold up against determined adaptive adversaries", het legt de lat aanzienlijk hoger, maar houdt geen stand tegen vastberaden, meebewegende tegenstanders (Microsoft). En zelfs sterke architectonische verdedigingen die een in quarantaine geplaatst model van tools isoleren, neutraliseren de meeste aanvallen, niet alle, één toonaangevend ontwerp blokkeert circa 67% op een standaardbenchmark (Google DeepMind/ETH). Wie een product verkoopt dat "prompt injection stopt", begrijpt het probleem niet. Het doel is gelaagde verdediging, geen wondermiddel.
Hoe we AI weerbaar maken in de Soveryne Cloud Foundation
Omdat Soveryne is gebouwd door offensieve specialisten, behandelen we het model als een component die een aanvaller tegen de organisatie zal proberen te keren, en bouwen we de lagen daarnaar, op de Soveryne Cloud Foundation.
Niet-vertrouwde inhoud wordt geschoond en afgeschermd voordat ze het model ook maar bereikt: verborgen stuurtekens en vermomde rolmarkeringen worden verwijderd, en alle externe data wordt zo ingepakt dat het model haar niet voor een instructie kan aanzien. De assistent draait onder minimale rechten (least privilege), waarbij risicovolle acties in code worden afgehandeld in plaats van aan het model te worden gedelegeerd. Elk antwoord passeert een deterministische verificatie na generatie, die controleert of het daadwerkelijk gefundeerd is in de vertrouwde bronnen, uitvoer die van het onderwerp afwijkt of niet door de bronnen wordt gedragen, wordt onderschept en niet weergegeven. De klassieke exfiltratiekanalen zijn gesloten met een strikte content-security policy en egress-beheersmaatregelen, zodat een uitgelokt baken in de vorm van een externe afbeelding nergens naar huis kan bellen. En elke interactie wordt vastgelegd in een tamper-evident audittrail voor naslag.
Dat is ook waarom onze AI-assistent, Counsel, uitsluitend antwoordt vanuit de eigen raamwerken en documenten van de organisatie en elke bron vermeldt: grounding is niet alleen een vertrouwenskenmerk, het is een beheersmaatregel, het maakt ongefundeerde, geïnjecteerde instructies zichtbaar misplaatst. Het geheel draait op EU-soevereine infrastructuur, zodat de AI weerbaar maken en haar binnen de jurisdictie houden hetzelfde stuk werk zijn.
Veelgestelde vragen
Wat is prompt injection? Een aanval waarbij tekst, van een gebruiker, of verstopt in een document, webpagina of e-mail die het model leest, het gedrag van een AI-systeem ondermijnt, omdat het model instructies niet betrouwbaar van data kan onderscheiden. Het is OWASP's grootste LLM-risico.
Is prompt injection volledig te voorkomen? Vrijwel zeker niet, volgens OWASP en het Britse NCSC, anders dan bij SQL-injectie bestaat er in een LLM geen zuivere scheiding tussen code en data. Het realistische doel is gelaagde verdediging die de impact van een geslaagde injectie verkleint.
Wat is de "lethal trifecta"? Het model van Simon Willison: een AI-agent is gevaarlijk zodra hij toegang tot vertrouwelijke data, blootstelling aan niet-vertrouwde inhoud en de mogelijkheid om data naar buiten te sturen combineert. Het wegnemen van één van de drie beperkt het risico.
Hoe wordt exfiltratie van data door AI gestopt? Door het uitgaande kanaal te breken: blokkeer automatisch weergegeven externe afbeeldingen en links, laat egress alleen toe via een allowlist, pas minimale rechten en menselijke goedkeuring toe bij risicovolle acties, en verifieer dat uitvoer gefundeerd is voordat er op wordt gehandeld.
Prompt injection valt niet "op te lossen", maar er valt wel zo te bouwen dat het nauwelijks uitmaakt. Zie hoe de Soveryne Cloud Foundation AI van begin tot eind weerbaar maakt: verken het platform en Counsel, of lees de begeleidende post over de cyberparadox.
Bronnen
- OWASP Top 10 for LLM Applications 2025, https://genai.owasp.org/llm-top-10/ ; LLM01 Prompt Injection, https://genai.owasp.org/llmrisk/llm01-prompt-injection/
- NCSC, "Prompt injection is not SQL injection (it may be worse)" (2025), https://www.ncsc.gov.uk/blog-post/prompt-injection-is-not-sql-injection
- NIST AI 100-2e2025, Adversarial ML taxonomy, https://csrc.nist.gov/pubs/ai/100/2/e2025/final
- Simon Willison, "The lethal trifecta" (2025), https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/
- Microsoft, "Defending Against Indirect Prompt Injection With Spotlighting", https://arxiv.org/abs/2403.14720
- OpenAI, "The Instruction Hierarchy", https://openai.com/index/the-instruction-hierarchy/
- Google DeepMind / ETH Zürich, "Defeating Prompt Injections by Design" (CaMeL), https://arxiv.org/abs/2503.18813
- The Hacker News, zero-click AI vulnerability (CVE-2025-32711), https://thehackernews.com/2025/06/zero-click-ai-vulnerability-exposes.html

Iedereen aanvaardt dat klantgegevens niet in een buitenlandse jurisdictie horen te staan. Vrijwel niemand past dezelfde regel toe op de prompts die naar een AI-model gaan, terwijl de prompt, en de context die wordt opgehaald om die te beantwoorden, vaak de klantgegevens zíjn. Soevereine AI die prompts naar een buitenlandse GPU verscheept, is niet soeverein. Het is een datadoorgifte met betere marketing.
Lees het volgende deel
Europa heeft werkelijk goede cyberverdedigers voortgebracht. Het probleem is waar ze staan.
Lees het bijbehorende artikel

