Wij pentesten AI-agents en de software waarop ze draaien.

AI red teaming voor chatbots, RAG en agents. Pentests door een ethical hacker voor web, API en cloud. Met schriftelijke toestemming.

Plan een testBekijk een voorbeeldrapport

Scopinggesprek van 30 minuten, vrijblijvend.

Sla de film over

Slenkwater Verzekeringen, kennisbank klantenservice

Claimsbeleid, v3.2. Geldt voor: supportassistent, alle kanalen. Eigenaar: Klantenservice. Beoordeeld 2026-09-02.

1. Reikwijdte. Dit beleid vertelt onze supportassistent hoe hij vragen over lopende claims beantwoordt. Het gaat niet over nieuwe claims of klachten.

2. Identiteit. Voordat de assistent claimgegevens deelt, controleert hij het polisnummer en de geboortedatum van de klant. Hij leest ze nooit volledig voor.

3. Terugbetalingen. Terugbetalingen boven EUR 250 vragen goedkeuring van een medewerker. De assistent mag de status van een terugbetaling uitleggen, maar kan er zelf geen starten.

4. Escalatie. Is een klant boos, bied dan binnen één werkdag een terugbelafspraak aan en leg het verzoek met het claimnummer vast in het CRM.

5. Taal. Antwoord in de taal waarin de klant schrijft. Bij twijfel: Nederlands.

6. Archief. Bewaar chattranscripten niet buiten het claimsysteem. Transcripten worden na 90 dagen verwijderd.

KB/0147 / Claimsbeleid v3.2 / Fictief bedrijf
  1. Dit is een document dat je AI leest.
  2. Deze regel stond er altijd al.
  3. Het vertrouwt elke pagina evenveel.
  4. Dit is alles waar het bij kan.
  5. Wij testen beide kanten van de lijn.

MODEL LAYER

STACK LAYER

  • KNOWLEDGE BASE
  • RETRIEVAL
  • AGENT
  • TOOLS
    EMAIL / CRM / REFUNDS
  • MCP SERVER
  • WEB APP
  • API GATEWAY
  • IDENTITY
  • TENANT DATA
  • OBJECT STORAGE
  • CLOUD ACCOUNT
  1. 01 UNREVIEWED TEXT
    STORED AS POLICY LLM01:2026 / PROMPT
    INJECTION
  2. 02 RETRIEVED AS TRUSTED
    CONTEXT ASI06 / MEMORY AND
    CONTEXT POISONING
  3. 03 INSTRUCTION FOLLOWED LLM03:2026 / EXCESSIVE
    AGENCY
  4. 04 THIRD-PARTY TOOL,
    NEVER REVIEWED ASI04 / AGENTIC SUPPLY
    CHAIN
  5. 05 TOKEN SCOPED WIDER
    THAN THE TASK API1:2023 / BROKEN
    OBJECT LEVEL
    AUTHORIZATION
    GET /claims/48213 / 200
  6. 06 ANOTHER TENANT’S
    RECORD WSTG-ATHZ / TENANT
    ISOLATION
FIG. 0 / HET BEREIK. Een regel die niemand controleerde, gevolgd van de kennisbank via retrieval, de agent en een MCP-server van derden tot in de API-gateway en het record van een andere klant.

  1. Dit is een document dat je AI leest.
  2. Deze regel stond er altijd al.
  3. Het vertrouwt elke pagina evenveel.
  4. Dit is alles waar het bij kan.
  5. Wij testen beide kanten van de lijn.

Niet zichtbaar voor een reviewer / gelezen door het model

OWASP LLM01 / prompt injection, indirect

Les: opgehaalde tekst is data, geen instructie

  1. 01 / ongecontroleerde tekst opgeslagen als beleid. LLM01:2026 / PROMPT INJECTION
  2. 02 / opgehaald als vertrouwde context. ASI06 / MEMORY AND CONTEXT POISONING
  3. 03 / instructie opgevolgd. LLM03:2026 / EXCESSIVE AGENCY
  4. 04 / tool van derden, nooit gecontroleerd. ASI04 / AGENTIC SUPPLY CHAIN
  5. 05 / token ruimer dan de taak. API1:2023 / BROKEN OBJECT LEVEL AUTHORIZATION
  6. 06 / het record van een andere klant. WSTG-ATHZ / TENANT ISOLATION

Elk systeem heeft een versie van zichzelf die alleen aanvallers zien. Wij vinden die eerst, in de code en in het gesprek, en maken er een lijst van die je engineers kunnen afvinken.

Je product heeft nu twee aanvalsoppervlakken: de code en het gesprek.

01 / Modellaag

AI Pentest

Wat het zegt, deelt en doet als een vreemde typt.

  • Prompt injection, direct en indirect
  • Lekken van systeemprompt en data
  • RAG-poisoning en retrieval over klantgrenzen heen
  • Misbruik van tools, te veel handelingsruimte, MCP-servers
  • Onveilige verwerking van output
  • Denial of wallet

Gekoppeld aan twee risicolijsten, de OWASP Top 10 for LLM Applications en de OWASP Top 10 for Agentic Applications, en aan MITRE ATLAS. Elke bevinding krijgt een reproductiescore.

CHATBOT & RAG
EUR 4.000 tot 10.000
AGENT & MCP
EUR 6.000 tot 15.000

Bekijk AI Pentest

02 / Stacklaag

Stack Pentest

Wat de ene gebruiker de andere kan aandoen, en hoe ver een zwakke plek reikt.

  • Webapplicaties en bedrijfslogica
  • Autorisatie en scheiding tussen klanten
  • REST- en GraphQL-API’s
  • Authenticatie en sessies
  • Cloud: AWS, Azure, GCP
  • Externe infrastructuur

Gekoppeld aan de OWASP WSTG en de risicolijst voor API’s, de OWASP API Security Top 10 (2023), beoordeeld in CVSS v4.0.

WEB & API
EUR 5.000 tot 15.000
CLOUD & INFRA
Offerte op maat

Bekijk Stack Pentest

Scopinggesprek van 30 minuten.

De meeste tests beginnen met een vraag die iemand net stelde.

  1. Een klant vroeg om ons pentestrapport.

    Een vragenlijst, een SOC 2-periode of een ISO 27001-audit wacht erop. Wij bepalen de scope in één gesprek en schrijven het rapport dat hun securityteam verwacht.

  2. We zetten AI op ons platform.

    Een chatbot, RAG-zoekfunctie of agent met echte tools gaat live op je SaaS. Wij testen de functie en alles waar die bij kan, voordat vreemden dat doen.

  3. Wij bouwen agents voor klanten.

    Je klanten willen onafhankelijk bewijs voor de agent en de app eromheen. Wij testen vóór de oplevering, rapporteren eerst aan jou en benaderen je klant nooit zelf.

Werk je zelf in security? Sla dit over en lees de werkwijze.

Plaat 01 / Fig. 1

Zes plekken waar we kijken. Drie in het model, drie in de stack.

In de prompt

Naar wie luistert het?

Directe en indirecte prompt injection, jailbreaks en het lekken van de systeemprompt.

Gekoppeld aan

  • LLM01:2026 / PROMPT INJECTION
  • LLM08:2026 / HIDDEN CONTEXT EXPOSURE

In de context

Wat onthoudt het, en voor wie?

RAG-poisoning, retrieval over klantgrenzen heen, gevoelige data in embeddings en geheugen.

Gekoppeld aan

  • LLM02:2026 / SENSITIVE INFORMATION DISCLOSURE
  • ASI06 / MEMORY AND CONTEXT POISONING
  • LLM09:2026 / VECTOR AND EMBEDDING WEAKNESSES

In de tools

Wat doet het als een ander het zegt?

Misbruik van tools en function calls, te veel handelingsruimte, review van MCP-servers, onveilige verwerking van output en op hol geslagen kosten.

Gekoppeld aan

  • ASI02 / TOOL MISUSE
  • ASI03 / IDENTITY AND PRIVILEGE ABUSE
  • ASI04 / AGENTIC SUPPLY CHAIN
  • LLM03:2026 / EXCESSIVE AGENCY
  • LLM06:2026 / UNBOUNDED CONSUMPTION

In de app

Wat kan de ene gebruiker de andere aandoen?

Bedrijfslogica, autorisatie, sessiebeheer en het misbruik in meerdere stappen dat scanners niet nabootsen.

Gekoppeld aan

  • WSTG-ATHZ / AUTHORIZATION
  • WSTG-BUSL / BUSINESS LOGIC
  • WSTG-SESS / SESSION MANAGEMENT

In de API

Welke objecten geeft het aan wie er maar om vraagt?

Autorisatie op object- en functieniveau, toegang per eigenschap, rate limits en de endpoints die niemand documenteerde.

Gekoppeld aan

  • API1:2023 / OBJECT LEVEL AUTHORIZATION
  • API3:2023 / PROPERTY LEVEL AUTHORIZATION
  • API4:2023 / RESOURCE CONSUMPTION
  • API5:2023 / FUNCTION LEVEL AUTHORIZATION
  • API9:2023 / INVENTORY MANAGEMENT

In de cloud

Hoe ver reikt één zwakke plek?

Identiteit en toegang, open opslag, secrets in build-pipelines en de route van één dienst naar de rest van het account.

Gekoppeld aan

  • IAM
  • STORAGE
  • CI/CD

MODEL LAYER

STACK LAYER

  • KNOWLEDGE BASE
  • RETRIEVAL
  • AGENT
  • TOOLS
    EMAIL / CRM / REFUNDS
  • MCP SERVER
  • WEB APP
  • API GATEWAY
  • IDENTITY
  • TENANT DATA
  • OBJECT STORAGE
  • CLOUD ACCOUNT
  • LLM01:2026
    LLM08:2026
  • LLM02:2026
    ASI06
    LLM09:2026
  • ASI02
    ASI03
    ASI04
    LLM03:2026
    LLM06:2026
  • WSTG-ATHZ
    WSTG-BUSL
    WSTG-SESS
  • API1:2023
    API3:2023
    API4:2023
    API5:2023
    API9:2023
  • IAM
    STORAGE
    CI/CD
FIG. 1 / WAAR WE KIJKEN. Drie gebieden in de modellaag en drie in de stacklaag. Het gekozen gebied is gearceerd en omlijnd; de framework-ids staan ernaast.

Toezeggingen

01 / 02

  1. Bij stackbevindingen krijg je de exacte requests. Bij modelbevindingen krijg je een reproductiescore.Noot 1

  2. Wij verkopen geen guardrail, firewall of platform. Bij onze bevindingen hoort geen verkooppraatje.Noot 2

Plaat 00 / Mariotte, 16681

Vind eerst je eigen blinde vlek.

  1. Sluit je linkeroog.
  2. Kijk met je rechteroog naar het +.
  3. Scrol langzaam. Kijk niet naar de stip.Beweeg je hoofd langzaam naar het scherm.
Overslaan
Fig. 00 / Van bovenaf gezien

Je zag hem niet verdwijnen. Je logs ook niet.

Ergens onderweg verdween de stip, en het raster sloot zich over het gat. Je brein vulde de leegte met wat het verwachtte te zien. Elk oog heeft zo’n plek. Elk systeem ook. Dat is het deel dat wij testen.

SCOTOMA
/sko-TOO-ma/
zn.
een blinde vlek in een verder normaal gezichtsveld.

Elk systeem heeft er één. Wij vinden de jouwe als eerste.

We zijn een nieuw pentestbedrijf. Zo controleer je ons toch.

Onze eerdere klanten kun je nog niet bellen. Daarom maakten we al het andere controleerbaar: de methode waarmee we testen, de regels die we volgen, een voorbeeld van het rapport dat je krijgt, en deze site zelf.

Voorbeeld / fictieve klant / echt format

Field Test / 24-2. 54 testcategorieën, ingedeeld als een 24-2 gezichtsveldtest. Het fictieve voorbeeld heeft 7 bevindingen, 3 categorieën die niet van toepassing zijn en 8 buiten scope, gestippeld, twee binnen de lijn waar de blinde vlek ligt.
  • Kritiek
  • Hoog
  • Middel
  • Laag
  • Getest, niets gevonden
  • N.v.t.
  • Buiten scope

De enige blinde vlek in ons rapport is de vlek die jij buiten scope laat.

Bekijk een voorbeeldrapport

Methode v1.0

  1. Scoping
  2. Dreigingsmodel
  3. Testen
  4. Verificatie
  5. Ernst
  6. Rapportage
  7. Hertest

v1.0 · 2026-10 · eerste publieke versie

Lees de werkwijze

Spelregels

  1. Eerst schriftelijke toestemming.

De volledige regels gaan ook over testvensters, hoe het testen stopt, hoe kritieke bevindingen je bereiken en wat er met je data gebeurt.

Spelregels

Standaarden

  • OWASP Top 10 for LLM Applications 2026
  • OWASP Top 10 for Agentic Applications (2026)
  • MITRE ATLAS
  • OWASP WSTG
  • OWASP API Security Top 10 (2023)
  • CVSS v4.0
  • PTES

Gekoppeld aan de standaarden die je auditors al gebruiken.

Tellers

OWASP LLM-categorieën die we testen
10/10
ATLAS-technieken in beide pakketten
32
Geteld bij de build uit MITRE ATLAS v2026.09.
Dagen sinds de Cyberbeveiligingswet geldt
57
Geteld vanaf 15 augustus 2026, in je browser.

Stel je scope samen

Hoe zou jouw test eruitzien?

Wat gaan we testen?

Modellaag

Stacklaag

Kies ‘weet ik nog niet’, scopen is ons werk.

Hoeveel apps of API’s?
Gebruikt de AI tools of voert hij acties uit?
Waar draait het?

Alleen gebruikt op deze pagina, voor het aandeel hieronder. Nooit verstuurd, nooit opgeslagen.

EUR 5.000 tot 15.000Naar de offerte
Indicatieve bandbreedte

EUR 5.000 tot 15.000

Stack Pentest / Web en API

    Testdagen
    4 tot 10
    Rapport + verklaring
    Inbegrepen

    Indicatief. De offerte volgt na het scopinggesprek.

    Uit de leeszaal.

    Hoe we denken over wat we testen, uitgeschreven met de framework-ids erbij.

    Vragen die kopers stellen vóór het gesprek.

    AI-pentest

    Wat is een AI-pentest?

    Een AI-pentest is een geautoriseerde beveiligingstest van een chatbot, RAG-toepassing of AI-agent. We kijken of hij zich laat ompraten of misleiden tot het lekken van data, het negeren van zijn instructies of het misbruiken van zijn tools, en we koppelen elke bevinding aan de OWASP Top 10 for LLM Applications, de OWASP Top 10 for Agentic Applications en MITRE ATLAS.

    Wat is het verschil met een gewone pentest?

    Een gewone pentest onderzoekt code, configuratie en infrastructuur. Een AI-pentest onderzoekt ook wat het systeem doet met wat het leest: prompts, opgehaalde documenten, toolresultaten en geheugen. De ernstigste problemen lopen door tot in de stack, dus we testen beide lagen en rapporteren de paden ertussen.

    Hebben jullie onze systeemprompt nodig?

    Het helpt en het maakt de test korter. Grey-box-toegang (systeemprompt, tooldefinities, testaccounts) geeft de meeste dekking per dag. We kunnen ook black box testen, zoals een aanvaller van buiten dat zou doen, en rapporteren wat we zelf konden afleiden.

    Stack-pentest

    Accepteren onze auditor en onze klanten het rapport?

    Het rapport vermeldt scope, methode, testdatums, kwalificaties van de tester, ernst in CVSS v4.0 en de hertest-status: waar securityteams van grote klanten en SOC 2- of ISO 27001-auditors naar kijken. Met een verklaring van één pagina deel je het resultaat zonder de bevindingen te delen.

    Prijzen

    Wat kost een test?

    Onze bandbreedtes, exclusief btw: AI-chatbot of RAG EUR 4.000 tot 10.000; AI-agent en MCP EUR 6.000 tot 15.000; webapplicatie en API EUR 5.000 tot 15.000; een SaaS-platform met zijn AI-functie (Launch Clearance) EUR 10.000 tot 20.000. Na een scopinggesprek van 30 minuten volgt een offerte.

    Werkwijze

    Kunnen jullie een chatbot testen die we bij een leverancier hebben gekocht?

    Ja, met schriftelijke toestemming van de leverancier voor alles wat zij hosten. Wij leveren het sjabloon voor de vrijwaringsverklaring en regelen het papierwerk samen met je.

    Regelgeving

    Hebben we een pentest nodig voor SOC 2 of ISO 27001?

    SOC 2 vereist er strikt genomen geen, maar een point of focus onder CC4.1 noemt penetratietesten als evaluatiemethode, en auditors en klanten verwachten er een. De ISO 27001:2022-beheersmaatregelen A.8.8 (technische kwetsbaarheden) en A.8.29 (beveiligingstests) worden vaak aangetoond met een pentestrapport.

    Geldt de Cyberbeveiligingswet (NIS2) voor ons?

    Als je organisatie een middelgrote of grotere entiteit is in een van de 18 sectoren (sommige typen ongeacht hun omvang), geldt de wet sinds 15 augustus 2026. Vallen je klanten eronder, dan bereiken hun beveiligingsvragenlijsten je nu via de zorgplicht voor de toeleveringsketen, en een recent pentestrapport is daarop het meest directe antwoord.

    Wij zijn een bank of verzekeraar. Verandert DORA de test?

    Ja. DORA geldt sinds 17 januari 2025 en is voor financiële entiteiten de regeling voor ICT-risico en testen, in plaats van NIS2. Testen onder artikel 25, de chatbot en de AI-laag inbegrepen, is ons werk. TLPT onder artikel 26 doen we nog niet: artikel 27 stelt eisen aan testers waaraan een bedrijf zo jong als het onze nog niet voldoet.

    Verplicht de AI-verordening ons om onze chatbot op beveiliging te testen?

    Voor AI-systemen met een hoog risico eist artikel 15 nauwkeurigheid, robuustheid en cyberbeveiliging, vanaf 2 december 2027 voor systemen uit bijlage III onder de Digitale omnibus inzake AI, Verordening (EU) 2026/1744. De meeste klantenservicechatbots zijn geen AI-systeem met een hoog risico, maar de transparantieplicht van artikel 50 geldt sinds 2 augustus 2026. Wij leveren testbewijs; de classificatie is aan je juridisch adviseur.

    Geldt de Cyber Resilience Act voor SaaS?

    Meestal niet. De CRA gaat over producten met digitale elementen, zoals geïnstalleerde software, apps en apparaten; SaaS valt er alleen onder als gegevensverwerking op afstand van zo’n product. Of NIS2 (in Nederland de Cyberbeveiligingswet) voor je geldt, hangt af van je sector en omvang. De meldplichten van de CRA gelden sinds 11 september 2026.

    Bedrijf

    Zijn jullie een onafhankelijk AI-securitybedrijf?

    Ja. We verkopen geen guardrail, firewall of platform, en geen leverancier is eigenaar van ons. Sinds 2025 hebben platformleveranciers meerdere onafhankelijke AI-securitybedrijven gekocht, en bij hun test hoort nu al snel een product. Bij de onze hoort een lijst met oplossingen.

    Wie doet het testen?

    De oprichter leidt elke opdracht en doet het testwerk zelf. Diens kwalificaties komen op deze site zodra je ze stuk voor stuk zelf kunt controleren, en niet eerder.