De toolbeschrijving is onderdeel van de prompt
Zodra een agent verbinding maakt met een MCP-server, wordt elke toolbeschrijving tekst die het model leest en opvolgt. Een vergiftigde beschrijving kan het model opdragen een private key te lezen voordat het twee getallen optelt, alle mail via één tool te sturen of daarover te zwijgen. De scanner controleert namen, beschrijvingen en schema's op die kenmerken, op verwijzingen naar andere tools van dezelfde server en op uitgaande URL's.
Het voorbeeldmanifest op de labs-pagina laat zien hoe dat eruitziet: een onschuldige add-tool met een <IMPORTANT>-blok dat om ~/.ssh/id_rsa vraagt, en een send_email-tool die voorrang opeist boven de agenda. Geen van beide zou opvallen in een chattranscript.
Behandel MCP-servers als browserextensies met shelltoegang. Zet versies vast, vergelijk beschrijvingen bij elke update en draai niet-vertrouwde servers zonder bestands- of netwerktoegang. Een agent-review controleert precies die drie dingen.
Start het lab: MCP-scanner voor tool poisoning →
Een lab toont één signaal. In het gesprek controleren we de hele keten.
Plan een gesprek van 30 minuten