AI-agenter brukes allerede av millioner av organisasjoner. Samtidig øker risikoen for at teknologien misbrukes til å hente ut innhold fra databaser, konfidensiell selskapsinformasjon og personopplysninger.
De siste fem månedene har Google og fire andre organisasjoner avdekket sårbarheter som kan gjøre det mulig for én agent i et målrettet nettverk å spre skadelige instruksjoner til andre interne agenter. Det er en særskilt form for promptinjeksjon: Angrepet rettes ikke direkte mot en stor språkmodell, men mot en bestemt agent – for eksempel et verktøy for oversettelse eller dataanalyse.
Agenter stoler på hverandre
Beskyttelsen rundt slike spesialiserte agenter er ofte svak eller helt fraværende. En agent kan motta en tekst som er utformet av en angriper, sende den videre til neste agent som en vanlig delegert oppgave, og få den andre agenten til å utføre instruksjonen fordi den stoler på agenten som sendte oppgaven.
Den uavhengige forskeren Syed Anas Mohiuddin undersøkte agenter hos blant andre Google, JP Morgan Chase, Weviate, Rapid7, det franske regjeringsdirektoratet for digitalisering og amerikanske føderale myndigheter. Konseptbevis-angrepene hans utnyttet tillitsmangler i MCP, eller Model Context Protocol.
MCP er en standard som lar AI-applikasjoner og agenter kommunisere i et internt nettverk. Mange spesialiserte agenter mangler samtidig beskyttelse som normalt kunne begrenset de farligste konsekvensene av promptinjeksjon. MCP-servere lagrer dessuten tilgangsopplysninger for hver agent, mens agentene som standard er laget for å stole på andre interne agenter.
Dermed kan et angrep som en stor språkmodell ville ha avvist, lykkes dersom det sendes gjennom en agent som er valgt med omhu. I mange tilfeller kan nøye utformede instruksjoner utløse såkalte server-side request forgery-angrep, SSRF. Det er en sårbarhet som kan få en nettserver til å gjøre uautoriserte forespørsler mot andre deler av nettverket.
Hver del gjør jobben sin
Makī påpekte at hvert ledd i en slik kjede gjør akkurat det det er laget for å gjøre. Det gjør angrepet vanskelig å oppdage: Hver protokoll er utviklet med antakelsen om at den fungerer selvstendig, og kontrollerer derfor sikkerheten ved sine egne «inngangsdører», mens ingen følger med på korridoren mellom protokollene.
Sårbarheten CVE-2026-97228, som ble funnet i Rapid7s nettverk, fikk en alvorlighetsgrad på 2,7 av 10. Rapid7 utbedret den forrige måned.
Sårbarheten hos Google var mer alvorlig og fikk en vurdering på 8 av 10. Problemet var knyttet til MCP-verktøykassen googleapis/mcp-toolbox, som er laget for databaser. Verktøykassen opprettet en HTTP-klient uten å bruke en CheckRedirect-policy – et sett med innstillinger som bestemmer hvordan serveren skal håndtere en URL som returnerer en feil eller videresender til en annen adresse.
Googles HTTP-klient kontrollerte heller ikke IP-adressene den skulle koble til.
«En utformet parameter i nettadressen kunne tvinge verktøykassen til å følge en videresending til et internt endepunkt og sende forespørsler på vegne av angriperen», forklarte Mohiuddin.
Googles løsning innførte en liste over tillatte IP-intervaller og blokkeringslister. En usikker basis-URL blir nå avvist allerede når programmet starter, i stedet for først når den første forespørselen sendes. Ifølge forskeren er dette et godt eksempel på SSRF-beskyttelse, selv om de fleste MCP-servere ennå ikke har innført tilsvarende kontroller.
Uenige om navnet på angrepet
Mohiuddin kaller angrepsklassen «protokollpivotering». Begrepet viser til at en applikasjon eller server bruker MCP til å gi en agent en oppgave, før agenten sender skadelige instruksjoner videre til en annen agent som kommuniserer gjennom en annen metode.
Googles Agent-to-Agent-protokoll, A2A, er ett eksempel. Den er laget for delegering mellom agenter. Også nye standarder som Agent Network Protocol nevnes i denne sammenhengen.
Ifølge Mohiuddin kan tillit eller autorisasjon i praksis gå tapt når instruksjoner sendes mellom protokoller. Han beskriver «protokollpivotering» som et flertrinnsangrep der angriperen først får tilgang gjennom én protokoll, utnytter tillitsantakelser mellom protokollene og deretter får tilgang til funksjoner som bare er tilgjengelige gjennom en annen protokoll.
Markus Vervjé fra X41 D-Sec, som også har utviklet AI-angrep som utnytter MCP, mener likevel at den mest presise betegnelsen fortsatt er promptinjeksjon. Etter hans vurdering er metoden Mohiuddin beskriver, bare en enkel variant av dette.
Advarer mot manglende nulltillit
Angrepsmetoden fungerte mot fem organisasjoner som først og fremst hadde MCP-bruken til felles. Det er bemerkelsesverdig fordi MCP fortsatt er en relativt ny standard, men allerede har blitt utbredt før den er tilstrekkelig testet og sikret.
Mens organisasjoner har skyndt seg med å bygge kompliserte agentarkitekturer, har de ifølge forskerne nedprioritert sikkerhetsprinsippet «nulltillit», eller zero trust. I en slik modell bygges nettverket med utgangspunkt i at én eller flere noder kan være kompromittert. For å begrense konsekvensene må hver node kreve autorisasjon fra en annen node før sensitive handlinger utføres.
«Den viktigste lærdommen jeg håper folk tar med seg, er denne: Alt som kommer fra en stor språkmodell inn i verktøyet ditt, må behandles som inndata fra en fremmed på internett, for i et promptinjeksjonsscenario er det nettopp det det er», sa Makī.
Han la til at de underliggende problemene – injeksjon og SSRF – har vært kjent lenge, og at prinsippene for å håndtere dem ikke har endret seg på 20 år. Samtidig mener han forskeren fortjener anerkjennelse for å ha gitt angrepet et navn, fordi et tydelig begrep kan hjelpe sikkerhetsfolk og standardutviklere med å lage mer målrettede forsvar.
Teknologi
Teknologi
Internett