Vannmerket vil ikke være synlig når teksten leses eller kopieres. OpenAI skal bruke teknologien textGrain, som gjør små endringer i modellens ordvalg for å skape et statistisk mønster som senere kan identifiseres.

«I løpet av de kommende ukene vil vi legge til et usynlig vannmerke i relevant tekst fra ChatGPT og Codex i EU», opplyser OpenAI.

Funksjonen blir foreløpig ikke aktivert som standard globalt. Fra 6. oktober kan API-utviklere over hele verden frivillig slå på vannmerking for modeller som støtter funksjonen, men innstillingen vil være avslått som standard. OpenAI har samtidig begynt å ta imot søknader om tilgang til verktøyet som kan oppdage vannmerkene. I første omgang blir tilgangen begrenset til godkjente forskere og ekspertorganisasjoner.

Redigering svekker treffsikkerheten

OpenAI erkjenner at tekstvannmerking ikke er en sikker metode. Selskapets tester viser at selv relativt vanlig redigering kan redusere muligheten for å identifisere KI-generert tekst betydelig.

I en test med tekstutdrag på 400 token sank treffsikkerheten fra rundt 92 til 66 prosent da 10 prosent av ordene ble erstattet med synonymer. Da 25 prosent av ordene ble byttet ut, falt treffsikkerheten til 17 prosent.

Med et mål om én prosent falske positive treff ble vannmerket funnet i omtrent 80 prosent av 200 token lange svar om psykologi. For svar på 400 token økte andelen til rundt 95 prosent. Resultatene var svakere i matematikk, fordi modellen har mindre frihet til å velge mellom ulike ord i denne typen tekst.

«Hvis vannmerket ikke blir funnet, beviser det ikke at teksten er skrevet av et menneske», advarer OpenAI.

Selskapet påpeker at tekst som er generert med verktøyene, kan være for kort, redigert eller oversatt til at deteksjonen fungerer pålitelig.

Avslører ikke konto eller samtale

OpenAI hevder at et funnet vannmerke ikke vil avsløre hvem som genererte teksten, hvilken konto som ble brukt, eller hvilken forespørsel eller samtale teksten stammer fra. Det vil heller ikke være mulig å fastslå hvor stor del av sluttproduktet som er laget eller redigert av et menneske.

OpenAI Eiropas Savienībā pievienos ChatGPT un Codex tekstiem neredzamu ūdenszīmi
Foto avots: tinte.lv · kilde ↗

OpenAI opplyser også at vannmerkingen ikke påvirker kvaliteten til GPT-6 Astra i vesentlig grad. Sammenlignende tester med textGrain skal samlet sett ha gitt resultater som ligner resultatene uten funksjonen.