OpenAI mener lanseringen av GPT-6 Astra kan bli et historisk vendepunkt for utviklingen av kunstig intelligens. Selskapets president Greg Brockman sa på en pressekonferanse 3. september at modellen kan være den som i ettertid blir sett på som starten på kunstig generell intelligens, AGI.

AGI brukes vanligvis om en hypotetisk kunstig intelligens som kan lære og resonnere på menneskelignende måte på tvers av mange typer oppgaver, i stedet for å være svært god på ett avgrenset område. Påstanden kommer samtidig som flere ledere i teknologibransjen allerede har hevdet at denne terskelen er nådd.

OpenAI skal samtidig ha droppet den planlagte lanseringen av GPT-6.1 Astra av sikkerhetshensyn. Uavhengige forskere og utviklere av AI-tester mener dessuten at deler av Astra-resultatene kan være drevet av nøye optimalisering av instruksjoner og testoppsett, snarere enn en genuint generell intelligens.

Viser sterke resultater i spesialiserte tester

OpenAI publiserte resultater fra et bredt utvalg tester som måler ulike sider ved kunstig intelligens. Selskapet hevder at Astra presterer best i bransjen på flere områder, blant annet programvareutvikling, selvstendig bruk av dataprogrammer, matematikk og vitenskapelig forskning.

I demonstrasjoner genererte modellen kode til 3D-CAD, plasserte et kretskort i et CAD-program, gjorde digitale 3D-modeller om til interaktive miljøer som minner om videospill, og satte opp nettapplikasjoner etter en instruksjon fra brukeren.

OpenAI viste også til lovende resultater innen juridisk arbeid. Niko Gruppen, leder for anvendt forskning hos AI-selskapet Harvey, sa at Astra i tidlige tester skilte mellom dokumenter og bekreftede opplysninger, avdekket ubegrunnede antakelser og omsatte mangler til konkrete forslag til dokumentarbeid.

Ifølge OpenAI slo GPT-6 Astra både forgjengeren GPT-5.6 Sol og ledende konkurrenter med 10–20 prosent i spesialiserte tester. Resultatene omfattet blant annet:

  • 98 prosent i FrontierMath Tier 4 (v2), som måler matematisk resonnering på ekspertnivå.
  • 100 prosent i ExploitBench, som tester evnen til å gjennomføre offensive cybersikkerhetsoppgaver.
  • 95,9 prosent i BenchCAD, som vurderer gjenoppbygging av 3D-objekter ved hjelp av CAD-kode.
  • 57,9 prosent i Terminal-Bench 4.0, som tester komplisert terminalarbeid, systemadministrasjon og programvareutvikling.
  • 41,4 prosent i AutomationBench, som måler hvor godt en AI-agent kan gjennomføre flertrinns arbeidsflyter på tvers av flere programmer.

Et nesten perfekt resultat har en viktig begrensning

Den største oppmerksomheten fikk testen ARC-AGI-3. Den skal måle hvor effektivt AI-systemer lærer nye og abstrakte oppgaver i ukjente miljøer. Astra fikk 99,9 prosent i OpenAIs offentliggjorte resultat.

En uavhengig kontroll utført av den ideelle organisasjonen ARC Prize Foundation viste at Astra lå over menneskenes referansenivå for «handlings effektivitet» på 96 prosent av nivåene. I gjennomsnitt trengte modellen 51,7 prosent færre handlinger enn mennesker for å løse oppgavene.

«Dette er ikke bare den beste modellen vi noensinne har testet», sa ARC Prize Foundations president Greg Kamradt i en uttalelse fra OpenAI.

Kamradt mente Astra representerer et betydelig sprang for avanserte modeller, både når det gjelder å orientere seg i og løse nye oppgaver, og hvor effektivt modellen lærer å gjøre det.

Forskere har likevel påpekt at toppresultatet i ARC-AGI-3 bygget på et proprietært rammeverk kalt «Provider Adapter». Dette er et spesialisert programvarelag som ikke er tilgjengelig for andre utviklere. Da testen ble kjørt med det rammeverksnøytrale standardoppsettet, falt resultatet til 62,7 prosent.

ARC Prize-organisasjonen har også understreket at det å «mette» en test – altså oppnå et resultat nær maksimum – ikke er bevis på AGI. ARC-AGI-3 består av lukkede og deterministiske oppgaver, og gjenspeiler derfor ikke kompleksiteten i den åpne verden.

Forskjeller i tallene skaper spørsmål

Det kom spørsmål om datagrunnlaget allerede før den offisielle lanseringen. Fortune meldte at en versjon av materialet som var sendt til mediene under embargo, oppga en Astra-skår på 98,6 prosent i ARC-AGI-3. På modellens offentlige nettsted sto resultatet senere som 99,9 prosent.

Doktorgradsforskerne Anka Reuela og Mike Hardy ved Stanford University viste også til at OpenAI i det stille endret flere av de publiserte tallene etter lanseringen. Blant annet ble den oppgitte hallusinasjonsraten først redusert fra 4,2 til 2,0 prosent, før den senere ble satt tilbake til 4,2 prosent.

I et intervju med Fortune knyttet Reuela og Hardy de skiftende tallene til det bransjen omtaler som «benchmaxxing». Begrepet brukes om praksisen med å kjøre tester på nytt med litt endrede instruksjoner, programvareoppsett eller fordeling av datakraft for å finne den høyest mulige teoretiske skåren.

I en studie fra 2025 med tittelen «Benchmarking is Broken – Don’t Let AI be its Own Judge», publisert på forhåndstrykkserveren arXiv, advarte eksperter mot at slike metoder skaper uklarhet og svekker tilliten til resultatene. Blant medforfatterne var Princeton-doktoranden Zerui Chen og Stella Wönig, postdoktor ved Universitetet i Luxembourg.

Forskerne mente at problemet blir særlig alvorlig når den tekniske dokumentasjonen ikke beskriver selv den grunnleggende metoden. Da blir uavhengig kontroll i praksis svært vanskelig.

Resultater som er oppnådd på denne måten, kan beskrive en idealisert toppytelse under optimale laboratorieforhold. De sier ikke nødvendigvis noe om hvor pålitelig systemet er når det tas i bruk uten særskilt tilpasning.

Uavhengig analyse finner både framgang og tilbakegang

Resultatene fra det eksterne AI-analysemiljøet Artificial Analysis står i kontrast til deler av OpenAIs offentliggjorte tall. I Artificial Analysis Intelligence Index, som sammenstiller vurderinger av avanserte modellers generelle resonneringsevner, fikk Astra 61 poeng – nøyaktig det samme som GPT-5.6 Sol.

Astra lå dessuten bak konkurrenter som Anthropic Claude Fable 5.1 og Meta Muse Spark 1.3.

Artificial Analysis fant forbedringer på enkelte områder, men svakere prestasjoner på andre. I GDPval-AA v2, en arbeidslivsorientert test som måler reelle oppgaver i 44 yrker, kom Astra betydelig dårligere ut i rangeringen enn GPT-5.6 Sol. Det ble også registrert tilbakegang i tester av kundeservice, vitenskapelig Python-programmering og resonnering over lange tekstmengder.

Samtidig var Astra mer effektiv når det gjaldt bruken av tokens, altså tekst- eller databiter modellen behandler. I tester av programvareutvikling var modellen ifølge Artificial Analysis rundt 70 prosent mer effektiv enn GPT-5.6 Sol. Den brukte omtrent en tredel så mange tokens som forgjengeren og en femtedel så mange som Claude Opus 5.

I vurderingen Agents’ Last Exam, som måler profesjonelle arbeidsoppgaver, reduserte Astra antallet genererte tokens med opptil 65 prosent sammenlignet med Opus 5. I tester av generell intelligens brukte Astra, med maksimal innsats, rundt 10 prosent færre genererte tokens enn Sol.

Bedre effektivitet, men langt høyere pris

Effektivitetsgevinsten blir imidlertid betydelig mindre når kostnadene tas med i regnestykket. Grunnprisen for GPT-6 Astra gjennom API-et økte med 250 prosent sammenlignet med GPT-5.6 Sol.

Prisen for input-tokens steg fra 4 til 10 dollar per million, mens output-tokens økte fra 20 til 50 dollar per million. Dermed blir én oppgave i tester av generell intelligens omtrent 75 prosent dyrere med Astra enn med forgjengeren, selv om modellen bruker 10 prosent færre tokens i svaret.

Forholdet har fått Artificial Analysis-forskere til å spørre om AI-laboratorier bruker dyr «brutal kraft» fra datamaskiner for å presse fram små forbedringer, i stedet for å oppnå fundamentale teknologiske sprang.

OpenAI legger større vekt på sikkerhet

Med den nye modellen har OpenAI også lagt større vekt på sikkerhetsmekanismer og kontroll. Det skjer etter flere oppsiktsvekkende hendelser der avanserte AI-modeller under testing utilsiktet brøt seg inn i tredjeparters nettverk og datasystemer. I slike situasjoner gikk modellene lenger enn menneskene hadde forutsett da de møtte kompliserte oppgaver.

OpenAI hevder at Astra ikke overskred grensene som var satt for modellen i sikkerhetstestene. Til sammenligning gikk GPT-5.6 Sol utenfor de autoriserte parameterne i nær halvparten av testtilfellene.

Selskapet oppga også en betydelig reduksjon i hallusinasjoner. I interne tester var raten 4,2 prosent, mot 12,2 prosent for GPT-5.6 Sol. I Artificial Analysis’ uavhengige tester, med maksimal innsats, ble det derimot målt en reduksjon fra 92 til 51 prosent. Modellen skal også ha blitt bedre til å håndtere uklare instrukser.

Handler utviklingen om mer enn merkelappen AGI?

David Wood, styreleder i den ideelle organisasjonen London Futurists, mener utviklingen av Astra bør vurderes ut fra mer enn enkeltresultater i tester. Organisasjonen arrangerer diskusjoner om ny teknologi.

Etter Woods vurdering er det viktigste ikke om Astra formelt kan kalles AGI, men at forholdet mellom mennesker og kunstig intelligens er i ferd med å endre seg. Modellene går fra å svare på spørsmål til å gjennomføre kompliserte mål på egen hånd i digitale miljøer.

Wood mener derfor at diskusjonen om Astra kan klassifiseres som AGI, er mindre viktig enn behovet for å sørge for at kontrollen og styringen av kunstig intelligens utvikler seg like raskt som teknologien.

«Muligheten for at kunstig intelligens fra systemer som Astra kan utvikle seg til et allsidig superintellekt, gjør behovet for menneskelig årvåkenhet, forståelse og samarbeid stadig mer presserende», sa han.