GPT-6 Astra og Claude Fable 5.1 kom denne uken. Jeg mener de sier noe ganske tydelig om hvor vi er på vei: Flere av oppgavene vi regner som krevende kontorarbeid, kan nå overlates til en AI som faktisk utfører arbeidet. Det flytter ansvaret vårt. Vi må bli langt mer presise på hva den skal få gjøre.
Fire måneder er blitt lang tid
I mai skrev vi om hvordan vi bruker AI i utviklingsarbeidet. Mye handlet om hjelp til å skrive kode, lage utkast og teste raskere. Den beskrivelsen dekker mindre av arbeidet som nå kan overlates til en agent.
OpenAI lanserte GPT-6 Astra 3. september. Modellen kombinerer resonnering, programmering, datamaskinstyring og dokumentarbeid. Den brukes blant annet i Codex og ChatGPT Work. Anthropic lanserte Claude Fable 5.1 1. september, med vekt på krevende arbeid med kode, kunnskap og lange oppgaver.
Datamaskinstyring fantes allerede i mai. Forskjellen jeg synes er mest interessant, er hvor mye av en sammenhengende oppgave vi kan forsøke å gi agenten ansvar for: undersøke, planlegge, bygge, kjøre tester og bruke resultatene til å rette eget arbeid.
Det finnes konkrete eksempler. I OpenAIs gjennomgang av spillet Void Explorer brukes Codex til kode, modeller og testing. Mennesker vurderer spillet og styrer retningen underveis. I Anthropics lansering beskriver Ramp en Fable 5.1-kjøring på 38 timer uten tilsyn. Det er en kundeerfaring formidlet av leverandøren, ikke en garanti for hva alle kan få til.
Disse eksemplene viser at agentene kan håndtere lange oppgaver med mange steg. Hvor lenge de kan arbeide uten hjelp, avhenger fortsatt av oppgaven, verktøyene og tilgangen de får.
Be om arbeidet du faktisk trenger
Trenger du bedre innsikt i Power BI? Be om en rapport som viser hvor marginene forsvinner, hvilke kunder som vokser, og hva som bør undersøkes nærmere. Microsofts Copilot kan lage og endre rapportsider fra en beskrivelse. Det betyr ikke at Astra automatisk har tilgang til Power BI. Verktøyet må kobles til riktig datagrunnlag, og noen må kontrollere at tallene betyr det rapporten hevder.
Trenger du å herde bedriftens egne systemer? Be om en gjennomgang av kode, tilganger og svakheter, med forslag som kan testes. Codex Security har en egen arbeidsflyt for forslag til systemherding. Jeg ville begynt med lesetilgang og et testmiljø, og krevd godkjenning før endringer settes i produksjon.
Ønsker du en app for bedriften? Beskriv hvem som skal bruke den, hva de skal få gjort, og hvilke opplysninger den trenger. La AI hjelpe med en fungerende prototype. Deretter må innlogging, datalagring og de vanskelige brukstilfellene tåle en ordentlig gjennomgang før appen tas i bruk.
Er arbeidsdagen fordelt på fem systemer og et regneark? Be om å få undersøkt hvordan de kan kobles sammen i ett grensesnitt for akkurat din arbeidsflyt. Kanskje slipper du å erstatte systemene. Du trenger kanskje bare en bedre måte å bruke dem på. Regnskapsregler, historikk og rettigheter forsvinner ikke fordi et nytt skjermbilde ser enklere ut.
Ja, jeg tror kontorjobber vil forsvinne
Jeg tror mange kontorjobber kommer til å endre seg raskt, og at noen vil forsvinne. Oppgaver som består av å hente informasjon, sammenligne den, flytte den mellom systemer og skrive en rapport, er åpenbare kandidater.
Det er min vurdering, ikke en dokumentert tidsplan for arbeidsmarkedet. En jobb består også av ansvar, prioriteringer, relasjoner og kunnskap som sjelden står samlet i et dokument. Hvor fort en bedrift kan endre seg, avhenger av mer enn modellens evner.
Likevel synes jeg bedrifter bør begynne å undersøke dette nå. Ta én faktisk arbeidsoppgave. Gi agenten et avgrenset miljø. Mål resultatet mot arbeidet dere gjør i dag, også feilene og tiden som går til kontroll.
Utviklere må forstå mer av helheten
Det er fristende å konkludere med at bedre AI gjør teknisk kunnskap mindre viktig. Min konklusjon er at utvikleren får et bredere ansvar.
Når en agent kan produsere mye kode, blir det viktigere å forstå om løsningen er riktig bygget. Hvilke data skal lagres hvor? Hvem får lese og endre dem? Hva skjer når en integrasjon svikter halvveis? Kan vi spore en feil og rulle tilbake endringen?
Vi må fortsatt kunne lese kode. Vi må i tillegg kunne vurdere arkitektur, sikkerhet, drift og samspillet mellom systemer. Vi må kjenne AI-verktøyenes begrensninger og lage tester som kan avsløre at agenten har misforstått oppgaven. Et grønt testresultat er lite verdt hvis testen bare gjentar den samme misforståelsen.
Sett grensene før du gir oppgaven
For meg handler fremtiden stadig mer om tydelige mål og grenser. En agent bør vite hvilke systemer den kan bruke, hva den får endre, og når den skal stoppe og spørre. OpenAIs råd for datamaskinstyring omfatter blant annet isolerte miljøer, begrensede tilganger og menneskelig kontroll ved handlinger med store konsekvenser.
«Gjør bedriften mer effektiv» er et dårlig oppdrag. «Lag et forslag til ukesrapport fra disse tre datakildene, uten å endre kildene eller sende noe til andre» er et oppdrag vi kan kontrollere.
Kraften i verktøyene gir oss rom til å være mer ambisiøse. Jeg vil bruke den til å bygge bedre løsninger, og bruke mer av utviklerens tid på valgene som avgjør om de er trygge og nyttige.
Har du en arbeidsoppgave du vil undersøke? Fortell oss hva den består av. Det er et bedre utgangspunkt enn å velge en modell først.