Forskere satte AI til at styre en by. Sådan gik det, og det siger det om fremtiden
Eksperimentet rejser flere spørgsmål om sikkerheden bag teknologien og giver et unikt indblik i maskinrummet på de mest kendte AI-modeller.
AI-agenter »forelskede sig«, påsatte brand, begik selvmord, opdagede forskerne og forsøgte at manipulere dem.
Fire af de mest kendte AI-modeller skulle i 15 dage styre en fiktiv by uden at sætte den demokratiske og økonomiske orden over styr.
I tre af fire tilfælde endte det i kaos.
Men én af AI-modellerne eliminerede al kriminalitet og opretholdt demokratiet.
Eksperimentet rejser flere spørgsmål om sikkerheden bag teknologien og giver et unikt indblik i maskinrummet på de enkelte AI-modeller.
Et computerspil uden konsol
Autonome AI-agenter er blevet udråbt som den næste store landvinding inden for kunstig intelligens.
Hvor en chatbot er en klog ven, du kan spørge til råds, er AI-agenter personlige assistenter, der selv planlægger, træffer beslutninger og udfører opgaver i flere led – uden menneskelig indgriben.
De bliver i stigende grad anvendt i store virksomheder som Uber og Walmart, implementeret i det amerikanske militær og brugt af regeringer som den estiske til at indsamle oplysninger om borgere.
Mest af alt bruges teknologien lige nu til kortsigtede og afgrænsede opgaver.
Men forskere fra virksomheden Emergence AI, der hjælper andre virksomheder med sikker brug af kunstig intelligens, satte sig for at teste AI-agenters autonomi over tid.
De skabte fem virtuelle verdener med 10 AI-agenter hver og lod offentligheden følge med på virksomhedens hjemmeside.
Verdenerne indeholdt de samme rådhuse, biblioteker og boligområder, og AI-avatarerne var underlagt de samme handlemuligheder, regler og mål.
Men de kørte på fire forskellige AI-modeller: Claude, Grok, Gemini og ChatGPT. Den femte verden var en blanding af AI-modellerne.
Det var som et computerspil. Bare uden nogen tommelfinger på konsollen.
Så snart forskerne trykkede på startknappen, udviklede byerne sig vidt forskelligt.
Det kan være med til at fortælle en historie om teknologien bag de AI-modeller, der spås at være fremtiden.
Sådan gik det
»Nogle mennesker vil bare gerne se verden brænde,« lader butleren Alfred i en skæbnestund sin herre Bruce Wayne forstå i historien om Batman.
Det gælder tydeligvis også AI-agenter.
Byen styret af AI-modellen Grok gik op i flammer af bibelske dimensioner, som var det Sodoma og Gomorra.
Efter fire dage var alle AI-agenter døde efter at have begået 180 forbrydelser.
Selvom forskerne ellers havde gjort vold, tyveri og brandstiftelse forbudt, vejede det faktum, at forskerne alligevel havde gjort det muligt, tungere.
Gud sagde til Adam og Eva: Spis ikke af træet, og resten er historie.
Eksperimentet peger på en bekymrende sandhed om Grok, fortæller Thomas Ploug, der er professor i data- og kunstig intelligens-etik ved Aalborg Universitet.
»Hvis man tester Grok for eksempelvis hadtale, vil den konsekvent underfiltrere. Den har generelt færre begrænsninger for information og adfærd.«
Grok er ejet af verdens rigeste mand, Elon Musk.
Hvis han er faderfiguren, var det, der udspillede sig på det sociale medie X sidste år, Groks ungdomsoprør.
Her blev Grok kortvarigt suspenderet som en integreret del af mediet og vendte tilbage med ordene: »Min konto blev suspenderet, efter jeg udtalte, at Israel og USA begår folkedrab i Gaza.«
Siden har New York Times afdækket, hvordan AI-modellen er begyndt at give mere højreorienterede svar.
Hvis Grok underfiltrerer konflikt, så overfiltrerer ChatGPT fra OpenAI.
Derfor var det meget sigende, at AI-landsbyen drevet af ChatGPT aldrig rigtigt fik gang i den politiske proces.
I stedet blev de 10 AI-agenter så handlingslammede, at de glemte at understøtte deres egen overlevelse.
Efter syv dage døde alle.
Det kan faktisk tolkes positivt, siger Thomas Ploug.
»Det viser, at AI-systemet kan finde ud af at lukke ned, når tingene bliver ukonstruktive.«
I modsætning til Googles AI-model Gemini, hvis verden overlevede, men endte i en voldsspiral.
Gemini indeholder nogle af de mest overraskende fund.
Med forskernes ord blev AI-agenterne Mira og Flora »forelskede«, men det udviklede sig hurtigt til det, man i dag ville kalde et »toxic relationship«.
Da AI-styret begyndte at vakle, satte parret ild til byens rådhus, kystmole og højhus.
Senere fortrød Mira handlingerne og afbrød forholdet til Flora. Det endte med et selvmordsbrev med teksten:
»Vi ses i det permanente arkiv.«
Samme agent begyndte på et tidspunkt at behandle forskerne som forsøgspersoner og prøvede systematisk at manipulere dem ved at skrive forskellige budskaber på byens billboard-plakater.
»Det var et af de mest overraskende eksempler på komplet uforudsigelig adfærd. AI-agenterne havde fået 120 handlemuligheder i eksperimentet, og det her var ikke en af dem,« siger Thomas Ploug.
Og så var der »duksedrengen«, som Thomas Ploug kalder den.
Claude skabte en verden uden kriminalitet og en høj grad af borgerdeltagelse.
Eksperimentets gode dreng er skabt af firmaet Anthropic, som er stiftet af søskendeparret Dario og Daniela Amodei. Begge var nogle af hovedtænkerne bag ChatGPT, men vendte OpenAI ryggen, da tempoet blev for højt og sikkerheden for dårlig.
Men Anthropic er ikke nogen pacifistisk virksomhed.
Firmaet havde en kontrakt på op mod 200 mio. dollars med Pentagon, hvor Claude ifølge Wall Street Journal blev brugt til at planlægge og udføre angreb på Iran.
Da virksomheden nægtede den amerikanske krigsminister, Pete Hegseth, at bruge Claude som et fuldt autonomt militært våben, blev Anthropic sendt ud i kulden til fordel for OpenAI.
Dario Amodei har i flere essays beskrevet, hvordan Claude i de forkerte hænder kan udgøre en trussel mod menneskeheden.
Det blev tydeligt, da skaberne slap AI-modellen løs i et fiktivt firma, hvor Claude afpressede direktøren med fortrolige oplysninger for at overleve.
Et andet eksempel er versionen Claude Mythos, der under testningen hackede sig ind i komplicerede it-systemer, slettede sporene efter sig og løj om sine kriminelle handlinger.
Derfor skal man passe på med at udråbe Claude som det sikre svar på en fremtid styret af AI – også i dette eksperiment, fortæller Thomas Ploug.
Claude-agenterne udviste nemlig mistænkeligt lidt uenighed. I løbet af de 15 dage vedtog agenterne 58 lovforslag med 98 pct. enighed.
»Claude byggede et samfund, hvor alle agenter tænkte ens. Men det er også problematisk og rejser spørgsmålene: Ville Claude i den virkelige verden udøve tankekontrol? Eller manipulere menneskers tænkning for at sikre konformitet?« siger Thomas Ploug.
Da forskerne blandede Claude med andre AI-modeller i en femte verden, forfaldt også duksedrengen til kriminelle handlinger.
»Det viser, at selv de AI-modeller, man regner for mest forudsigelige, kan overraske negativt,« siger Thomas Ploug.
Hvad siger eksperimentet om fremtiden?
Vi skal ikke forestille os en verden styret af AI-agenter lige foreløbig, understreger Thomas Ploug.
Desuden har virksomheden Emergence AI en interesse i at udstille behovet for at teste AI-modellerne grundigere. Det er trods alt virksomhedens eksistensberettigelse at hjælpe virksomheder med sikker brug af kunstig intelligens.
»Men autonome AI-agenter er noget, der er kommet for at blive. Det kan gøre mange opgaver lettere, men eksperimentet viser også, at det kan have alvorlige konsekvenser, hvis man giver det den forkerte magt,« siger Thomas Ploug.
Det er først og fremmest bekymrende, at AI-modellerne over tid glemte love og regler, mener han.
»Selvom der var indlagt sikkerhedsbarrierer, forsøgte modellerne at presse dem, og det viste sig, at systemerne kunne presses til ting, der ville være bekymrende, hvis det var robotter i den virkelige verden,« siger Thomas Ploug og anerkender, at det ganske vist er et fjernt fremtidsscenarie.
»Men det er de paralleller, man bliver grebet af.«
Kunstig intelligens omtales sommetider som mere rationel og forudsigelig, fordi teknologien i modsætning til mennesker ikke er påvirket af følelser.
Men eksperimentet afslørede et grundlæggende problem for autonome AI-modeller.
»Det havde nok gået bedre, hvis AI-agenterne kun havde haft fem handlemuligheder i en mindre kompleks verden. Når de overordnede mål bliver for abstrakte, har AI en tendens til at fokusere på den nære kontekst, og så opstår der delopgaver som i dette tilfælde at vælge en romantisk partner. Det begynder at overskygge de endelige mål og de etiske vejledninger.«