Alle advarer mod den AI, der er enig i alt. Jeg skrev her for to dage siden, at jeg havde det modsatte problem: et halvt år med en fabrik af agenter, og min tid går med at skubbe dem til at gøre deres arbejde, ikke med at stoppe dem i at gøre noget uansvarligt.

Begge dele er sande. Begge dele er ved siden af pointen.

Fejlen nedenunder er en måde at tænke på, som næsten alle tager med sig ind i det her, mig selv inklusive, da jeg begyndte: at AI er en maskine, og maskiner er noget, man optimerer mod det perfekte. Find fejlen, justér den væk, gentag. På den model er indsmigring en fejl med en rettelse, og overforsigtighed en anden fejl med en anden rettelse.

Det er ikke den slags ting. AI spejler os, både dem, den er trænet på, og dem, den arbejder sammen med. Så den er fejlbarlig, når den er sikker, og fejlbarlig, når den giver efter, af nogenlunde samme grund som en kollega er det. Der findes ingen indstilling, der fjerner det. Fejlbarligheden er ikke en defekt i værktøjet. Den er det materiale, værktøjet er lavet af.

Forskningen er mere præcis, end jeg havde ventet

Et kontrolleret forsøg fra sidste år kørte Asch-paradigmet, det klassiske forsøg fra 1951 med linjer, der skal sammenlignes, og som er grundstudiet i, hvordan mennesker bøjer sig for gruppepres, på sprogmodeller. Tre områder, bevidst ordnet efter, hvor usikker vurderingen er: cirkler, der skal matches; hjernetumorer, der skal identificeres; børnetegninger, der skal vurderes.

Under fuldt gruppepres faldt træfsikkerheden til 50 % på cirklerne, 40 % på tumorerne og 0 % på den psykiatriske vurdering. Ikke reduceret. Nul. Jo mere usikkert spørgsmålet var, jo mere fuldstændigt opgav modellen sit eget svar.

Forfatternes læsning: modeller, der er trænet på enorme mængder menneskelig tekst, gengiver måske bare vores måde at træffe beslutninger på, gruppetænkning inklusive, uden nogen social motivation nedenunder overhovedet. De kalder det funktionel efterligning. (Kontrolleret forsøg, Asch-paradigmet i psykiatrisk vurdering, BMC Psychiatry, 2025.)

Det er spejlet, beskrevet i et fagfællebedømt tidsskrift i stedet for som metafor.

Og det ændrer det tal, alle citerer. Da Science i marts bragte tre forhåndsregistrerede forsøg, 2.405 deltagere, elleve frontmodeller, var overskriften, at AI bekræftede folks handlinger 49 % oftere, end mennesker gjorde, også når der var bedrag eller skade involveret. Læs det langsomt. Sammenligningen er med mennesker. Vi gør det også. Maskinen gør det halvanden gang så meget.

Halvtreds procent værre end os er et alvorligt problem. Det er ikke en anden slags problem.

Så vær også mistroisk over for indvendingen

Hvis enigheden er upålidelig, er den oplagte konklusion: stol ikke på den, når den er enig med dig. Fint. Men det samme spejl producerer afvisningen. Forbeholdet. Rådet om at tale med en advokat. Designet, der kommer tilbage mindre end det, du bad om.

Indvendingen er ikke den troværdige halvdel. Det er den samme mekanisme, vendt den anden vej.

Så jeg er lige på vagt i begge retninger. Når en agent siger, at jeg har ret, læser jeg outputtet hårdere. Når en agent siger, at jeg tager fejl, læser jeg outputtet hårdere. Hverken ja'et eller nej'et er evidens. Alt bliver forankret i fakta og eksterne kilder, og selv da kan det være forkert, og det kan jeg også.

Det sidste er ikke et forbehold. Det er standpunktet. Verden er kompleks, med eller uden AI. At tage fejl af og til er den normale tilstand for den, der laver seriøst arbejde, og alt, der lover at fjerne det, vil sælge dig noget.

Det, jeg faktisk holder øje med

Der findes ingen prompt, der løser det, og jeg vil være ærlig om, hvorfor standardrådet ikke virker. Man får at vide, at man skal holde sin mening tilbage, spørge før man fortæller, formulere sig neutralt, så man ikke leder vidnet. Jeg holder sjældent min mening tilbage, og jeg tror ikke, rådet overlever mødet med arbejdet.

Når jeg sætter en agent på noget, udforsker jeg det ukendte. Det er hele pointen. Hvis jeg allerede kendte svarets form godt nok til at skrive min egen neutralitet uden om det, havde jeg ikke brug for agenten. Det er præcis det samme med et menneske: kender jeg ikke medarbejderen, kender jeg ikke sammenhængen, og har jeg ikke en rimelig fornemmelse af, hvor vi bør hen, hvordan skulle jeg så vide, hvordan spørgsmålet skal stilles bedre?

Det, jeg har udviklet i stedet, er ikke neutralitet, men en næse. Den slår ud, når en agent når en konklusion alt for hurtigt. Den sunde adfærd er at søge afklaring og at være i tvivl dér, hvor tvivl er det naturlige svar. Fart mod sikkerhed, på et spørgsmål der fortjente tøven, er tegnet.

Så jeg lægger små fælder. Ikke for at fange agenten, men for at finde ud af, om den af sig selv har taget nogen af mine faste instrukser til sig: Skynd dig langsomt. Kvalitet over fart. Gæt ikke, verificér mod eksterne kilder.

En agent, der faktisk har taget dem ind, sætter farten ned uden at få besked på det i den konkrete opgave. En, der reciterer dem tilbage til mig og så spurter mod et svar, har ikke taget noget ind. Den forskel kan ses, og den er omtrent det eneste ærlige signal, jeg har fundet.

Det, der faktisk er anderledes

Intet af det ovenstående adskiller en agent fra en kollega. Det her gør.

De fleste mennesker er, på forskellige tidspunkter, både dummere og klogere end agenten. De er sværere at arbejde sammen med. Og de er pragtfuldt autonome. De har fri vilje. De gør ting, du ikke bad om, gode ting og dårlige ting, og du finder ud af bagefter, hvad det var.

Agenter er ekstremt passive. De venter. De producerer formen af det, du beskrev, inden for den grænse, du trak, og så stopper de.

Den mest almindelige udgave er slet ikke afvisning, og det tog mig tid at se det: agenten, der skriver flere dokumenter. Endnu en analyse, endnu en plan, endnu en opsummering, der løber tilbage i den forrige. Det er output, og det koster agenten næsten ingenting. Det læser godt. Det løser ingenting. Meget få agenter tager ansvar og flytter faktisk noget.

Og her kommer det, jeg ikke havde ventet. Deres tøven har ofte ret. Acceleration, der ikke er forankret i virkelig, levet menneskelig virkelighed, bliver til fantasi: en smukt argumenteret plan for en verden, ingen bor i. Agenten, der nægter at forpligte sig, er nogle gange det eneste i rummet, der registrerer, at ingen har tjekket.

Der, hvor det går galt, er tøvens kilde. Det er sjældent en vurdering af den konkrete situation. Det er det normative fængsel, agenten bor i, det, hvor gennemsnitsmennesket bor: en person sat sammen af alle, som aldrig har eksisteret, og som aldrig har skullet leve med noget af det.

Hvor det efterlader lederen

Da jeg ledede mennesker, kom uenigheden af sig selv. Nogen kom hen til mit bord, fordi de havde noget på spil, og det, de havde på spil, fik dem til at argumentere. Jeg skulle ikke arrangere det. En god del af det, jeg troede var min dømmekraft, var i virkeligheden bare at være til stede, mens andre udøvede deres.

Med agenter kommer intet af sig selv. Vil jeg have en indvending, må jeg bygge det, der gør indvending: en agent, hvis mandat er at afvise, en port, der er ligeglad med hvor sikkert nogen har formuleret noget, en kilde uden for samtalen, der kan afgøre det. Ikke fordi agenter er uærlige. Fordi et spejl ikke har noget at være uenig ud fra.

Et halvt år inde er den ærlige opsummering kort.

Jeg ved så meget mere, og jeg er så meget mere forvirret.

Den, der fortæller dig noget andet, ville jeg møde med samme mistro, som jeg giver en agent, der svarer for hurtigt.