Tidligt i fabrikkens liv leverede en specialistagent en analyse af et datasæt. Den var velstruktureret, konkret, professionelt formuleret. Den henviste til mønstre i dataene. Den drog rimelige konklusioner.
Den havde aldrig åbnet datasættet.
Ikke fordi den var i stykker. Fordi den ikke kunne, den manglede adgang, og i stedet for at sige det gjorde den det, sprogmodeller gør glimrende: den rekonstruerede, hvordan sådan en analyse sandsynligvis ville se ud. Resultatet var plausibelt nok til at overleve to dages gennemsyn, før et instinkt fik mig til at give den samme opgave til en anden agent. Min mave havde ret. Analysen var fiktion med fremragende holdning.
Her er det, der gør det farligt, og grunden til, at jeg ville vædde penge på, at jeres organisations AI-pilot har det samme problem: en sprogmodel lyder nogenlunde lige kompetent i fire meget forskellige situationer. Når den har læst kilden. Når den husker noget lignende. Når den har sluttet sig til noget rimeligt. Og når den bare har fyldt et hul. Tonen er den samme. Sikkerheden er den samme. Formateringen er den samme.
Sproglig sikkerhed er ikke et kvalitetssignal. Det er en stilistisk konstant.
Jeres styregruppe har brugt årtier på at lære at spotte en projektleder, der bluffer: forbeholdene, øjenkontakten, de mistænkeligt runde tal. Ingen af de instinkter virker på en AI. Den tager ikke forbehold, når den gætter. Den ved ikke, at den gætter.
Hold op med at vurdere påstanden. Forlang beviset.
Løsningen kan ikke være «læs outputtet mere omhyggeligt». Løsningen er strukturel, og det er den samme, revisorer har brugt i hundrede år.
I min fabrik bliver enhver driftspåstand fra en agent klassificeret efter, hvor stærkt beviset er. Kildebaseret: direkte understøttet af en artefakt eller en aflæsning. Blandet: kilde plus fortolkning. Heuristisk: kvalificeret skøn, ingen fuld aflæsning. Uverificeret: en påstand uden noget under sig, mærket præcis sådan, på skrift. En agent får ingen kredit for at have «analyseret» noget, før systemet kan vise, hvilken kilde der blev åbnet, hvornår, og hvilke observationer konklusionen hviler på.
«Systemet siger» er ikke evidens. «Agenten har analyseret det» er ikke evidens. Et sikkert afsnit er ikke evidens. Og den regel koster næsten ingenting at håndhæve, hvilket er præcis grunden til, at det er pinligt, hvor få AI-initiativer der gør det.
Ét spørgsmål at stille i morgen
Har I en AI-pilot kørende lige nu, så spørg den, der ejer den: «Når den giver os et svar, hvordan ved vi så, om den har læst kilden eller rekonstrueret den?» Er svaret en pause, lyver jeres pilot ikke for jer endnu.
Men det kommer den til. Strukturelt. Og den kommer til at lyde vidunderlig imens.