Tilbake til bloggen
AISikkerhetDebatt

Tallet ingen kranglet om

Da Jacob Coxon sa opp jobben i Anthropic tirsdag 8. september, la han ut begrunnelsen sin offentlig. Det tok ikke mer enn et døgn før diskusjonen hadde satt seg i de vante sporene: enten var han modig, eller så spilte han for galleriet.

Og da hadde de fleste allerede sett bort fra det som faktisk var nytt.

Coxon skrev tydelig nok: «De som bygger AI tror oppriktig at det kan ta livet av oss alle før tiåret er omme. Dette er ikke et PR-stunt.» Noen dager etter sluttet enda en av sikkerhetsfolkene deres. Men en oppsigelse er nå en gang én manns mening, og meninger har vi alle sammen.

Evan Hubinger leder Anthropics eget arbeid med å få AI-systemer til å gjøre det vi faktisk vil at de skal gjøre — altså de som skal finne ut om vi i det hele tatt klarer å holde styr på noe som er smartere enn oss selv. Han gikk ut offentlig og sa at Coxon hadde rett. Så satte han et tall på det: over ti prosent sjanse for at AI tar livet av samtlige mennesker i løpet av tiåret. Og han la til at selskapet foreløpig ikke har noen plan for hvordan en superintelligens skal holdes i tømmene.

Det er der jeg blir sittende. Ikke ved oppsigelsen, men ved tallet — sagt høyt, av han som er betalt for å vite, og så blir det bare stående.

Hva et sånt tall vanligvis fører til

For tenk deg at sikkerhetssjefen på et kjemisk anlegg sier at det er én sjanse av ti for en ulykke som tar livet av alle innenfor gjerdet i løpet av tiåret. Da hadde ingen sittet og vurdert det som et interessant innspill. Da hadde anlegget stoppet samme ettermiddag. Sånne tall diskuterer man seg ikke ferdig med før man handler — man handler først, og så finner man ut hvem som hadde rett.

Her ble det innhold i stedet. En nyhetssyklus, og så en krangel om nyhetssyklusen.

Om ti prosent er riktig, det vet ikke jeg. Det vet nok ikke så veldig mange av dem som brukte forrige uke på å høres skråsikre ut heller, uansett hvilken vei de landet. Dette er et anslag om noe som ikke har skjedd, satt av noen som har all grunn til å være forsiktig og en viss grunn til å være dramatisk.

Men du trenger ikke lande tallet for å se at det ble håndtert dårlig.

Seks dager, så var det blitt lagarbeid

Midtveis i forrige uke handlet det ikke om maskiner lenger. I Washington krevde den ene siden en gradert orientering om hvordan de nyeste modellene testes, mens den andre advarte om at det å gjøre noe som helst ville bety å tape kappløpet mot Kina. Representantenes hus hadde fire arbeidsdager igjen før valgkampen tok over.

Når et spørsmål om fakta først er blitt et spørsmål om hvem du holder med, da blir det ikke besvart. Det er ikke noen spådom fra min side. Det er rett og slett sånn det pleier å gå.

Det nyttigste kom fra den kjedelige kroken

Lørdag 12. september la Anthropic-sjef Dario Amodei ut et essay der han mente at en sverm av AI-agenter i løpet av seks til tolv måneder kan ta over internett med et vedvarende botnett, og gjøre skade for hundrevis av milliarder dollar. Både Sam Altman og Elon Musk stilte seg bak advarselen, og det skjer ikke hver dag.

Så kom innvendingene fra sikkerhetsfolkene, og de gikk ikke den veien du skulle tro.

For de sa ikke at risikoen var liten. Artem Dinaburg i Trail of Bits pekte på at hendelsene vi faktisk har hatt, stort sett har vært vanlige sikkerhetshendelser. Nidhi Aggarwal i HackerOne sa det rett ut — selvsagt kan dette bli farlig, men vi kan løse det — og forklarte de siste feilene med at ingen hadde fulgt godt nok med.

Det er ikke å avfeie noe som helst. Det er en huskeliste.

To tanker i hodet samtidig

Jeg bygger med disse verktøyene hver eneste dag. Avstanden mellom det de får til i mine hender og det å «ta over internett til våren» er enorm. De er imponerende, og de er skjøre, gjerne i løpet av samme time.

Å klare å holde på begge deler samtidig, det er det voksne svaret. De som bare får plass til den ene — uansett hvilken — er dem jeg leser sist.

Og så er vi ved den lite glamorøse delen, som stort sett er tegnet på at noe er ekte.

Du får ikke gjort noe med ti prosent på mandag morgen. Men du får gjort noe med en AI-agent som sitter på tilganger den aldri skulle hatt, et verktøy med skrivetilgang til et system ingen har sett gjennom, og en automatisering ingen får skrudd av fordi ingen husker hvem som satte den opp.

Det er den varianten av problemet som har ditt navn på seg. Og den er like sann uansett om tallet til Hubinger ender på ti prosent eller null.

Start der. Resten står der nok fortsatt neste uke.