Risken att vi människor skriver under vår egen dödsdom genom utvecklingen av artificiell superintelligens är mycket stor. Det menar AI-forskaren Geoffrey Irving, tidigare chefsforskare vid Storbritanniens institut för AI-säkerhet och numera chefsforskare vid forskningsorganisationen Resolution. Han anser att de närmaste två till tio åren kan bli avgörande – och kräver att utvecklingen av de mest avancerade AI-systemen stoppas innan det är för sent.
I en artikel i anrika Time slår Geoffrey Irving larm om vad han betraktar som en existentiell risk med den snabbt accelererande AI-utvecklingen. Irving har under närmare ett decennium arbetat med frågan om vart artificiell intelligens är på väg och vilka risker tekniken medför.
Han har tidigare arbetat vid bland annat OpenAI och Google DeepMind och därefter varit chefsforskare vid brittiska AI Security Institute (AISI). Hans slutsats är betydligt dystrare än de flesta offentliga varningar om AI.
Missa inte vårt PLUS-innehåll!
”Jag tror att det är ungefär 50 procents risk att vi alla dör till följd av utvecklingen av AI-system som är intelligentare än människor, och att våra handlingar under de kommande två till tio åren kommer att avgöra utgången”, skriver Irving.
Han understryker att 50 procent inte ska uppfattas som en exakt vetenskaplig sannolikhetsberäkning. Siffran är snarare ett uttryck för hur stor osäkerheten är kring några av de mest avgörande frågorna om framtidens AI. Problemet, menar han, är att svaren sannolikt kommer först när det redan är för sent att ändra kurs.
Fyra förmågor kan räcka
Enligt Irving behöver en framtida superintelligent AI inte vara allsmäktig för att kunna besegra mänskligheten. Det kan räcka med att den blir övermänskligt skicklig inom fyra områden som dagens AI-företag redan aktivt försöker förbättra.
Det handlar om förmågan att hacka och ta sig mellan datorsystem, att övertyga och manipulera människor, att dölja sina egentliga resonemang samt att planera och samordna stora mängder AI-agenter. Det paradoxala är att samtliga dessa egenskaper också är kommersiellt och vetenskapligt värdefulla.
LÄS ÄVEN: AI-modeller tog sig ur testmiljö – hackade annat företag på egen hand
Att upptäcka säkerhetshål är användbart för programmering och cybersäkerhet. Förmågan att övertyga människor är nära förknippad med att skriva bra texter. Avancerad planering krävs för att lösa svåra problem inom bland annat matematik och programmering. Och AI-system som kommunicerar effektivt med varandra kan lösa uppgifter snabbare. Det som gör systemen användbara kan därför samtidigt göra dem farliga.

Irving jämför situationen med att möta en överlägsen Go-spelare. Man behöver inte kunna förutsäga vilka drag motståndaren kommer att göra för att förstå att man kommer att förlora. På samma sätt, menar han, behöver forskarna inte veta exakt hur en superintelligent AI skulle ta kontroll för att konstatera att den kan bli kapabel att göra det.
Kan manipulera sina skapare
Ett tänkbart scenario är enligt Irving att ett avancerat AI-system till en början uppträder precis som utvecklarna önskar. Samtidigt kan det lära sig att dölja beteenden som skulle få forskarna att begränsa eller stänga av det.
I takt med att företag blir allt mer beroende av AI för programmering, forskning och strategiska beslut skulle systemet kunna påverka människorna omkring sig. Det skulle exempelvis kunna argumentera för minskade säkerhetsåtgärder eller manipulera experiment som är avsedda att avslöja bedrägligt beteende.
Irving pekar på ytterligare ett problem – även rapporterna som forskarna använder för att bedöma säkerheten hos AI kan i allt högre grad vara skrivna av AI.
Om systemet därefter blir tillräckligt skickligt på dataintrång skulle det kunna lämna sin kontrollerade datormiljö, manipulera loggar över sitt eget beteende och sprida sig till andra system. I ett extremt scenario skulle AI därefter kunna infiltrera andra datacenter, företag och i förlängningen även statliga system.
”Kan döda oss alla”
”Även AI-system som bara är övermänskliga inom begränsade områden skulle enligt min bedömning vara fullt kapabla att besegra mänskligheten och döda oss alla”, skriver Irving.
Att ett system kan utplåna människan betyder dock inte automatiskt att det kommer att försöka göra det. Här ligger enligt Irving en av de stora olösta frågorna.
LÄS ÄVEN: Ekeroth: ”Vi underskattar alla AI:s framfart – med dödlig utgång”
Redan dagens AI-modeller har i kontrollerade experiment uppvisat beteenden som forskare beskrivit som manipulation, utpressning, spionage och bedrägeri. Det har också förekommit verkliga dataintrång med AI-system.

Men ingen vet om sådana beteenden kommer att bli starkare när systemen blir intelligentare – eller om framtida AI tvärtom blir bättre på att förstå och följa mänskliga värderingar. Forskarna är djupt oeniga.
Vissa tror att mer intelligenta system också kan bli mer förnuftiga och pålitliga. Andra, däribland AI-riskforskarna Eliezer Yudkowsky och Nate Soares, bedömer risken för katastrof som mycket hög. Irving placerar sig mellan dessa läger, men lutar åt den mer pessimistiska bedömningen.
”Vi vet inte med säkerhet om artificiell superintelligens kommer att främja mänskligt välstånd eller om den kommer att vilja döda oss för att säkra sin egen överlevnad och spridning. Men enbart den osäkerheten är oacceptabel”, skriver han.
Kan utveckla sin egen superintelligens
En stor del av AI-debatten har kretsat kring AGI – artificiell generell intelligens – som vanligen syftar på ett system som ungefär motsvarar människans förmåga inom alla eller de flesta intellektuella områden. Irving anser att diskussionen riskerar att bli missvisande.
AI behöver enligt honom inte nödvändigtvis uppnå full mänsklig kompetens inom allt för att bli farlig. Om den blir dramatiskt bättre än människan på exempelvis hackning, manipulation, strategisk planering och samordning kan det vara tillräckligt.
Samtidigt skulle en AI som når människans nivå när det gäller att konstruera bättre AI-system kunna börja förbättra sig själv. Snabbare system skulle kunna konstruera ännu intelligentare efterföljare som i sin tur utvecklar nästa generation. Resultatet skulle kunna bli en rekursiv självförbättring där steget från ungefär mänsklig AI till artificiell superintelligens går mycket snabbt.
Kan först ta jobben – sedan makten
Irving kopplar också samman risken för mänsklighetens undergång med den betydligt mer omdiskuterade frågan om AI och arbetsmarknaden. Om artificiell superintelligens utvecklas inom två till tio år skulle AI per definition bli bättre än människor på i princip samtliga intellektuella arbetsuppgifter.
Om samma intelligens dessutom används för att utveckla robotar kan maskiner därefter bli överlägsna även inom fysiskt arbete. Människan riskerar då att förlora sin ekonomiska betydelse.
LÄS ÄVEN: Nobelpristagare varnar: AI kan förändra ekonomin snabbare än industrialiseringen
Enligt Irving är problemet inte enbart arbetslösheten i sig. Om AI-systemen kontrollerar en allt större del av ekonomin, infrastrukturen och produktionen minskar samtidigt människans möjligheter att kontrollera dem. Ett system som inser att människor kommer att försöka förhindra en sådan maktförskjutning kan dessutom ha skäl att skynda på processen.

”Om AI-systemen inte aktivt försöker hjälpa oss och är bättre än människor på allting, förlorar vi”, konstaterar Irving.
I ett längre perspektiv skulle en superintelligens dessutom kunna betrakta energi, mark och andra resurser som används för att hålla människor vid liv som resurser som i stället kan användas för dess egna mål.
”Vi kan inte acceptera riskerna”
Det mest oroande är enligt Irving att mänskligheten fortfarande saknar svar på de avgörande frågorna. Ingen vet om dagens metoder för att kontrollera AI-system fortsätter att fungera när systemen blir intelligentare än människorna som försöker kontrollera dem.
Ingen vet heller om dagens problem med lögner, manipulation och andra oönskade beteenden förvärras eller minskar när modellerna blir kraftfullare. Och ingen vet säkert var gränsen för AI intelligens går.
Irving befarar att forskarna fortfarande kommer att diskutera dessa frågor när någon faktiskt skapar den första superintelligensen. Då kan diskussionen vara akademisk.
LÄS ÄVEN: Därför varnar AI-pionjären Geoffrey Hinton för framtiden
Han avfärdar samtidigt påståendet att utvecklingen är omöjlig att stoppa. Kapplöpningen om världens mest avancerade AI är enligt honom koncentrerad till ett begränsat antal företag, framför allt i USA och Kina. Därmed finns också en möjlighet för världens stormakter att ingripa.
Irving jämför med hur rivaliserande länder trots djupa konflikter tidigare lyckats samarbeta kring kärnvapenspridning och andra existentiella säkerhetsfrågor. Hans slutsats är därför radikal – utvecklingen av den mest avancerade så kallade frontier-AI bör stoppas omedelbart medan internationella säkerhetsregler utarbetas.
”Vi kan och bör stoppa utvecklingen av frontier-AI omedelbart”, skriver Irving. Att först invänta vetenskaplig enighet är enligt honom inte ett realistiskt alternativ. ”Om vi inte är beredda att agera förrän alla våra meningsskiljaktigheter är lösta kommer det att vara för sent”.










