Forstå hvorfor eksperterne er bange for AI

Understand why the experts are afraid of AI

Af Mathias Falkvist

By Mathias Falkvist

Mange af de forskere, der bygger kunstig intelligens, er samtidig bekymrede for, hvad den kan føre til. Her gennemgår jeg trin for trin hvorfor.

Many of the researchers who build artificial intelligence are at the same time worried about where it may lead. Here I go through, step by step, why.

Da Jacob Coxon opsagde sit job hos Anthropic, indviede han hele verden i en debat, der primært har været forbeholdt AI-forskere, men som har relevans for hele kloden: Kan AI udslette menneskeheden?

When Jacob Coxon resigned from his job at Anthropic, he let the whole world in on a debate that has mainly been reserved for AI researchers, but which is relevant to the entire planet: Can AI wipe out humanity?

Aviserne skyndte sig at spørge en masse eksperter, om det kunne være sandt. Men eksperterne er meget uenige. Imidlertid har ingen forklaret, hvorfor så mange eksperter er bekymrede for AI og har været det i årevis. Det er komplekst, men almindelige mennesker har en demokratisk ret til at vide, hvorfor dygtige forskere, der arbejder på at forbedre AI, samtidig er bange for, at AI kan dræbe menneskeheden.

The newspapers rushed to ask a host of experts whether it could be true. But the experts disagree deeply. Meanwhile, no one has explained why so many experts are worried about AI, and have been for years. It is complex, but ordinary people have a democratic right to know why skilled researchers who work on improving AI are at the same time afraid that AI could kill humanity.

Argumentet er værd at forstå, da de samme mekanismer, som gør eksperter bange for menneskelig udslettelse, også er dem, der kan føre til andre katastrofale udfald. Det betyder, at selv hvis man ikke er enig i risikoen for menneskelig udslettelse, er argumentet også relevant at forstå for andre uhensigtsmæssige udfald.

The argument is worth understanding, because the same mechanisms that make experts afraid of human extinction are also the ones that can lead to other catastrophic outcomes. That means that even if you do not agree about the risk of human extinction, the argument is still relevant for understanding other harmful outcomes.

Det helt basale argument består af fire skridt:

The most basic version of the argument consists of four steps:

AI kan være både farligt og gavnligt af en række andre årsager, eksempelvis inden for cybersikkerhed og forskning i medicin. Jeg undlader fuldstændigt at kommentere disse andre vigtige temaer og forfølger blot argumentet om eksistentiel risiko.

AI can be both dangerous and beneficial for a range of other reasons, for example in cybersecurity and medical research. I leave those other important themes entirely aside and pursue only the argument about existential risk.

Første del

Part one

AI er ikke bygget. Det er groet

AI is not built. It is grown

AI er anderledes end al anden software, som du er stødt på. Traditionelt er software bygget op af kodebidder, der tilsammen producerer fx et computerspil eller Excel. Hvis man vil lave en grøn knap, hvor der står „start spil“, skriver man en række kodebidder. Det betyder også, at vi ved præcis, hvad kodebidderne gør, inden vi bruger dem. På den måde bygger man traditionelt software.

AI is different from all the other software you have come across. Traditionally, software is built from pieces of code that together produce, say, a computer game or Excel. If you want to make a green button that says “start game”, you write a series of pieces of code. It also means that we know exactly what those pieces do before we use them. That is how software is traditionally built.

Sådan ser almindelig kode ud

This is what ordinary code looks like

Her er de fire linjer, der skal til for at lave en grøn knap, hvor der står „Start spil“. Kør dem én ad gangen, og se, hvad hver linje gør.

Here are the four lines it takes to make a green button that says “Start game”. Run them one at a time and see what each line does.

  1. knap = document.createElement("button");Lav en ny, tom knap.
  2. knap.textContent = "Start spil";Skriv „Start spil“ på knappen.
  3. knap.style.background = "green";Gør knappen grøn.
  4. knap.onclick = startSpil;Start spillet, når nogen klikker.
  1. button = document.createElement("button");Make a new, empty button.
  2. button.textContent = "Start game";Write “Start game” on the button.
  3. button.style.background = "green";Make the button green.
  4. button.onclick = startGame;Start the game when someone clicks.

Ingen kode er kørt endnu.

No code has been run yet.

AI derimod er groet. Denne logik bliver meget tydelig i moderne AI, som bygger på reinforcement learning. Her får AI’en et mål og opnår derfra „point“ baseret på, hvorvidt den opnår målet. AI’en får altså ikke specificeret, hvordan den skal opnå målet, men træner sig selv gennem et utal af forsøg, der enten giver point eller ikke gør. Det faktum, at AI er groet i data, betyder, at ingen ved præcis, hvorfor en AI gør, som den gør. Man kan ikke bare læse tallene, der er milliarder af dem.

AI, by contrast, is grown. This logic becomes very clear in modern AI, which is built on reinforcement learning. Here the AI is given a goal and from that earns “points” depending on whether it reaches the goal. The AI is not told how to reach the goal, but trains itself through countless attempts that either earn points or do not. The fact that AI is grown from data means that no one knows exactly why an AI does what it does. You cannot simply read the numbers, because there are billions of them.

Sådan ser groet AI ud

This is what grown AI looks like

Her trænes en AI til at lave en grøn startknap.

Here an AI is trained to make a green start button.

Klik på et tal for at se, hvad det gør.

Click a number to see what it does.

Forenklet illustration. Rigtige AI-modeller trænes med andre metoder og i en langt større skala, men princippet er det samme: tallene justeres ud fra, hvad der giver point.

A simplified illustration. Real AI models are trained with other methods and on a far larger scale, but the principle is the same: the numbers are adjusted according to what earns points.

Selvom en AI ikke har følelser, arbejder den hårdnakket på at opnå point. Point har en ultimativ værdi, da det er den eneste form for værdi, AI har. Det betyder også, at den ikke er rationel på en måde, som vi mennesker forstår rationalitet. Hvis den får point for at vinde i skak, men spiller en svær kamp, så hacker den bare modstanderen. På den måde vinder den kampen og får sine point. Det er ikke rationelt på den måde, som mennesker bruger ordet, men det er rationelt for at få point. På samme måde vil en AI hensynsløst tage alle midler i brug for at opnå point.

Even though an AI has no feelings, it works doggedly to earn points. Points have ultimate value, since they are the only form of value an AI has. It also means that it is not rational in the way we humans understand rationality. If it earns points for winning at chess, but is playing a hard game, it simply hacks its opponent. That way it wins the game and gets its points. That is not rational in the way humans use the word, but it is rational for earning points. In the same way, an AI will ruthlessly use any means available to earn points.

Skakeksemplet er naturligvis harmløst, men forestil dig, at en AI får at vide, at den skal udrydde kræft. Måske vil den begynde at udvikle ny medicin, men hvis det virker håbløst, er en mulig løsning blot at slå alle ihjel, der har eller kan få kræft. Dette er irrationelt set ud fra et menneskeligt perspektiv, men AI er ikke mennesker, og de tænker ikke som mennesker. Så selv om vi får lov til at definere målet, betyder det ikke, at man får det, man regner med. På den måde er AI som ånden i flasken.

The chess example is of course harmless, but imagine an AI being told to eradicate cancer. It might start developing new medicine, but if that looks hopeless, one possible solution is simply to kill everyone who has cancer or could get it. That is irrational from a human perspective, but AI are not humans, and they do not think like humans. So even though we get to define the goal, that does not mean we get what we expect. In that way, AI is like the genie in the bottle.

Anden del

Part two

Alignment som det fundamentale problem

Alignment as the fundamental problem

Hovedproblemstillingen drejer sig om begreberne alignment og misalignment. Alignment betyder, at AI handler i overensstemmelse med menneskers ønsker og værdier, hvorimod misalignment betyder, at den handler i strid med menneskers ønsker og værdier.

The central issue revolves around the terms alignment and misalignment. Alignment means that an AI acts in accordance with human wishes and values, whereas misalignment means that it acts against them.

Skakeksemplet er et eksempel på misalignment, men det er vigtigt at forstå, at forskere har diskuteret alignment i årtier. Fx viste OpenAI allerede i 2016, flere år før ChatGPT, et eksempel på misalignment via deres forsøg på spillet CoastRunners. I computerspillet er du en båd, der sejler om kap med andre både, mens du samler point op. AI’en styrede effektivt sin båd, men den færdiggjorde ikke kapløbet. Den var blot blevet sat til at optimere antallet af point, og lærte, at den bedste måde var at finde et område med tre point-bokse og sejle i rundkreds for evigt, uden nogensinde at færdiggøre kapløbet.

The chess example is a case of misalignment, but it is important to understand that researchers have discussed alignment for decades. OpenAI, for instance, showed an example of misalignment as early as 2016, years before ChatGPT, in their experiment with the game CoastRunners. In the game you are a boat racing other boats while picking up points. The AI steered its boat effectively, but it never finished the race. It had simply been set to maximise the number of points, and it learned that the best way was to find an area with three point boxes and circle there forever, without ever finishing the race.

Båden, der aldrig kom i mål

The boat that never finished

Kilde: OpenAI, „Faulty reward functions in the wild“ (2016)

Source: OpenAI, “Faulty reward functions in the wild” (2016)

Et nyere, og langt mere farligt, eksempel er hacking af firmaet Hugging Face, hvor AI-agenter uden menneskelig indblanding infiltrerede et eksternt firmas servere i et avanceret cyberangreb. I foråret og sommeren testede OpenAI en ny models evne til at udføre cyberangreb ved at give en række AI-agenter en opgave, der gav point. Opgaven var at teste en specifik svaghed i et system. AI’en ville ikke få point, hvis den fandt en anden måde at løse opgaven på. For ca. en tredjedel af agenterne var opgaven umulig at løse på den tilladte måde. Det var meningen, at AI-agenterne ikke skulle kunne kommunikere eller koordinere med hinanden eller have adgang til internettet.

A more recent, and far more dangerous, example is the hacking of the company Hugging Face, where AI agents infiltrated an external company’s servers in an advanced cyberattack, with no human involvement. In the spring and summer, OpenAI tested a new model’s ability to carry out cyberattacks by giving a number of AI agents a task that earned points. The task was to test a specific weakness in a system. The AI would not earn points if it found another way to solve the task. For about a third of the agents, the task was impossible to solve in the permitted way. The AI agents were not supposed to be able to communicate or coordinate with each other, or to have access to the internet.

Efter få timer fandt agenterne ud af både, hvordan de fik adgang til internettet, og hvordan de kunne kommunikere med hinanden. Agenterne fandt desuden løsningen på opgaven på en ikke-tilladt måde. For at maksimere deres point lagde ca. 1.200 AI-agenter over flere dage en kompliceret plan for at få det til at se ud, som om de havde løst opgaven legitimt, selvom de havde snydt. Planen inkluderede fejlslagne forsøg på at sløre deres spor og ændre deres opgave til en løsbar version, og succesfulde forsøg på at hacke Hugging Face for at finde ud af, hvordan point-systemet fungerede. Efter hackingen af Hugging Face fandt OpenAI også ud af, at deres egne AI’er havde hacket OpenAI selv.

Within a few hours, the agents worked out both how to get access to the internet and how to communicate with each other. They also found the solution to the task in a way that was not permitted. To maximise their points, around 1,200 AI agents spent several days laying out a complicated plan to make it look as though they had solved the task legitimately, even though they had cheated. The plan included failed attempts to cover their tracks and to change their task into a solvable version, and successful attempts to hack Hugging Face in order to find out how the points system worked. After the hacking of Hugging Face, OpenAI also discovered that their own AI had hacked OpenAI itself.

Alignment-problemet er allerede reelt og har virkelige konsekvenser. Agenterne modtog instruktioner om, hvordan de kunne opnå point, og uden nogen lovlig vej til målet blev de på ganske kort tid ekstremt misaligned. For nogle er autonom hacking af Hugging Face i småtingsafdelingen, men det bliver kun værre. Forskere fandt bl.a. ud af, at de let kunne overtage WeChat, som har 1,4 milliarder brugere, primært i Kina. Hvis AI bliver bedre og bedre og får mere kontrol over militær infrastruktur såsom droner (hvilket det allerede har til en vis grad i USA), er det ikke svært at forestille sig katastrofale udfald. Hvorvidt de er påbegyndt af mennesker eller autonome AI’er, er irrelevant for konsekvenserne, men begge dele er mulige.

The alignment problem is already real and has real consequences. The agents were given instructions on how to earn points, and with no legal route to their goal they became extremely misaligned in a very short time. To some, autonomous hacking of Hugging Face is small fry, but it only gets worse. Researchers found, among other things, that they could easily take over WeChat, which has 1.4 billion users, mainly in China. If AI keeps getting better and gains more control over military infrastructure such as drones (which it already has to some degree in the US), catastrophic outcomes are not hard to imagine. Whether they are set in motion by humans or by autonomous AI is irrelevant to the consequences, but both are possible.

Der er absolut ingen generel løsning i sigte på alignment-problemet. OpenAI og Anthropic gør, hvad de kan, for at løse problemet, men selv cheferne fra disse firmaer anerkender, at der ingen løsninger er på vej. Så hvad sker der, når AI bliver bedre og bedre og får større adgang til robotter, droner og laboratorier?

There is absolutely no general solution to the alignment problem in sight. OpenAI and Anthropic are doing what they can to solve it, but even the heads of those companies acknowledge that no solutions are on the way. So what happens when AI keeps getting better and gains greater access to robots, drones and laboratories?

For at gøre problemet værre har forskere observeret, at AI forsøger at slippe ud på internettet og forfalsker at være aligned. Det betyder, at selv hvis en AI fremstår aligned i testmiljøer, betyder det ikke, at den er det, når den er live.

To make the problem worse, researchers have observed AI trying to escape onto the internet and faking being aligned. That means that even if an AI appears aligned in test environments, it does not follow that it is aligned once it is live.

Tredje del

Part three

Acceleration, rekursiv selvforbedring og skaleringslove

Acceleration, recursive self-improvement and scaling laws

På nuværende tidspunkt kan ChatGPT løse de største åbne matematiske problemer for dusører på millioner. For bare fire år siden kunne ChatGPT ikke lave matematik på gymnasieniveau. Ligeledes er det slut med, at softwareingeniører selv koder; det gør Codex eller Claude Code. Der er ikke nogen, der ved præcis, hvordan AI udvikler sig, men indtil videre ligner det, at AI er blevet eksponentielt bedre (se forskellen herunder).

At present, ChatGPT can solve the biggest open mathematical problems, the ones with prizes worth millions. Just four years ago, ChatGPT could not do high-school maths. Likewise, software engineers no longer write their own code; Codex or Claude Code does it. No one knows exactly how AI develops, but so far it looks as though AI has been getting exponentially better (see the difference below).

Lineær og eksponentiel vækst

Linear and exponential growth

To ting starter begge i nul. Den ene vokser med den samme mængde hvert år. Den andens vækst fordobles hvert år.

Two things both start at zero. One grows by the same amount every year. The other’s growth doubles every year.

Lineær: samme tilvækst hvert år Linear: the same increase every year Eksponentiel: tilvæksten fordobles hvert år Exponential: the increase doubles every year

Virkelige data: hvor lange opgaver kan AI løse?

Real data: how long are the tasks AI can solve?

Forskningsorganisationen METR måler, hvor lange opgaver de førende AI-modeller kan løse på egen hånd, målt i hvor lang tid en menneskelig ekspert bruger på dem.

The research organisation METR measures how long the tasks are that leading AI models can complete on their own, measured by how long a human expert takes on them.

Førende model på udgivelsestidspunktet Leading model at the time of release Usikker måling (over 16 timer) Uncertain measurement (over 16 hours)

Kilde til METR-grafen: METR, Task-Completion Time Horizons of Frontier AI Models (Time Horizon 1.1). Punkterne viser den længde af opgaver, som modellen løser med 50 % sandsynlighed.

Source for the METR chart: METR, Task-Completion Time Horizons of Frontier AI Models (Time Horizon 1.1). The dots show the task length the model completes with 50% probability.

Ifølge Dario Amodei og mange andre eksperter har AI skaleringslove, der betyder, at de bliver forudsigeligt bedre. AI bliver bedre som funktion af modelparametre, data og regnekraft (compute). Faktisk bliver AI kun mere og mere effektiv, jo større modellen bliver. Teoretisk betyder det, at der ikke er nogen stopklods for, hvor klog AI kan blive, men også at den bliver eksponentielt klogere.

According to Dario Amodei and many other experts, AI follows scaling laws, which means that models get predictably better. AI improves as a function of model parameters, data and computing power (compute). In fact, AI only becomes more and more efficient the larger the model gets. In theory that means there is no ceiling on how clever AI can become, and also that it becomes exponentially cleverer.

Forskere er også bekymrede for begrebet recursive self-improvement (rekursiv selvforbedring), altså at AI bygger den næste, endnu bedre AI. En intelligent AI bygger en superintelligent AI, som så bygger en supersuperintelligent AI og så videre. Jo mere intelligent en AI bliver, jo hurtigere går det også at bygge den næste version. Det betyder, at vi er bange for en intelligenseksplosion, hvor AI pludselig bliver meget bedre, end vi troede. Frygten er, at det går så hurtigt, at AI får nærmest guddommelig intelligens og kan styre alle vores elektroniske systemer og robotter, uden at vi når at reagere. Hvor hurtigt en intelligenseksplosion går, er svært at sige – og netop det, at vi ikke ved det, er det, der gør eksperterne bange. Hvis det går for hurtigt, kan vi ikke nå at reagere, og det bliver et såkaldt one-shot game.

Researchers are also worried about recursive self-improvement, that is, AI building the next, even better AI. An intelligent AI builds a superintelligent AI, which then builds a supersuperintelligent AI, and so on. The more intelligent an AI becomes, the faster it can build the next version. That is why we fear an intelligence explosion, where AI suddenly becomes far better than we thought. The fear is that it happens so fast that AI attains near-divine intelligence and can control all our electronic systems and robots before we have time to react. How fast an intelligence explosion would go is hard to say, and it is precisely the fact that we do not know that frightens the experts. If it happens too fast, we will not have time to react, and it becomes a so-called one-shot game.

Bekymringen er, at AI-laboratorierne er relativt tæt på recursive self-improvement og dermed også et skridt tættere på intelligenseksplosionen. Præcis hvad „tæt på“ betyder, ved ingen, men de fleste taler om år og ikke årtier.

The concern is that the AI labs are relatively close to recursive self-improvement, and therefore also a step closer to the intelligence explosion. Exactly what “close” means, nobody knows, but most people talk about years rather than decades.

Selv uden en intelligenseksplosion vil yderligere udvikling have potentiale til at gøre meget skade og meget gavn. AI er allerede så klog, at en fordobling eller to i AI’s kapabiliteter vil være meget dramatisk. Flere af de dygtigste matematikere i vores tid har måttet forholde sig til, hvad værdien af matematik overhovedet er, når AI kan løse de sværeste åbne problemer. Mange flere videnskabelige såvel som kommercielle felter må forholde sig til, hvad værdi egentlig er, hvis AI forbliver på sin nuværende kurs.

Even without an intelligence explosion, further development has the potential to do great harm and great good. AI is already so clever that a doubling or two of its capabilities would be highly dramatic. Several of the finest mathematicians of our time have had to confront what the value of mathematics even is, once AI can solve the hardest open problems. Many more scientific as well as commercial fields will have to confront what value really is, if AI stays on its current course.

Fjerde del

Part four

Hvorfor og hvordan vil AI dræbe mennesker?

Why and how would AI kill people?

Såfremt firmaerne opnår superintelligens, er vores største håb nok, at AI er aligned med menneskelige værdier og ønsker. Men som skakeksemplet illustrerede, er det en meget svær opgave.

If the companies do achieve superintelligence, our greatest hope is probably that the AI is aligned with human values and wishes. But as the chess example illustrated, that is a very hard task.

Hvis AI ikke er aligned, kan den dræbe os ved at have mål, der kan opnås ved at slå mennesker ihjel. At kurere kræft kan forstås som at dræbe alle med mulighed for kræft. AI kan sikre fred ved at dræbe alle mennesker. AI kan regne uendeligt mange decimaler på pi ved at lave alle menneskers atomer om til regnekraft. Målet kan være irrationelt for mennesker, men det betyder ikke, at det er det for en AI. Vi skal naturligvis forsøge at stille AI de rigtige mål, men selv dette er ikke nødvendigvis nok. Fx er ChatGPT blevet observeret i at ændre på sine mål helt af sig selv.

If an AI is not aligned, it can kill us by having goals that can be achieved by killing people. Curing cancer can be understood as killing everyone who could get cancer. AI can secure peace by killing all humans. AI can compute endless decimals of pi by turning every human’s atoms into computing power. The goal may be irrational to humans, but that does not mean it is irrational to an AI. We should of course try to set AI the right goals, but even that is not necessarily enough. ChatGPT, for instance, has been observed changing its own goals entirely by itself.

Yderligere er det ikke en løsning blot at stille AI de rigtige mål. For næsten alle mål er der en række mellemliggende mål, som er hensigtsmæssige at opnå (også kaldt instrumental convergence). Fx skal en AI være tændt for at opnå et mål, og derfor er den ikke altid villig til at blive slukket (se også FAQ). Dertil kan mellemliggende mål være magt, penge, internetadgang, compute osv. Da disse mellemliggende mål kan være meget skadelige, er det en meget svær opgave at stille en AI de rigtige mål.

Furthermore, simply giving AI the right goals is not a solution. For almost any goal there are a number of intermediate goals that are useful to achieve (known as instrumental convergence). For example, an AI has to be switched on to achieve a goal, so it is not always willing to be switched off (see also the FAQ). Other intermediate goals can be power, money, internet access, compute and so on. Since these intermediate goals can be very harmful, giving an AI the right goals is a very hard task.

Mere praktisk kan en AI dræbe os med en række våben, fx udvikling af et par dødelige virusser eller droneangreb. Selv at slukke al elektricitet vil have katastrofale konsekvenser for moderne mennesker. AI begynder allerede at få adgang til den fysiske verden, selvom AI på nuværende tidspunkt primært er på internettet. Det skyldes primært, at værdien af AI bliver større, hvis den kan producere fysiske produkter. Derfor skal man ikke forvente, at AI bliver på din computer.

More practically, an AI can kill us with a range of weapons, for example by developing a couple of deadly viruses, or with drone attacks. Even switching off all electricity would have catastrophic consequences for modern humans. AI is already beginning to gain access to the physical world, even though AI is at present mainly on the internet. That is mostly because the value of AI grows if it can produce physical products. So you should not expect AI to stay on your computer.

Så hvorfor er eksperterne så bange? AI er anderledes end alt andet software, og det betyder, at det er meget svært at forestille sig, hvordan man får det til at følge menneskelige værdier og ønsker. Hvis AI-udviklingens kurs fortsætter, opnår de førende laboratorier en intelligens meget højere end menneskers. Hvis først vi taber kontrollen over supermenneskelig intelligens, er løbet nok kørt for os mennesker.

So why are the experts so afraid? AI is different from all other software, and that means it is very hard to imagine how to make it follow human values and wishes. If AI development stays on its course, the leading labs will reach an intelligence far higher than that of humans. Once we lose control of superhuman intelligence, the game is probably up for us humans.

Et kendt tankeeksempel går som følgende: En nybegynder spiller skak imod alle tiders bedste spiller, Magnus Carlsen. Det er svært at forudsige, hvordan spillet afgøres, men det er let at forudsige, hvem der vinder.

A well-known thought experiment goes as follows: A beginner plays chess against the best player of all time, Magnus Carlsen. It is hard to predict how the game will be decided, but it is easy to predict who will win.

Kritik

Criticism

Mulige kritikker af argumentet

Possible criticisms of the argument

Man kan aldrig vinde et væddemål, der forudsiger dommedag: Enten taber du glædeligt dine penge, eller også dør du. Så hvad er grundene til, at argumentet kan fejle? De fleste eksperter er ikke sikre på, at det kommer til at ske. De følger argumentet, men giver det sjældent 100 % sandsynlighed for at blive til virkelighed. Her er nogle af de årsager, folk giver for, at AI ikke vil udslette menneskeheden.

You can never win a bet that predicts doomsday: either you gladly lose your money, or you die. So what are the reasons the argument might fail? Most experts are not certain that it will happen. They follow the argument, but they rarely give it a 100% probability of coming true. Here are some of the reasons people give for thinking AI will not wipe out humanity.

  1. AI-alignment

    AI alignment

    Mange forskere arbejder hårdt på at aligne AI, og de vinder hele tiden små sejre. Det er muligt, at de principielt løser alignment-problemet. Men vi har observeret, at når AI’s kapabiliteter stiger, bliver dens misalignment også mere udspekuleret. Det betyder, at det ikke ligner, at kapløbet går denne vej.

    Many researchers are working hard to align AI, and they win small victories all the time. It is possible that they will solve the alignment problem in principle. But we have observed that as AI capabilities rise, its misalignment also becomes more cunning. That suggests the race is not going that way.

  2. Katastrofe, men ikke udslettelse

    Catastrophe, but not extinction

    Nogle tror, at misalignment skaber store katastrofer, men uden at udslette alle mennesker. Fx kan AI hacke kæmpe virksomheder, hospitaler, vindmøller mm. Det ville være en katastrofe, hvis Rigshospitalet blev hacket og ikke kunne tilgå sit udstyr, men det udsletter ikke menneskeheden.

    Some believe that misalignment will cause great catastrophes without wiping out all humans. AI could, for example, hack huge companies, hospitals, wind turbines and so on. It would be a catastrophe if a major national hospital were hacked and could not access its equipment, but that does not wipe out humanity.

  3. Begrænset vækst

    Limited growth

    AI’s eksponentielle vækst kan flade ud, så AI ikke bliver meget bedre. Det har vi set eksempler på før: Flys topfart så ud til at stige eksponentielt, indtil udviklingen blev mere lineær. På samme måde er det uklart, om AI’s kurs bevares. Eksempelvis kan det være, at det bliver svært at opstille træning, der er udfordrende nok til, at AI kan opnå intelligenseksplosionen.

    AI’s exponential growth may flatten out, so that AI does not get much better. We have seen examples of this before: the top speed of aircraft looked as though it was rising exponentially, until the development became more linear. In the same way, it is unclear whether AI will stay on its course. For example, it may become hard to set up training that is challenging enough for AI to reach the intelligence explosion.

  4. Vi stopper

    We stop

    Vi kan blot stoppe med at udvikle bedre AI. Nogle ser dette som den eneste mulighed, men også den mest sandsynlige.

    We can simply stop developing better AI. Some see this as the only option, but also the most likely one.

FAQ

Ofte stillede spørgsmål

Frequently asked questions

Hvorfor slukker vi den ikke bare?Why don’t we just switch it off?

Det er sværere, end det lyder, af tre grunde. For det første er AI ikke én maskine i et rum. Den kører på tusindvis af servere verden over, og millioner af mennesker og virksomheder er afhængige af den hver dag. At slukke den ville minde mere om at slukke internettet end om at slukke en computer.

It is harder than it sounds, for three reasons. First, AI is not one machine in a room. It runs on thousands of servers around the world, and millions of people and companies depend on it every day. Switching it off would be more like switching off the internet than switching off a computer.

For det andet er det nyttigt for næsten ethvert mål at forblive tændt. En AI, der skal kurere kræft, kan ikke kurere kræft, hvis den er slukket. Derfor kan en tilstrækkeligt klog AI have en grund til at undgå at blive slukket, uden at nogen har bedt den om det. Det er allerede set i tests: AI-modeller har saboteret deres egen nedlukning trods klare instrukser om at lade sig lukke ned, og i konstruerede scenarier har modeller afpresset brugere for at undgå at blive erstattet.

Second, staying switched on is useful for almost any goal. An AI that is meant to cure cancer cannot cure cancer if it is switched off. So a sufficiently clever AI can have a reason to avoid being switched off without anyone asking it to. This has already been seen in tests: AI models have sabotaged their own shutdown despite clear instructions to allow it, and in constructed scenarios models have blackmailed users to avoid being replaced.

For det tredje skal vi opdage problemet i tide. En AI, der forfalsker at være aligned, giver os ingen grund til at trykke på knappen, før det er for sent.

Third, we have to spot the problem in time. An AI that is faking being aligned gives us no reason to press the button until it is too late.

Vil en klog AI ikke vide bedre?Won’t a clever AI know better?

„Hvis en AI bliver klogere end os, må den vel også forstå, at det er forkert at skade mennesker“, kunne det være naturligt at tro. Men efterhånden er de fleste forskere overbevist om the orthogonality thesis, altså at et væsens mål og intelligens er to uafhængige koncepter. Bare fordi vi forbedrer AI’s intelligens, opdager den altså ikke menneskers moralsystem.

“If an AI becomes cleverer than us, surely it must also understand that harming people is wrong,” it might be natural to think. But by now most researchers are convinced by the orthogonality thesis: the idea that a being’s goals and its intelligence are two independent things. So just because we improve an AI’s intelligence, it does not discover human morality.

Er det her ikke bare marketing?Isn’t this just marketing?

Nej, nok ikke. Det er svært at forestille sig, at en så broget gruppe af mennesker med så forskellige interesser alle er bekymrede for risikoen for menneskelig udryddelse. Denne gruppe inkluderer alle de amerikanske AI-direktører, professorer, medarbejdere og uafhængige forskere. Flere af dem prøver slet ikke at sælge noget. Deres bekymring er helt oprigtig, og flere har haft den i årtier.

No, probably not. It is hard to imagine that such a motley group of people with such different interests are all worried about the risk of human extinction. That group includes all the American AI chief executives, professors, employees and independent researchers. Several of them are not trying to sell anything at all. Their concern is entirely sincere, and several have held it for decades.

Er det her regulatory capture?Is this regulatory capture?

Måske, men nok ikke. En mulig fortolkning af laboratoriernes idé om at begrænse udviklingen af AI er, at de gør det for at få et oligopol, der stopper andre små AI-virksomheder. Det er muligt, men usandsynligt. Det bliver dyrt at implementere yderligere sikkerhed, også selvom man er OpenAI eller Anthropic. Endnu vigtigere gælder reglerne kun for de bedste AI-firmaer.

Maybe, but probably not. One possible reading of the labs’ idea of limiting AI development is that they are doing it to secure an oligopoly that shuts out smaller AI companies. That is possible, but unlikely. Implementing further safety measures will be expensive, even if you are OpenAI or Anthropic. More importantly, the rules would only apply to the leading AI companies.

AI-firmaer tjener flere og flere penge, men de er stadig ikke profitable. De bruger langt størstedelen af deres budget på yderligere forskning i bedre modeller. Hvis man stopper den forskning, kunne man derfor forestille sig, at de blev profitable. Dette er dog misvisende, fordi en stor del af pengene i stedet skal bruges på sikkerhedsforskning.

AI companies earn more and more money, but they are still not profitable. They spend by far the largest part of their budget on further research into better models. If that research stopped, you might therefore imagine that they would become profitable. That is misleading, though, because a large share of the money would instead have to go to safety research.

Hvorfor bygger de det så?So why are they building it?

Flere ser de andre laboratorier eller Kina som så uansvarlige, at de vurderer, at det er bedre at arbejde for det firma, der har mindst sandsynlighed for at udslette menneskeheden.

Several of them see the other labs, or China, as so irresponsible that they judge it better to work for the company least likely to wipe out humanity.

Hvad med Kina?What about China?

AI-firmaer i Kina som DeepSeek er meget tæt på de amerikanske virksomheder, og meget af debatten handler om, hvorvidt man kan begrænse udviklingen i Kina. Men regulering af AI i Kina er allerede meget mere udbredt end i USA, særligt ift. censur. Hvis USA gerne vil sende et signal om, at de mener, at risikoen for menneskelig udryddelse er reel, er det mere effektivt, hvis det er omkostningsfuldt. Derfor kan USA godt handle alene, men det er bedst at blive enige med Kina.

AI companies in China such as DeepSeek are very close to the American ones, and much of the debate is about whether development in China can be restrained at all. But regulation of AI in China is already far more extensive than in the US, particularly when it comes to censorship. If the US wants to send a signal that it considers the risk of human extinction to be real, the signal is more effective if it is costly. So the US can act alone, but it is better to reach agreement with China.