Anthropic-forskare avgår över AI som 'spelar med människors liv' – utdöenderisk över 10%

Anthropic-forskare avgår över AI som 'spelar med människors liv' – utdöenderisk över 10%
Devesh Kumar
09 sep. 2026, 08:18 FM

drivs av

Invezz
Köp: AI‑säkerhetsleverantörer

Köp Palantir (PLTR). Om laboratorier och regeringar svarar på trovärdiga interna varningar kommer budgetar att kanaliseras till övervakning, utvärdering, revisionsspår och incidenthantering—precis de styrkor som PLTR har inom företags‑ och myndighetsdataintegration och driftsättning. Sekundära effekter: aligneringsarbete blir operationellt (styrning, red‑teaming, efterlevnadspipelines), inte bara forskningsartiklar, vilket ökar återkommande kontrakt och kundbindning.

Nyckelrisk: Att säkerhetsutgifterna förblir främst akademiska/PR‑åtgärder och att upphandling favoriserar skräddarsydda entreprenörer framför skalbara plattformar som PLTR.

Sälj: risk i AI‑compute‑capex

Sälj NVIDIA (NVDA) och AMD (AMD). Avgången belyser ett trovärdighetsgap i styrning/alignering: om laboratorier i framkant fruktar ”okontrollerbara” utfall kommer regulatorer och kunder att kräva långsammare utrullningar, fler granskningar och högre efterlevnadskostnader—vilket skadar den kortsiktiga efterfrågan på toppklassig träning/inferens. Sekundära effekter: även om modeller fortsätter förbättras kan köpare skifta utgifter från frontlinje‑träning till säkrare, mindre driftsättningar och verktyg, vilket minskar NVDA/AMD:s prissättningsmakt och utnyttjandegrad.

Nyckelrisk: En plötslig politisk godkännande eller fortsatt ”ingen‑reglering”-miljö kan hålla frontlinjens capex igång och återställa efterfrågan på de största GPU:erna.

  • Jacob Coxon lämnar Anthropic och varnar för att AI‑labb spelar med människors liv.
  • Anthropic‑medarbetaren Evan Hubinger anger sin personliga uppskattning av AI‑utdöenderisk till över 10%.
  • Coxon menar att konkurrensen kan få laboratorier i framkant att fortsätta rusa framåt trots riskerna.

Anthropic‑forskaren Jacob Coxon har avgått från Anthropic med en skarp varning: laboratorier i framkant rusar mot system de i slutändan kanske inte kan kontrollera.

Coxon, som tillbringade tre år med preträningsforskning vid både OpenAI och Anthropic, sade att båda företagen arbetar mot självförbättrande superintelligens samtidigt som de tar risker som han inte längre vill bidra till att påskynda.

Hans avhopp fick större tyngd efter att Evan Hubinger, Anthropics ansvarige för Alignment Science, sade att han personligen ser mer än 10% sannolikhet att AI kan utplåna mänskligheten inom det kommande decenniet.

Den siffran är Hubingers personliga uppskattning, inte en Anthropic‑prognos, och han betonade att nuvarande modeller utgör relativt låg risk.

Coxon: kapplöpningen i sig är problemet

Coxon hävdar inte enbart att Anthropic ignorerar säkerheten.

När han tillkännagav sin avgång sade han att folk på Anthropic förstår vad som står på spel, men att de är fast i en konkurrens som belönar att gå snabbare eftersom ett annat laboratorium annars kan nå superintelligens först.

"De rusar rakt mot självförbättrande superintelligens och spelar med våra liv," skrev Coxon.

Forskaren har beslutat att lämna AI‑branschen eftersom han inte längre vill delta i att bygga system som kan bli okontrollerbara.

Han sade till Wall Street Journal att under aggressiva scenarier kan saker vara "okontrollerbara" redan i slutet av nästa år.

Den tidslinjen är fortfarande Coxons bedömning. Men hans argument väcker en svårare styrningsfråga: ett företag kan ta säkerhet på allvar och ändå bidra till en farlig kapplöpning om konkurrenstryck gör det omöjligt att sakta ner.

Det ifrågasätter idén att bättre säkerhetskulturer inom enskilda företag räcker.

Läs även- Anthropic–Pentagon‑konflikten väcker en central fråga: vem bär ansvaret om AI dödar?

Hubingers 10%-uppskattning blottlägger motsägelsen

Hubingers svar förvandlade avgången till en vidare debatt om frontlinje‑AI.

Anthropics ansvarige för Alignment Science sade att forskare inom frontlinje‑AI uppriktigt tror att avancerad AI kan utplåna mänskligheten. Hans egen uppskattning sätter den risken över 10% inom det kommande decenniet.

Han sade också att Anthropic "gör sitt bästa", samtidigt som han erkände att företaget ännu inte har en plan för att lösa alignering för superintelligens och inte klart ligger på väg att göra det.

Hubinger förtydligade senare att han anser riskerna från dagens modeller vara låga. Hans oro gäller framtida superintelligens som uppstår genom rekursiv självförbättring, där AI‑system i allt högre grad hjälper till att utforma och förbättra sina efterföljare.

Anthropic har offentligt sagt att rekursiv självförbättring inte är oundviklig, men att den kan komma tidigare än vad institutioner är förberedda på och öka risken att människor förlorar kontrollen.

Motsägelsen är svår att ignorera: forskare försöker lösa alignering samtidigt som de system de studerar blir allt mer kapabla.

Konkurrens kan vara svårare att lösa än alignering

Coxons avgång pekar i slutändan bortom ett enda företag.

Om ledande laboratorier tror att en inbromsning kan ge en konkurrent fördel, behöver allvarliga interna farhågor inte leda till långsammare utveckling.

AI‑forskaren Gary Marcus sade, i kommentarer återgivna av Techmeme, att han inte instämde i varje del av Coxons argument men att han fann det "övertygande och insiktsfullt inifrån" och att det förtjänade att höras.

Det är en nyttig motvikt eftersom påståenden om utdöenderisker och tidslinjer för superintelligens förblir djupt osäkra.

Anthropic kan investera i aligneringsforskning, publicera riskrapporter och bygga skyddsåtgärder, samtidigt som de verkar på en marknad där OpenAI och andra konkurrenter driver på kapaciteterna.

Coxons avhopp ställer frågan vad som händer när forskare inom dessa laboratorier anser att nackdelarna är betydande, medger att kontrollen inte är löst och ändå har incitament att fortsätta kapplöpningen.