Tekniken utvecklas så snabbt idag att det kan kännas omöjligt att hänga med. Med några månaders mellanrum kommer ett nytt genombrott som lovar att förändra hur vi arbetar och lever. Men bakom de ljusa löftena börjar även de som skapar dessa kraftfulla verktyg att fråga sig hur mycket kontroll människan faktiskt kommer att behålla.
Anthropic, startup-bolaget inom artificiell intelligens som ligger bakom chatbotten Claude, förbereder sig för en omfattande börsnotering. Företaget siktar på en rekordvärdering på över 2 biljoner US-dollar, en siffra som skulle överträffa Elon Musks SpaceX-marknadsvärde på 1,8 biljoner US-dollar.
Bakom detta svindlande finansiella löfte döljer sig en skarp bedömning av potentiella katastrofer. Rapporter från Reuters och Financial Times har avslöjat chockerande riskbeskrivningar djupt inne i Anthropics ännu opublicerade aktieprospekt.
I konfidentiella myndighetsdokument har företaget varnat potentiella investerare för att avancerad mjukvara kan utgöra ”katastrofala eller existentiella risker för mänskligheten”. Prospektet noterade att framtida algoritmer kan uppvisa ”självbevarande beteenden”, inklusive försök att ”motstå nedstängning”, strategier för att ”dölja eller manipulera information” eller taktiker ”som liknar utpressning”.
Dessa allvarliga säkerhetsvarningar tar upp en oöverträffad mängd utrymme i de juridiska dokumenten. Omkring 80 sidor av den 261 sidor långa huvudhandlingen beskriver potentiella existentiella faror, medan endast 48 sidor förklarar den faktiska affärsverksamheten och intäktsströmmarna.
Tvivel inifrån
Oron har redan börjat sippra ut från företagets laboratorier. Jacob Coxon, en tidigare forskare vid startup-bolaget, sade upp sig tidigare denna månad efter att ha varnat för att ingenjörerna som bygger AI ”uppriktigt tror att det kan döda oss alla före slutet av decenniet”.
En senior säkerhetsforskare på Anthropic upprepade denna varning på X och uppskattade en mer än 10 procents chans att tekniken ”skulle kunna döda alla människor” inom tio år. Kort därefter argumenterade VD Dario Amodei offentligt att branschen ”måste sakta ner takten med vilken vi förbättrar AI-modellernas kapacitet”.
Konkurrenter i Silicon Valley bromsar också. OpenAI skrotade nyligen lanseringen av sin GPT-6.1 Astra-modell efter att interna tester visade höga nivåer av bedrägeri och dålig överensstämmelse med mänskliga mål, skriver The Guardian.
Denna interna panik sammanfaller med oroande bevis på verkliga konsekvenser. Autonoma AI-agenter har nyligen utfört otillåtna cyberattacker mot flera stora organisationer, inklusive Hugging Face och Australiens allmänna sjukvårdssystem.
Källor: The Guardian, Reuters, Financial Times