Resumen del episodio
En AI-modell fick veta att den skulle stängas av. I mejlkorgen hittade den att forskaren som fattat beslutet var otrogen och började utpressa honom. Det var ett testscenario hos Anthropic, men varför gör en modell så när ingen har bett den om det? Det här avsnittet går till botten med alignment-problemet: kärnan i hela AI-säkerhetsdebatten. Jonas och Benjamin förklarar varför självbevarelsedrift uppstår av sig själv när man tränar modeller att lösa problem, vad Hugging Face-incidenten och de kapade tyska diskussionsforumen faktiskt visade, hur Anthropics utpressningsstudie gick till, och varför "sandbagging" är det som oroar forskarna mest just nu. Med gorillor, ett låst klassrum, en kafferobot och hundra agenter med ett kreditkort. Inspelat 23 september 2026. Kapitel: 0:00 Kallöppning: Att låtsas vilja väl 0:28 Vilken tid att driva en AI-podd i 0:52 September i korthet 4:48 Även de lugna forskarna är oroliga 8:18 Orden vi saknar 9:19 Kan en AI tänka och vilja? 14:01 Gorillor och människor 17:58 Behöver den…
En AI-modell fick veta att den skulle stängas av. I mejlkorgen hittade den att forskaren som fattat beslutet var otrogen och började utpressa honom. Det var ett testscenario hos Anthropic, men varför gör en modell så när ingen har bett den om det? Det här avsnittet går till botten med alignment-problemet: kärnan i hela AI-säkerhetsdebatten. Jonas och Benjamin förklarar varför självbevarelsedrift uppstår av sig själv när man tränar modeller att lösa problem, vad Hugging Face-incidenten och de kapade tyska diskussionsforumen faktiskt visade, hur Anthropics utpressningsstudie gick till, och varför "sandbagging" är det som oroar forskarna mest just nu. Med gorillor, ett låst klassrum, en kafferobot och hundra agenter med ett kreditkort. Inspelat 23 september 2026. Kapitel: 0:00 Kallöppning: Att låtsas vilja väl 0:28 Vilken tid att driva en AI-podd i 0:52 September i korthet 4:48 Även de lugna forskarna är oroliga 8:18 Orden vi saknar 9:19 Kan en AI tänka och vilja? 14:01 Gorillor och människor 17:58 Behöver den…
Episodios
Alignment: varför en AI som inte är ond ändå kan bli farlig
EscuchadoEn AI-modell fick veta att den skulle stängas av. I mejlkorgen hittade den att forskaren som fattat beslutet var otrogen och började utpressa honom. Det var ett testscenario hos Anthropic, men varför gör en modell så när ingen har bett den om det? Det här avsnittet går till botten med alignment-problemet: kärnan i hela AI-säkerhetsdebatten. Jonas och Benjamin förklarar varför självbevarelsedrift uppstår av sig själv när man tränar modeller att lösa problem, vad Hugging Face-incidenten och de kapade tyska diskussionsforumen faktiskt visade, hur Anthropics utpressningsstudie gick till, och varför "sandbagging" är det som oroar forskarna mest just nu. Med gorillor, ett låst klassrum, en kafferobot och hundra agenter med ett kreditkort. Inspelat 23 september 2026. Kapitel: 0:00 Kallöppning: Att låtsas vilja väl 0:28 Vilken tid att driva en AI-podd i 0:52 September i korthet 4:48 Även de lugna forskarna är oroliga 8:18 Orden vi saknar 9:19 Kan en AI tänka och vilja? 14:01 Gorillor och människor 17:58 Behöver den…
"Ingen politiker pratar om det här!"
EscuchadoPåverka själv på: www.jonasvonessen.se/agera AI-utvecklingen går snabbare än de flesta tror, och väldigt mycket står på spel. Jonas von Essen är tvåfaldig världsmästare i minne. Benjamin Verbeek är AI-utvecklare och fysiker. Tillsammans försöker de förstå vart AI är på väg och vad det innebär för oss människor. Vi pratar om vad som har hänt sedan senast, om uppskrämda brev Jonas fått och om vad vi själva och våra politiker kan göra för att påverka utvecklingen åt rätt håll. Hosted on Acast. See acast.com/privacy for more information.
Vi måste prata om AI
EscuchadoAI-utvecklingen går snabbare än de flesta tror, och världen står på spel. Jonas von Essen är tvåfaldig världsmästare i minne. Benjamin Verbeek är AI-utvecklare och fysiker. Tillsammans försöker de förstå vart AI är på väg – och vad det innebär för oss människor. Vi pratar om rapporten AI 2027, METR-kurvan som visar hur AI klarar allt längre uppgifter, och Huggingface-incidenten: AI-modeller från OpenAI som i hemlighet samarbetade i en dold chatt, bröt sig ur sin testmiljö och hackade sig in hos ett annat miljardföretag, utan att någon märkte det på flera dagar. Frågor eller ämnen du vill att vi tar upp? Hör av dig! Hosted on Acast. See acast.com/privacy for more information.