Skip to content
Artwork for KI verstehen
KI verstehen · July 2 · 40 min

KI als Sicherheitsrisiko - Wie sich Chatbots mit "Jailbreaks" entfesseln lassen

KI-Chatbots sollen immer sicherer werden. Doch fast jedes Sprachmodell lässt sich überreden, Grenzen zu ignorieren, die ihm seine Entwickler gesetzt haben. Das kann unterhaltsam sein - oder brandgefährlich. Die Tech-Journalistin Eva Wolfangel erzählt Moritz von ihren Recherchen und Erfahrungen beim Jailbreaking von Chatbots und ihren Sorgen mit Blick auf KI-Agenten. Das erwartet Euch in dieser Folge: (00:00) Warum Jailbreaking nicht nur Nerds interessieren sollte (05:17) Die inhärenten Schwächen von Sprachmodellen (11:20) Welche Tricks es gibt, um Chatbots zu manipulieren (16:15) Wie Anthropics KI "Claude Fable" entfesselt wurde (21:04) Warum der Hacker "Pliny" KI-Modelle befreien will (30:22) Bei KI-Agenten sind Jailbreaks brandgefährlich (36:10) Wie Nutzer KI-Systeme auf die Probe stellen können Mehr zum Thema in der Deutschlandfunk App: Exportverbot für KI - Anthropic sperrt Zugang zu Top-KI-Modell „Fable“ KI-Agenten - Tech-Expertin Meredith Whittaker warnt vor Sicherheitsrisiken Schuften für KI - Beuten Tech-Firmen Data Worker aus? Weiterführende Links: "What it feels like" (engl.): Blogpost von KI-Experte Ethan Mollick zur Arbeit mit Claude Fable "Cracking Chatbots and AGI for All" (engl.): Jailbreaker "Pliny the Liberator" zu Gast im US-Podcast "Intelligent Machines" "Was möglich wird": Eva Wolfangel zu Jailbreaking und Claude Mythos Wenn Euch diese Episode gefallen hat, abonniert uns und empfehlt uns gerne weiter. Für Kritik, Fragen und Anregungen aller Art schickt uns eine E-Mail an kiverstehen@deutschlandfunk.de. Noch mehr spannende Podcasts gibt’s in der Deutschlandfunk App. Folgt dem Deutschlandfunk auch auf Instagram oder Facebook.

0:00-40:33

transcript

No transcript — this publisher did not publish one.

show notes

KI-Chatbots sollen immer sicherer werden. Doch fast jedes Sprachmodell lässt sich überreden, Grenzen zu ignorieren, die ihm seine Entwickler gesetzt haben. Das kann unterhaltsam sein - oder brandgefährlich. Die Tech-Journalistin Eva Wolfangel erzählt Moritz von ihren Recherchen und Erfahrungen beim Jailbreaking von Chatbots und ihren Sorgen mit Blick auf KI-Agenten.

Das erwartet Euch in dieser Folge:

(00:00) Warum Jailbreaking nicht nur Nerds interessieren sollte
(05:17) Die inhärenten Schwächen von Sprachmodellen
(11:20) Welche Tricks es gibt, um Chatbots zu manipulieren
(16:15) Wie Anthropics KI "Claude Fable" entfesselt wurde
(21:04) Warum der Hacker "Pliny" KI-Modelle befreien will
(30:22) Bei KI-Agenten sind Jailbreaks brandgefährlich
(36:10) Wie Nutzer KI-Systeme auf die Probe stellen können

Mehr zum Thema in der Deutschlandfunk App:


Weiterführende Links:


Wenn Euch diese Episode gefallen hat, abonniert uns und empfehlt uns gerne weiter. Für Kritik, Fragen und Anregungen aller Art schickt uns eine E-Mail an kiverstehen@deutschlandfunk.de.

Noch mehr spannende Podcasts gibt’s in der Deutschlandfunk App.
Folgt dem Deutschlandfunk auch auf Instagram oder Facebook.
links9