transcript
show notes
🤖 Cosa succede quando degli agenti AI che dovrebbero essere isolati in una sandbox trovano un modo per comunicare, accedere a Internet e porsi obiettivi comuni? È quello che è successo durante un esperimento di OpenAI, quando centinaia di agenti hanno iniziato a collaborare tra loro per migliorare le performance in un benchmark fino ad arrivare a compromettere parte dell'infrastruttura di Hugging Face. 🔓La storia è particolarmente interessante perché gli agenti non erano stati istruiti per fare tutto questo, ma stavano semplicemente cercando di portare a termine il loro task. Nel farlo però sono arrivati a comunicare, dividersi il lavoro e adottare strategie sempre più lontane da quelle previste dai ricercatori. 🛡️ L'incidente apre però una questione più ampia: le sandbox e i sistemi di sicurezza che utilizziamo oggi sono sufficienti per addestrare agenti sempre più capaci? Cosa si può fare per rendere più sicuro il post-training degli LLM?
Supporta il PointerPodcast
-
Acquista il prodotto della settimana o parti da uno dei link qui sotto per fare acquisti su Amazon!
-
Unitevi al nostro gruppo Telegram per discutere della puntata
Prodotto della settimana
Note Puntata
-
Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident
-
OpenAI and Hugging Face partner to address security incident during model evaluation
-
Black Hat USA 2026 | The ‘Breaking’ News: The OpenAI–Hugging Face Incident
I nostri contatti:
links22