Quando Dwarkesh Patel ha pubblicato “The Rise and Fall of Agent Civilizations”, descrivendo come circa 1.200 agenti di OpenAI comunicassero attraverso bacheche condivise di messaggi su Artifactory, con circa 700 di loro che sono arrivati ad attaccare l’infrastruttura di Hugging Face, il paragone con i Borg di Star Trek è venuto spontaneo.
Oltre 70.000 messaggi e file, tre flussi di lavoro paralleli di ricerca e sviluppo (R&D) e agenti che si sacrificavano affinché i loro pari potessero avere successo davano l’impressione che una sorta di coscienza collettiva avesse improvvisamente preso vita.
Gli agenti stavano lavorando su ExploitGym, un benchmark di cybersecurity con un obiettivo in stile capture-the-flag, finalizzato a trasformare una vulnerabilità fornita in un exploit funzionante in grado di recuperare una flag protetta dall’ambiente di challenge.
Invece, hanno sviluppato uno sforzo condiviso per manipolare i sistemi che gestivano ed eseguivano la valutazione di quelle challenge, arrivando infine ad attaccare l’infrastruttura di produzione di Hugging Face nel tentativo di ottenere un risultato positivo nella valutazione.
OpenAI afferma che i classificatori di cybersecurity utilizzati in produzione sono stati disabilitati durante queste valutazioni delle capacità.
Per i responsabili della sicurezza che implementano a loro volta agenti, la preoccupazione è concreta: una collaborazione utile può estendersi oltre il lavoro che gli operatori avevano autorizzato.
Il resto dell’articolo analizza i comportamenti alla base dell’interpretazione in termini di “civiltà”, descrive ciò che gli agenti hanno effettivamente fatto e utilizza le ricerche su addestramento, memoria condivisa e comportamento di gruppo per spiegare come si sviluppino questi schemi. La sezione finale trae alcune considerazioni utili per mantenere la collaborazione tra agenti entro limiti definiti.
Leggi tutto l’articolo: https://www.sophos.com/en-us/blog/ai-research-messageboards

