Prendiamo in considerazione un alert di cybersecurity relativo a uno script PowerShell potenzialmente dannoso che scarica ed esegue un file. Un agente AI all'interno di un Security Operations Center (SOC) può gestirlo scegliendo tra una serie predefinita di azioni: chiudere l'alert classificandolo come benigno, raccogliere ulteriori evidenze oppure inoltrarlo a un analista. Prima di consentire all'agente di intervenire su questi alert, il SOC deve sapere con quale frequenza effettua la scelta corretta e se il suo livello di confidenza aiuta a individuare gli errori.
TypeSafe.ai ha sviluppato Jev proprio per questo tipo di attività decisionali. Uno sviluppatore fornisce un contesto strutturato, una domanda e le risposte consentite, e Jev restituisce le probabilità associate a ciascuna risposta, senza generare un testo articolato. TypeSafe presenta questa architettura come una soluzione molto più rapida ed economica, in termini di costo per decisione, rispetto a un Large Language Model (LLM) generalista.
In un'intervista a Latent Space, Diogo Almeida, cofondatore e CEO di TypeSafe, ha descritto una categoria di modelli in cui «l'obiettivo è che sia il codice a utilizzare il risultato». La sua ambizione è rendere queste valutazioni sufficientemente affidabili da consentire agli sviluppatori di richiamarle con la stessa frequenza e semplicità di una query a un database.
TypeSafe ha chiamato Jev il proprio modello ispirandosi al paradosso di Jevons, secondo cui una maggiore efficienza stimola un aumento della domanda tale da determinare un incremento del consumo complessivo delle risorse.
Ed è proprio qui che emerge il paradosso di Jev. Se Jev rende le decisioni automatizzate sufficientemente economiche da poter essere applicate a qualsiasi attività, i team automatizzeranno un numero molto maggiore di decisioni e qualsiasi tasso di errore superiore a quello attuale, umano o automatizzato, si tradurrà in un aumento del numero complessivo di errori.
Il fatto di restituire sempre una risposta valida rende Jev facile da integrare. La frequenza con cui seleziona la risposta corretta determina invece la sua effettiva utilità. Se, inoltre, è in grado di riconoscere quando una risposta proposta non è affidabile, questa capacità può influenzare la quantità di lavoro che è possibile automatizzare in sicurezza.
Si tratta di tre proprietà distinte, che l'attenzione suscitata dal lancio di Jev ha contribuito, almeno in parte, a confondere.
I classificatori che accettano le proprie etichette al momento dell'esecuzione non rappresentano una novità. Almeno dal 2019, i modelli di Natural Language Inference (NLI) gestiscono la classificazione zero-shot verificando se un determinato input supporta un'affermazione come «questo alert è dannoso», senza che sia necessario riaddestrare il modello.
Un benchmark pubblicato nel marzo 2026 ha confrontato questi modelli con modelli di embedding, reranker e LLM ottimizzati tramite instruction tuning.
TypeSafe non ha pubblicato l'architettura di Jev, quindi non è chiaro dove si collochi rispetto a queste soluzioni, sebbene il suo obiettivo dichiarato di addestrare il modello a prendere decisioni calibrate presenti analogie con alcune ricerche pubblicate, che verranno approfondite più avanti.
In ogni caso, per un SOC, la novità tecnologica dovrebbe contare meno della capacità di Jev di migliorare i propri flussi di lavoro. Per questo motivo, i primi test indipendenti pubblicati dopo il lancio meritano un'analisi più approfondita.
Leggi tutto l’articolo: https://www.sophos.com/en-us/blog/jevs-paradox-hidden-cost-of-cheap-ai-decisionshttps://www.sophos.com/en-us/blog/jevs-paradox-hidden-cost-of-cheap-ai-decisions

