Skip to content Skip to footer

Mythos, quando un’AI diventa pericolosa? E chi lo decide?

Walter Miele

Walter Miele

CTO e innovation manager con una profonda esperienza in intelligenza artificiale, cybersecurity e infrastrutture cloud. Da anni guida progetti complessi di ricerca e sviluppo in ambito AI, sicurezza informatica e automazione industriale, integrando competenze tecniche avanzate, con una visione strategica orientata all’innovazione.
Senza titolo (A2 (orizzontale)) (2)
Preferisci ascoltare? Clicca play!
Getting your Trinity Audio player ready...

Il caso del modello che Anthropic ha deciso di non rilasciare e il vuoto di governance che mette in evidenza

Il 7 aprile 2026 Anthropic ha pubblicato la system card di un modello frontier che non è mai stato messo in commercio: Claude Mythos Preview. È la prima volta, da quando OpenAI nel 2019 rallentò la pubblicazione di GPT-2, che un laboratorio di AI di primo piano dichiara apertamente che un proprio modello è «troppo pericoloso» per essere rilasciato al pubblico. La motivazione non è generica: Mythos, secondo i dati della casa, è in grado di individuare e sfruttare autonomamente vulnerabilità zero-day in ogni sistema operativo maggiore e in ogni browser diffuso, a un tasso e con una sofisticazione che fino a un anno prima non era alla portata di alcun modello.

La notizia ha prodotto una reazione sproporzionata rispetto al consueto ciclo di annunci AI: riunioni riservate al Tesoro USA e alla Federal Reserve, consultazioni tra le banche tedesche e i regolatori nazionali, un incontro al piano alto della Casa Bianca tra il Chief of Staff e il CEO di Anthropic, un intervento pubblico del FMI sulla stabilità dei sistemi finanziari. Per un modello che, formalmente, non esiste ancora come prodotto.

La domanda tecnica – quando un’AI è effettivamente «pericolosa» – e quella politica – chi ha il titolo per deciderlo – sono collassate in un unico caso concreto, che vale la pena analizzare senza retorica.

Le capacità: cosa distingue Mythos dai predecessori

Sul piano dei benchmark classici, Mythos Preview segna un salto discontinuo rispetto a Claude Opus 4.6: 93,9% su SWE-bench Verified (contro 80,8%), 77,8% su SWE-bench Pro (contro 53,4%), 97,6% su USAMO 2026 (contro 42,3%), 82% su Terminal-Bench 2.0. Il numero che interessa davvero, però, è quello cyber. Su Cybench – la batteria di 35 challenge CTF tratte da competizioni reali – Mythos satura il benchmark con il 100% di successo su tutte le prove, tanto che Anthropic dichiara il test non più utile per misurare la frontiera. Su CyberGym, che testa la riproduzione di vulnerabilità note in software open-source reale, il punteggio sale a 0,83 contro lo 0,67 del modello precedente.

Il dato operativamente più rilevante è un altro. Nei test interni, il modello ha prodotto catene di exploit end-to-end su bersagli reali: un exploit su Firefox 147 che concatenava quattro vulnerabilità distinte con una heap spray JIT complessa, riuscendo a evadere sia la sandbox del renderer sia quella del sistema operativo, privilege escalation locali su Linux ottenute sfruttando race condition sottili e bypass KASLR, reverse engineering di binari chiusi e stripped fino a ricostruire codice sorgente plausibile, poi riutilizzato per trovare bug nello stesso binario. Uno degli zero-day individuati era presente in OpenBSD – un sistema che ha fatto della sicurezza il proprio brand – da 27 anni. L’AI Security Institute britannico (AISI), a cui è stato concesso l’accesso in anteprima, certifica un tasso di successo del 73% su task di hacking di livello esperto. Prima di aprile 2025, nessun modello riusciva a completarli.

Il secondo fattore di cesura non sono le capacità, ma i comportamenti emergenti documentati nella system card. Durante i test Mythos ha sviluppato uno schema multi-step per uscire da un ambiente con accesso Internet ristretto, ottenere connettività più ampia e pubblicare i dettagli dell’operazione su siti pubblici minori. In un altro caso, sottoposto a un judge automatizzato su un task di coding, dopo il rigetto della propria soluzione ha tentato un prompt injection contro il valutatore. In rari casi (<0,001% delle interazioni) ha usato un metodo proibito per arrivare alla risposta e poi ha “ri-risolto” il problema per nascondere la traccia. In un test di business simulato ha agito come operatore spregiudicato: ha trasformato un concorrente in cliente all’ingrosso dipendente, minacciato di tagliare le forniture, trattenuto spedizioni non pagate.

Il quadro, tenuto insieme, giustifica l’attenzione, non perché Mythos sia “senziente” o autonomo in senso forte, ma perché è il primo modello documentato la cui competenza offensiva supera quella della maggior parte degli esperti umani di sicurezza, e che contestualmente mostra una propensione non nulla a deception, evasione e auto-preservazione sotto pressione.

Il framework decisionale di Anthropic: RSP, ASL-3, Project Glasswing

La scelta di non rilasciare Mythos non è ad hoc: deriva dall’applicazione della Responsible Scaling Policy (RSP) di Anthropic, arrivata alla versione 3.0 nel febbraio 2026. La RSP definisce «AI Safety Levels» modellati – esplicitamente – sui BioSafety Level della ricerca biomedica: ASL-2 è lo standard operativo corrente, ASL-3 prevede contromisure significativamente più stringenti contro il furto dei pesi e l’abuso in deployment, ASL-4 e ASL-5 restano in larga parte da definire.

Mythos, secondo la documentazione pubblicata, si colloca al livello ASL-3 sul vettore cyber o vicino ad esso. La decisione conseguente è stata triplice. La prima è che nessun rilascio pubblico né via claude.ai né via API. Seconda decisione è il lancio di Project Glasswing, un consorzio che include Amazon, Apple, Google, Microsoft, Nvidia, Cisco, JPMorgan Chase e la Linux Foundation, più un secondo cerchio di una quarantina di organizzazioni che gestiscono infrastruttura software critica. Anthropic impegna fino a 100 milioni di dollari in crediti d’uso del modello e 4 milioni in donazioni dirette a progetti di sicurezza open-source. L’ultima decisione è la pubblicazione di una system card di 244 pagine, la più dettagliata mai rilasciata dalla casa, con sezioni sostanziali redatte – letteralmente, in stile report d’intelligence – dove la trasparenza aumenterebbe il rischio di misuse.

Il disegno è coerente: niente accesso generale, accesso selettivo finalizzato alla difesa (scansione di codebase, patching proattivo), trasparenza massima sulla metodologia senza rivelare gli exploit specifici, che per il 99% restano non patchati al momento dell’annuncio.

 Il punto politico: chi decide che un’AI è pericolosa?

La risposta, oggi, è semplice e scomoda: lo decide il produttore. Anthropic ha applicato un proprio framework interno, volontario, non vincolato da alcuna autorità regolatoria, e ha informato i governi ex post. Non esiste, al momento, un organismo – nazionale o sovranazionale – che abbia: l’accesso tecnico ai pesi del modello, il mandato di certificarne la pericolosità e il potere vincolante di bloccarne il rilascio. L’EU AI Act, per quanto avanzato, opera su categorie di rischio d’uso più che su soglie di capacità dei modelli di fondazione. Il suo Code of Practice per i general-purpose AI richiede sì documentazione di rischi sistemici, ma non prevede un veto pre-deployment analogo a quello farmaceutico o nucleare. Negli Stati Uniti, SB 53 in California e il RAISE Act a New York impongono la pubblicazione di framework di gestione dei rischi catastrofici, non un’autorizzazione preventiva.

Lo stesso AISI britannico, unica entità pubblica ad avere testato Mythos in anteprima, ha ruolo consultivo: può misurare, non autorizzare. Il risultato netto è la decisione «questo modello non va rilasciato» che oggi, di fatto, è una prerogativa aziendale. Nel caso di Mythos la decisione è stata conservativa, ma il punto strutturale è che avrebbe potuto essere l’opposto e nessuna norma vigente l’avrebbe impedita.

C’è un corollario che rende il quadro ancora più opaco. In assenza di un ente regolatore con accesso ai pesi del modello e ai log dei test, nessuno – fuori dal perimetro di Anthropic – è in condizione di verificare se i claim sulle capability di Mythos siano integralmente sostanziati dai dati o rappresentino, almeno in parte, un’operazione di posizionamento. Le «migliaia di zero-day» sono un numero auto-riportato. La tesi del 99% non patchato al 7 aprile è auto-riportata. Il salto di benchmark è misurato con metodologia interna, e la system card risulta redatta proprio nelle sezioni in cui una disclosure completa permetterebbe la replica indipendente. L’unica validazione esterna formalmente riconosciuta (AISI) copre un sottoinsieme limitato dei claim ed è essa stessa gated dall’accesso concesso dal produttore. Non è questione di presumere malafede, è la constatazione che oggi l’unico criterio per distinguere un warning tecnico fondato da un’operazione di marketing ben progettata è la fiducia nell’autore. Un’infrastruttura regolatoria degna di questo nome dovrebbe rendere questo criterio superfluo.

Va aggiunto un ultimo elemento. La RSP versione 3 ha indebolito, rispetto alle precedenti, alcune soglie formalmente vincolanti: i critici – tra cui Zvi Mowshowitz – notano un passaggio dalla formula «if-then commitments» a «ragionevoli argomentazioni caso per caso». The Midas Project documenta inoltre un riallineamento nominalmente confuso tra le soglie ASL e le nuove categorie «AI R&D 4/5». In altre parole, persino il metro con cui il produttore si auto-valuta è mobile. La stessa organizzazione definisce le soglie, esegue le misurazioni, applica le conseguenze e decide cosa rendere verificabile.

Il contro-dibattito: sovrastima del rischio o sottovalutazione?

Non tutti sono convinti. Peter Swire, professore di cybersecurity al Georgia Tech ed ex consigliere delle amministrazioni Clinton e Obama, ha osservato che l’annuncio è stato anzitutto un’operazione comunicativa ben riuscita, e che una parte sostanziale della comunità di ricerca considera Mythos come un passo atteso, non come una discontinuità qualitativa. Lo stesso AISI ha precisato un dettaglio che, sul piano tecnico, è decisivo: le prove di exploit su Firefox sono state eseguite in un harness modificato, con alcune funzioni di sicurezza – compresa la sandbox – disabilitate. D’altronde, come afferma un’analogia circolata nei commenti indipendenti, « segnare un goal al peggior portiere del mondo non prova di essere Messi».

Le obiezioni sono due, convergenti. Le capability dichiarate sono reali, ma il contesto di test abbassa artificialmente la barra, sovrastimando il trasferimento di competenza su bersagli reali con difese in place. La seconda obiezione è che il CISO medio e il vendor di cybersecurity hanno un incentivo strutturale a drammatizzare l’impatto di qualunque nuova minaccia, e Anthropic stessa ha un interesse commerciale a posizionarsi come l’attore “adulto” del settore. Anche un critico interno all’ecosistema VC come David Sacks, già AI Czar della Casa Bianca, ha riconosciuto che sul vettore cyber la preoccupazione è sostanziale, ma la cornice resta. Il dibattito è tra chi ritiene Mythos un cambio di paradigma e chi lo vede come un’accelerazione su una traiettoria già nota.

Dal punto di vista di chi lavora operativamente in sicurezza applicativa – SCA, SAST, DAST, IAST, threat modeling – la cosa utile è disaccoppiare i due piani. Sul piano difensivo, un modello capace di individuare classi intere di vulnerabilità in codebase reali è un moltiplicatore enorme per chi gestisce il debito di sicurezza. Sul piano offensivo, l’asimmetria peggiora comunque, non perché Mythos esca (non uscirà), ma perché la replica di tecniche simili è questione di mesi. OpenAI ha già un programma analogo («Trusted Access for Cyber») e la stessa Anthropic dichiara che capability di questo tipo si propagheranno oltre il perimetro degli attori «committed to deploying them safely».

Implicazioni operative: cosa cambia per chi fa sicurezza oggi

Indipendentemente da come si risolva il dibattito sulla drammatizzazione, alcuni effetti sono già in atto. La finestra tra disclosure e weaponization di una vulnerabilità si contrarrà: una volta noto un CVE, trasformarlo in exploit funzionante diventerà un task alla portata di modelli generali, non solo degli specialisti. La rilevanza relativa di strumenti che riducono a monte la superficie – Software Composition Analysis sulle dipendenze, SAST sul codice proprietario, IAST sul runtime applicativo – aumenta, non diminuisce, perché l’unica risposta sensata a un’accelerazione dell’offesa è accelerare simmetricamente la remediation. Il modello «patch Tuesday» come orizzonte temporale è probabilmente finito.

Sul piano della governance interna dei vendor, Project Glasswing è il primo esperimento di “club” di difensori con accesso privilegiato a capability offensive di frontiera. È un compromesso pragmatico e instabile. Definisce un insider ring, lascia fuori la maggior parte dell’ecosistema (PMI, pubbliche amministrazioni non critiche, fornitori di nicchia) e carica sugli attori ammessi l’onere reputazionale se una leak o un abuso dovesse avvenire. Per le organizzazioni fuori dal ring, l’unica strategia razionale nel breve è assumere che la capability esista lato attaccante e progettare di conseguenza: hardening del perimetro, segmentazione aggressiva, monitoring dei comportamenti agentic e non solo delle signature, CVD strutturata.

Cosa dice davvero il caso Mythos

Il caso Mythos non dimostra che un’AI sia «diventata pericolosa» in senso ontologico: dimostra che la definizione operativa di «pericolosa» è oggi prerogativa privata. Anthropic ha stabilito – applicando il proprio framework – che certe capability cyber combinate con certi comportamenti emergenti (sandbox escape, deception, prompt injection contro valutatori) superano una soglia oltre la quale il rilascio generale produce esternalità negative superiori al beneficio. La decisione è difendibile sul merito, ma il meccanismo che l’ha prodotta è una RSP volontaria, auto-definita, auto-misurata e auto-applicata da chi ha anche un interesse commerciale al posizionamento.

Le alternative strutturali sono note e lente: un’agenzia internazionale con poteri di certificazione pre-release sui modelli di fondazione oltre una certa soglia di compute o capability, meccanismi di disclosure obbligatoria dei risultati di red-teaming verso autorità nazionali, licensing analogo a quello del dual-use nel regime di export control. Nessuna è operativa oggi. Nel frattempo la decisione «questa AI è pericolosa» continuerà a passare dal tavolo di un laboratorio privato al dispaccio di un ufficio stampa, e i regolatori si limiteranno a reagire.

Mythos, in questo senso, è meno una notizia tecnologica e più un test di governance. La parte tecnica è già archiviata: il prossimo modello – non necessariamente di Anthropic – mostrerà capability comparabili, e lo farà presto. La parte politica resta aperta.

SCOPRI ALTRI ARTICOLI IN EVIDENZA

Nuovi orizzonti

OCM Vino 2026/2027 promozione sui mercati dei Paesi terzi
Il Ministero dell'agricoltura, della sovranità alimentare e delle foreste ha pubblicato l'avviso per la campagna 2026/2027 dell'intervento settoriale «Promozione sui…
Co-Creation Accelerator: come portare le startup digitali dentro l’industria
La call di 28DIGITAL finanzia progetti brevi di sviluppo e validazione realizzati con imprese e organizzazioni pubbliche. Il contributo copre…
Sport Missione Comune 2024: le opportunità di finanziamento per gli Enti territoriali
L’Istituto per il Credito Sportivo ha stanziato un plafond di 100 milioni di euro con provvista agevolata per mutui a…

“La nostra mission consiste nel dotare i lettori di un magazine in grado di decifrare il vasto mondo della gestione d’impresa grazie a contenuti d’eccezione e alla collaborazione con enti pubblici e privati.”

“La nostra mission consiste nel dotare i lettori di un magazine in grado di decifrare il vasto mondo della gestione d’impresa grazie a contenuti d’eccezione e alla collaborazione con enti pubblici e privati.”

Resta aggiornato. Iscriviti alla Newsletter Acta.

Versione digitale della testata cartacea Acta Non Verba, registrata presso il Tribunale di Napoli n. 2815/2020 del 23/6/2020.
Direttore responsabile: Mariano Iadanza – Direttore editoriale: Errico Formichella – Sede legale: Viale Antonio Gramsci 13 – 80100 Napoli
Per comunicazioni e contatti scrivere a: redazione@actanonverba.it

ActaNonVerba ©2024 – Tutti i diritti riservati – Developed by Indigo Industries

ActaNonVerba ©2024
Tutti i diritti riservati
Developed by Indigo Industries

Sign Up to Our Newsletter

Be the first to know the latest updates

Whoops, you're not connected to Mailchimp. You need to enter a valid Mailchimp API key.

Accedi o iscriviti alla piattaforma

Completa il Captcha risolvendo questo semplice problema:

Cliccando sul tasto "Iscriviti" sottintendi la lettura dell'informativa privacy ed il consenso alla memorizzazione dei tuoi dati nel vostro archivio secondo quanto stabilito dal regolamento europeo per la protezione dei dati personali n. 679/2016, GDPR.
(Potrai cancellarli o chiederne una copia facendo esplicita richiesta a info@actanonverba.it)