L’accuratezza dei rilevatori di deepfake scende fino al 49% in un anno di progressi dei video AI
Aggiornato il
Per anni la verifica di un video sospetto ha seguito una sequenza stabile: nasce il dubbio, un rilevatore automatico analizza il file, un punteggio chiude la questione. Quella sequenza non regge più. Riconoscere i video generati dall’IA è oggi quasi casuale: sul banco di prova DF26, pubblicato il 7 settembre 2026, la media di nove rilevatori allo stato dell’arte scende da 84,4 a 56,1 di AUROC, il migliore si ferma a 69,7 e le persone identificano i falsi nel 52,6% dei casi. Il rilevatore più colpito perde il 49% della propria accuratezza in un anno, scendendo da 94,3 a 48,2.
La scelta del rilevatore, a questo punto, conta meno della domanda a monte: ha ancora senso affidare a un’analisi successiva una decisione con conseguenze legali o assicurative? L’autenticità va fissata quando il contenuto nasce, perché ricostruirla dopo ha ormai un margine di errore vicino al caso.
Che cosa misura il banco di prova DF26, e perché i suoi numeri contano
Il banco di prova DF26 è un insieme di 2.691 video pubblicato il 7 settembre 2026 (arXiv:2609.07369) che misura quanto i rilevatori automatici riescano a distinguere un video reale da un video generato per intero. Comprende 271 video autentici, presi da OpenVid-1M, TalkingCelebs e MAVOS-DD, e 2.420 video sintetici prodotti da sette modelli generativi, tutti su tre scenari di parlato in pubblico. Il metodo rende confrontabili i risultati: da ogni video reale viene ricavato un prompt semantico e su quel prompt si generano le clip corrispondenti, così ogni coppia reale/falso condivide lo stesso contesto visivo. Nei video generati non compaiono filigrane visibili né marcatori di esportazione: nessun indizio esterno aiuta chi deve decidere.
Quattro dei sette modelli sono chiusi e accettano solo istruzioni testuali (text-to-video), tre sono aperti; l’Elo è la stima di Artificial Analysis ad agosto 2026.
| Modello | Sviluppatore | Uscita | Accesso | Elo |
|---|---|---|---|---|
| Wan 2.6 | Alibaba | dicembre 2025 | chiuso, text-to-video | 1.185 |
| Veo 3.1 | gennaio 2026 | chiuso, text-to-video | 1.213 | |
| Grok Imagine 1.0 | SpaceXAI | gennaio 2026 | chiuso, text-to-video | 1.221 |
| Kling 3.0 | KlingAI | febbraio 2026 | chiuso, text-to-video | 1.212 |
| Wan 2.2 A14B | Alibaba | luglio 2025 | aperto, anche immagine-video | 1.106 |
| HunyuanVideo 1.5 | Tencent | novembre 2025 | aperto, anche immagine-video | 1.016 |
| LTX 2.3 | Lightricks | marzo 2026 | aperto, anche immagine-video | 1.120 |
Nove rilevatori allo stato dell’arte, nessuno affidabile
Secondo il banco di prova DF26, il rilevatore che su CelebDF++ segnava 94,3 di AUROC crolla a 48,2 sui video generati dai modelli del 2026. L’AUROC misura la capacità di separare due classi: 100 è la separazione perfetta, 50 equivale a una risposta tirata a sorte. Il crollo non riguarda un caso isolato: la media dei nove sistemi valutati passa da 84,4 su CelebDF++ a 56,1 sul nuovo insieme, nessuno supera 69,7 e uno si ferma a 44,0, cioè sotto la soglia del caso. Tutti sono addestrati su FaceForensics++ e valutati senza riaddestramento, così il confronto misura il comportamento davanti a generatori mai visti, non la capacità di ripetere quanto già imparato. Cedono sia i rilevatori che esaminano il singolo fotogramma sia quelli che seguono la dinamica temporale: nessuna delle due famiglie offre un riparo.
| Rilevatore | Sede e anno | CelebDF++ | DF26 | Differenza |
|---|---|---|---|---|
| DFD-FCG | CVPR 2025 | 94,3 | 48,2 | meno 46,1 |
| PwTF-DVD | ICCV 2025 | 92,3 | 61,6 | meno 30,7 |
| GenD-PE | WACV 2026 | 89,9 | 69,7 | meno 20,2 |
| GenD-CLIP | WACV 2026 | 85,2 | 54,2 | meno 31,0 |
| GenD-DINO | WACV 2026 | 82,6 | 54,7 | meno 27,9 |
| DFD-HR | CVPR 2026 | 81,6 | 63,5 | meno 18,1 |
| FSFM | CVPR 2025 | 79,6 | 52,6 | meno 27,0 |
| Effort | ICML 2025 | 78,7 | 44,0 | meno 34,7 |
| ForAda | CVPR 2025 | 75,6 | 56,6 | meno 19,0 |
Le medie nascondono il punto più serio: su Grok Imagine 1.0 il rilevatore Effort scende a 13,6 e DFD-FCG a 20,5. Lette generatore per generatore, le macro-medie si distendono fra il 72,7 di GenD-PE e il 40,9 di Effort. Un’analisi video AI che regge su un generatore e finisce sotto la soglia del caso su quello dopo è imprevedibile prima ancora che imprecisa, e l’imprevedibilità sposta la domanda su chi risponde del margine di errore.
Non è un incidente di settembre: la curva scende da due anni
Il calo non nasce nel 2026. Deepfake-Eval-2024 (arXiv:2503.02857, CVPRW 2026) aveva già misurato la stessa direzione su 45 ore di video, 56,5 ore di audio e 1.975 immagini raccolte nel 2024 da 88 siti in 52 lingue, tutti contenuti realmente circolati in rete: rispetto ai banchi di prova precedenti, l’AUC dei rilevatori aperti cala del 50% sul video, del 48% sull’audio e del 45% sull’immagine. Chi valuta oggi un sistema di verifica video AI si muove in un mercato in cui il risultato dichiarato e quello sul materiale reale divergono da due anni, come segnalava lo studio di Edimburgo sulle impronte dei modelli.
Perché riconoscere i video generati dall’IA è diventato difficile: il problema ha cambiato natura
A differenza dei video deepfake tradizionali, i contenuti video generativi del 2026 non manipolano un volto reale. I nove rilevatori sono addestrati su FaceForensics++ (ICCV 2019), costruito su manipolazioni di volti autentici: scambio di volto, rianimazione facciale, modifica di attributi. Cercano quindi la discontinuità fra la parte autentica di un fotogramma e quella alterata, cioè la cucitura fra due materiali diversi. Nei video del banco di prova DF26 quella cucitura non esiste, perché l’intera scena viene generata da zero a partire da un’istruzione testuale. Gli autori chiamano il fenomeno scostamento di distribuzione fra i modelli generativi, e una verifica interna allo studio conferma che il crollo dipende dal generatore, non dallo scenario ripreso.
Il riaddestramento funziona, e proprio per questo è istruttivo: su GenD-PE riaddestrato sul sottoinsieme di HunyuanVideo la media sale da 76,0 a 82,3, con Grok Imagine da 66,5 a 96,8. Il guadagno però arriva un generatore per volta, e solo dopo che quel generatore è uscito. Spostare la certezza a monte è l’approccio delle piattaforme di data authenticity come TrueScreen, e la ragione per cui il rilevamento non regge come strategia.
L’occhio umano non è la riserva
Il controllo umano non compensa il divario. Nello studio condotto sul banco di prova DF26, 232 sessioni di etichettatura su studenti volontari hanno prodotto un’accuratezza del 52,6% sui video falsi; ciascuno ha giudicato 30 video da 5 secondi, rivedibili al massimo dieci volte.
| Insieme di video | Accuratezza sui reali | Accuratezza sui falsi |
|---|---|---|
| DF26 | 76,0% | 52,6% |
| CelebDF++ | 75,5% | 74,5% |
| DeepSpeak v2 | 72,8% | 69,8% |
Sui video autentici le persone rendono allo stesso modo ovunque, segno che il crollo non dipende dalla stanchezza. C’è poi un numero letto di rado: il 24,0% dei video reali del banco di prova DF26 è stato scambiato per falso. Credere a un video fake è solo metà del danno; l’altra metà è smettere di credere a un video vero, e ricade su chi deve difendere una documentazione autentica.
Il campione non c’entra: Diel e colleghi, su 56 studi e 86.155 partecipanti, misurano un’accuratezza media del 55,54% con intervallo di confidenza al 95% fra 48,87% e 62,10% (doi:10.1016/j.chbr.2024.100538): l’intervallo attraversa il 50%, e una prestazione simile non si distingue dal caso.
Se il dubbio non si risolve dopo, va reso inutile prima
Piattaforme come TrueScreen, la Data Authenticity Platform, affrontano il problema in direzione opposta: invece di analizzare un video dopo che è circolato, ne fissano l’autenticità nel momento in cui viene acquisito. È il principio di provenienza digitale e standard C2PA, portato dentro la cattura anziché applicato al file che ne esce.
Che cosa significa certificare l’autenticità di un video alla fonte
L’autenticità di un video si stabilisce nel momento in cui il video nasce, non ricostruendola a posteriori. Certificare alla fonte significa fissare tre elementi nell’istante della cattura: l’integrità del contenuto, il tempo e le condizioni in cui è stato prodotto. Le organizzazioni che devono sostenere un video in sede assicurativa o giudiziale usano TrueScreen per acquisirlo in ambiente forense, con integrità, marca temporale conforme a RFC 3161 e coordinate di acquisizione, anche tramite acquisizione forense da app, e con il sigillo di QTSP qualificati terzi integrato via API. Dove il migliore dei nove rilevatori si ferma a 69,7 di AUROC e le persone riconoscono i falsi nel 52,6% dei casi, un contenuto certificato alla fonte non richiede una stima di probabilità, perché porta con sé la documentazione di quando e come è nato.
Le marcature dichiarate aiutano, ma da sole non bastano. TrueScreen supporta lo standard C2PA, legge le altre marcature presenti nel file, dal campo IPTC digitalSourceType ai tag del generatore in EXIF e XMP, e aggiunge una metodologia forense che documenta le condizioni in cui il dato è nato. Un file privo di Content Credentials non è per questo sospetto, perché le marcature si perdono a ogni ricompressione; nei video del banco di prova DF26, del resto, non compare alcuna filigrana visibile.
Il caso di un perito che documenta un danno da grandine su un capannone lo mostra bene: se il video nasce già certificato, la controparte non può aprire il dibattito sulla sua genuinità, perché non è un reperto da analizzare ma un atto da verificare. L’onere si rovescia, e non tocca più all’assicurazione dimostrare che il video è falso: per questo certificare un video con valore legale e il diritto all’autenticità come prova positiva del vero sono lo stesso problema visto da due lati.
Lo studio ha confini dichiarati: il banco di prova DF26 contiene 2.691 video, una scala contenuta, e valuta la sola modalità visiva, senza audio né sincronia labiale. Gli autori non arrivano a dire che il rilevamento sia inutile in assoluto; dicono che i rilevatori valutati non reggono davanti a generatori mai visti.
Domande frequenti
Quanto sono accurati oggi i sistemi che riconoscono i video generati dall’IA?
Cosa distingue un video generato dall’IA da un video manipolato?
L’occhio umano riesce ancora a distinguere un video generato dall’IA?
Come si scopre la provenienza di un video?
Come si certifica un video perché non sia contestabile?
Fissa l’autenticità quando il dato nasce
Con TrueScreen, la Data Authenticity Platform, origine, integrità e tempo di una ripresa vengono registrati nel momento stesso in cui viene prodotta. La prova non va ricostruita dopo: esiste già.
Redazione TrueScreen
Questa sezione è curata dalla redazione di TrueScreen, che riunisce competenze di informatica forense, diritto delle prove digitali e conformità normativa. Ogni contenuto è verificato sulle fonti primarie: testi di legge, sentenze pubblicate, norme tecniche e documentazione ufficiale, sempre citate nel corpo del testo.
