OpenAI prepara ChatGPT e Codex a una modifica che, almeno nell’Unione Europea, toccherà direttamente il testo generato: le risposte prodotte avvalendosi dei modelli generativi addestrati dall’azienda guidata da Sam Altman conterranno un watermark invisibile, un segnale statistico inserito nelle scelte dei token e rilevabile da uno strumento che conosce il metodo usato per produrlo.
La società ha presentato la tecnologia il 5 ottobre 2026 con il nome di textGrain, collegandone esplicitamente l’introduzione agli obblighi di trasparenza dell’AI Act europeo.
Non c’entrano nulla né i metadati né l’aggiunta di caratteri speciali nel testo: il meccanismo interviene durante la generazione del testo, intervenendo sulle probabilità con cui il modello sceglie determinate termini, con cui proseguire ogni singola frase. Nell’articolo sull’intelligenza artificiale spiegata facile abbiamo chiarito i meccanismi che portano a individuare i token più pertinenti per la generazione dei testi.
Perché l’AI Act spinge verso testi riconoscibili dalle macchine
L’obbligo europeo (articolo 50, paragrafo 2) impone ai fornitori di sistemi generativi di predisporre output machine-readable, rilevabili come artificialmente generati o manipolati. Le soluzioni devono risultare efficaci, interoperabili, robuste e affidabili per quanto tecnicamente possibile, tenendo conto delle caratteristiche del mezzo e dello stato dell’arte.
Esistono inoltre alcune eccezioni. L’AI Act esclude, per esempio, alcune funzioni di modifica assistita che non alterano sostanzialmente i dati forniti dall’utente o il loro significato. Sul versante degli editori, l’articolo 50 distingue poi il problema tecnico della marcatura dall’obbligo di dichiarazione relativo ai testi destinati a informare il pubblico su materie di interesse pubblico; quest’ultimo può non applicarsi quando il contenuto passa attraverso revisione umana o controllo editoriale e una persona fisica o giuridica assume la responsabilità editoriale.
La Commissione Europea ha accompagnato le norme con un “Codice di buone pratiche sulla trasparenza dei contenuti generati dall’AI“.
Per i sistemi immessi sul mercato prima del 2 agosto 2026 è inoltre prevista una fase transitoria: l’adeguamento all’articolo 50, paragrafo 2, deve avvenire entro il 2 dicembre 2026.
La tecnologia OpenAI textGrain non inserisce caratteri nascosti nel testo
I tecnici di OpenAI chiariscono che non esiste una sequenza segreta di spazi, caratteri Unicode invisibili o metadati che possa sparire facendo copia e incolla.
Il watermark aggiunto al testo scaturisce, come raccontato in precedenza, durante il campionamento dei token. Il modello linguistico calcola, a ogni passo, una distribuzione di probabilità sui token (leggasi “parole”) da usare per proseguire il testo generato. La tecnologia textGrain modifica in modo controllato il processo di scelta introducendo una dipendenza da valori pseudocasuali ottenuti tramite una chiave segreta.
Come conferma il rapporto tecnico di textGrain, il sistema cerca di creare una correlazione riconoscibile tra i token scelti e una sequenza pseudocasuale nota al verificatore, senza allontanarsi troppo dalla distribuzione che il modello avrebbe usato normalmente.
Forzare sistematicamente la comparsa nel testo di un ventaglio di parole renderebbe il watermark facile da individuare, ma rischierebbe anche di peggiorare le risposte e di renderle meno varie. Se invece il sistema lasciasse completamente invariato il campionamento, non resterebbe alcun segnale da rilevare. textGrain lavora “nella terra di mezzo” e assegna un vero e proprio budget alla “quantità di casualità” che può sacrificare.
È un approccio simile alla soluzione scelta da Anthropic per l’aggiunta di un watermark o filigrana ai testi generati con Claude AI.
Come fa il rilevatore a capire che il watermark textGrain è presente nel testo
La fase di verifica ricostruisce, a partire dal testo osservato, la stessa struttura pseudocasuale utilizzata durante la generazione.
Servono il tokenizer corretto, i parametri relativi ai blocchi, la regola che definisce la finestra di token e soprattutto la chiave segreta. Il meccanismo di rilevazione non deve conoscere il prompt originale, il modello che ha prodotto la risposta o il budget di entropia applicato in ciascuna specifica generazione.
Per ogni posizione analizzabile, il verificatore produce un punteggio collegato; i punteggi si accumulano e il valore ottenuto è poi confrontato con una soglia scelta in funzione del tasso di falsi positivi auspicato.
Il modello matematico, tuttavia, non garantisce lo stesso comportamento con ogni chiave, ogni applicazione e ogni implementazione numerica: un watermark statistico, insomma, non diventa una firma crittografica solo perché dispone di una chiave.
I numeri pubblicati da OpenAI mostrano bene i limiti del rilevamento. Impostando un tasso di falsi positivi obiettivo dell’1%, il verificatore riconosce il watermark in circa l’80% dei passaggi da 200 token appartenenti a contenuti come quelli relativi al tema della psicologia. Salendo a 400 token, il tasso arriva a circa il 95%. Nei testi matematici le prestazioni risultano sensibilmente inferiori, perché la libertà nella scelta delle parole diminuisce.
Basta modificare parte del testo per indebolire drasticamente il segnale
Il problema più serio emerge con l’editing: nei test effettuati su porzioni di testo da 400 token scritte in inglese, OpenAI registra una probabilità di rilevamento vicina al 92% sul testo originario. Sostituendo soltanto il 10% delle parole con sinonimi, il valore scende intorno al 66%; con una sostituzione del 25% precipita al 17%.
Riscrittura manuale, traduzione, parafrasi o interventi editoriali possono alterare proprio le scelte lessicali sulle quali poggia il segnale statistico. Né OpenAI né nessun altro fornitore di modelli generativi può presentare un eventuale rilevatore come oracolo capace di stabilire l’origine di qualsiasi testo.
Per la stessa ragione, l’assenza di watermark non dimostra che un testo provenga da una persona in carne ed ossa: potrebbe trattarsi di una testo troppo breve, di un testo modificato o tradotto, di un modello non coperto dal sistema, di contenuto prodotto prima dell’attivazione del watermark o semplicemente di un altro servizio AI.
Un risultato positivo non dice chi ha scritto davvero il contenuto
OpenAI insiste su un punto che avrà conseguenze pratiche soprattutto a scuola, nelle aziende e nel mondo editoriale.
La rilevazione del watermark, della filigrana o della firma textGrain – che dir si voglia – indica soltanto che il passaggio conserva un segnale compatibile con una generazione o elaborazione effettuata attraverso un sistema OpenAI; non quantifica il contributo umano.
Un autore potrebbe aver scritto personalmente metà del documento e usato ChatGPT per rifinire alcune sezioni; potrebbe avere ottenuto una prima bozza e averla revisionata con grande attenzione, oppure aver pubblicato l’output quasi senza interventi. Il watermark non distingue questi casi. Non attribuisce neppure il testo a un account, a una persona, a un’organizzazione, a uno specifico prompt o a una conversazione.
Non stabilisce inoltre proprietà intellettuale, liceità, responsabilità editoriale o correttezza fattuale.
Rilevare il segnale non significa dimostrare che un contenuto sia falso, copiato o utilizzato impropriamente. L’avevamo già osservato nel caso del sistema congegnato da Anthropic: confondere provenienza tecnica e giudizio sul contenuto sarebbe del tutto squalificante.
Perché OpenAI non rende subito pubblico il detector di textGrain
OpenAI accetterà richieste di accesso da ricercatori e organizzazioni con competenze specifiche, valutandole caso per caso.
La scelta nasce soprattutto dal rischio di falsi positivi e falsi negativi: un rilevatore aperto a chiunque potrebbe trasformarsi (a torto!) in uno strumento disciplinare o probatorio usato oltre ciò che i suoi margini statistici consentono.
Non solo. Un verificatore interrogabile senza limiti può facilitare tentativi iterativi di rimozione del watermark. Un utente potrebbe modificare il testo, verificarlo, ritoccarlo ancora e ripetere il processo finché il segnale non scompare.
L’impressione è che i fornitori di modelli AI commerciali stiano facendo le corse per adeguarsi alle prescrizioni contenute nell’AI Act europeo ma non torna comodo a nessuno “sbandierare” in qualche modo se un testo sia prodotto (o non lo sia!) con un modello generativo…
AI Act e watermark nei testi: l’Europa chiede certezze che la tecnologia non può ancora garantire
Alla fine l’AI Act impone una serie di obblighi di trasparenza e responsabilizzazione che, in alcuni punti, si scontrano con limiti tecnici che il legislatore può aver valutato in modo più ottimistico di quanto consentano oggi le tecnologie disponibili.
Il caso del watermark testuale è emblematico. L’articolo 50 dell’AI Act richiede che determinati contenuti generati dall’AI risultino identificabili in formato leggibile dalle macchine, con soluzioni efficaci, interoperabili, robuste e affidabili per quanto tecnicamente possibile. Il problema è che per il testo queste quattro proprietà sono difficili da ottenere simultaneamente. E come abbiamo visto, anche le filigrane aggiunte nelle immagini generate con l’AI non è che stiano tanto meglio…
Come OpenAI sembra dichiarare rispetto alla sua tecnologia textGrain, il watermark sul testo non è affatto una firma indelebile: la modifica statistica nella scelta dei token funziona bene soprattutto su testi abbastanza lunghi e poco manipolati.
La legge europea parte da un obiettivo ragionevole – permettere di riconoscere contenuti artificiali – ma il testo è un mezzo estremamente “fragile” dal punto di vista della provenienza. Inoltre, il confine tra “testo generato dall’AI” e “testo umano” sta diventando meno netto di quanto presupponga una norma basata sulla provenienza.
La Commissione ha dovuto pubblicare linee guida specifiche a luglio 2026 proprio per rendere più chiaro l’ambito applicativo.
4 limiti tecnici che Bruxelles rischia di sottovalutare
Dove può esserci stata una sottovalutazione nell’approvazione di una normativa come l’AI Act?
- Asimmetria fra generazione e trasformazione. Il provider controlla il testo nel momento in cui lo genera, ma perde praticamente ogni controllo appena l’utente ne assume il controllo. Una semplice riscrittura con un secondo modello può distruggere il segnale del primo.
- Interoperabilità. Un mondo in cui OpenAI usa textGrain, altri provider impiegano watermark differenti e modelli open source non applicano necessariamente nulla rischia di produrre una collezione di sistemi incompatibili anziché un metodo universale di provenienza.
- Falsi positivi. Anche percentuali apparentemente piccole diventano problematiche quando il verificatore fosse utilizzato su milioni di documenti o in situazioni ad alto impatto. Anche un sistema con l’1% di falsi positivi non può essere trattato come una prova individuale.
- Origine tecnica e autorialità. La presenza di un watermark nel testo non risponde alla domanda che spesso interessa davvero alle persone: “chi ha scritto questo testo?”. Dice soltanto che una parte sufficientemente ampia del testo presenta caratteristiche compatibili con una determinata procedura di generazione.
C’è inoltre un rischio di incentivi perversi. Più il legislatore rende obbligatorio un watermark, maggiore diventa l’interesse economico a costruire strumenti che lo eliminano.
Se bastano una parafrasi o una traduzione per attenuarlo, gli utenti che vogliono occultare l’origine possono farlo relativamente facilmente, mentre quelli che usano normalmente il sistema rimangono marcati. Si potrebbe quindi ottenere una situazione quasi rovesciata: i contenuti prodotti in buona fede restano riconoscibili, quelli deliberatamente manipolati no.
La formula del “per quanto tecnicamente possibile”
L’AI Act usa più volte formule come “per quanto tecnicamente possibile” e la Commissione sta affidandosi a linee guida e codici di buone pratiche proprio perché alcune prescrizioni necessitano di adattamento tecnico.
La vera criticità non sembra essere l’obiettivo della normativa, ma l’aspettativa che una marcatura tecnica possa risolvere un problema che è in gran parte sociale ed editoriale.
Provenienza, responsabilità e attendibilità sono tre cose differenti: sapere che ChatGPT o un qualsiasi altro modello generativo ha contribuito a produrre un testo può essere utile; non dice però se quel testo sia corretto, manipolatorio, originale, autorizzato o responsabile.
Davvero abbiamo bisogno di watermark che mettano alla gogna chi affianca alla propria professionalità strumenti che aiutano a ottimizzare testi, a proporre punti di vista diversi, ad approfondire, a fornire spunti? Non è forse più importante capire se il testo sia autorevole, risponda a esigenze concrete, sia utile, fornisca risposte, risulti informativo/formativo e contenga valore? Non è forse il principio EEAT (Experience, Expertise, Authoritativeness, Trustworthiness) che dovrebbe fungere da faro guida?