Vi sarà oramai capitato più volte di leggere un testo online e chiedervi: "ma se fosse stato scritto con l'AI?". Tranquilli, non siete i soli. Con il miglioramento repentino della qualità di scrittura dei Large Language Models (LLM) e la loro capacità di adattarsi a stili di scrittura molto diversi tra loro, il dubbio che ad aver scritto l'ultimo articolo del vostro giornale o blog preferito non sia stato l'autore citato ma Claude o ChatGPT non è solo legittimo, ma inevitabile. E vi anticipo che almeno fino ad oggi questo dubbio è destinato a rimaner tale, con buona pace dell'amico che con sicurezza serafica dichiara di saper riconoscere la "firma dell'AI" già dalla prima riga di testo.

Ma come faccio a dirlo? In questo articolo parliamo della tecnica attualmente più in auge per riconoscere testi scritti con l'AI: il watermarking, e del perchè quest'ultima non ci dia ancora sufficienti sicurezze.

Che cos'è un watermark?

Un watermark (letteralmente: "filigrana") è una firma inserita all'interno di un file. Può essere visibile o invisibile e serve ad attestarne la provenienza o, nel nostro caso, se è stato o meno generato dall'AI. Se consideriamo il caso di un'immagine, è facile immaginare di inserire una firma invisibile al suo interno, ad esempio cambiando leggermente la tonalità di alcuni pixel seguendo un pattern impercettibile per l'uomo, ma riconoscibile da un computer.

Nel caso di un testo scritto, però, questo processo non è così immediato. In questo caso gli unici mezzi che abbiamo a disposizione per inserirvi una firma sono i caratteri del testo stesso. Possiamo immaginare di inserire una firma scritta, ma un autore che ha utilizzato un LLM per scrivere il suo testo potrebbe semplicemente rimuoverla prima di pubblicarlo. Altre tecniche prevedono invece l'inserimento di spazi o caratteri invisibili, ma anche in questo caso rimuoverli è un processo facilmente automatizzabile per un computer.

Dunque, che fare?

Il soft watermarking

Dei ricercatori hanno introdotto la tecnica del "soft watermarking" per ovviare al problema del riconoscimento dei testi scritti dall'AI (Kirchenbauer et al. 2023). In particolare questa permette agli LLM che la implementano di inserire un watermark invisibile nel testo che producono, permettendo di conseguenza alla piattaforma su cui quel testo verrà pubblicato di verificare velocemente e accuratamente se sia stato o meno generato dall'AI.

Per spiegarne il funzionamento dobbiamo fare un breve passo indietro: come sappiamo gli LLM compongono le loro risposte per step, parola per parola, scegliendo ogni volta come continuazione di quello che hanno già scritto una tra le parole con più alta probabilità rispetto ai dati che hanno visto durante l'addestramento. Perchè non scegliere sempre la parola con probabilità più alta? Perchè così facendo ad una stessa domanda ripetuta corrisponderebbe la stessa identica risposta, e questo non è sempre quello che vogliamo. Ci precluderemmo risposte più inaspettate ma comunque corrette, come una soluzione più "creativa" ad un problema o un'email di risposta un po' meno passivo-aggressiva per il nostro capo.

Il soft watermarking funziona suddividendo il vocabolario (la lista di tutte le parole a disposizione dell'LLM per continuare la propria risposta) in parole "verdi" e "rosse". Questa suddivisione è pseudo-casuale, ovvero può essere ripetuta identicamente se si ha a disposizione lo stesso codice ("chiave") utilizzato per effettuarla la prima volta. Ad ogni step le parole contrassegnate come verdi o rosse cambiano a seconda della chiave e della parola precedente. Il watermarking avviene dunque forzando l'LLM a dare priorità, tra le parole con probabilità più alta, a quelle che in quel determinato step sono verdi per comporre le proprie risposte. La piattaforma che riceve il testo potrà dunque utilizzare la chiave e il testo stesso per verificare, parola per parola, quali fossero quelle verdi e quelle rosse al momento della generazione. Se conterà una grande maggioranza di parole verdi allora quel testo verrà segnalato come scritto dall'AI, altrimenti come senza watermark (o scritto da un umano). Secondo i test effettuati dagli autori, grazie a questa tecnica si è in grado di riconoscere un testo scritto dall'AI nel 99.8% dei casi.

Niente di paragonabile all'amico citato in introduzione, ma comunque un ottimo risultato.

Problema risolto, no?

Differenza in termini di parole "verdi" e "rosse" tra un testo prodotto da un LLM con sistema di soft watermarking e uno senza. (Kirchenbauer et al. 2023)
Differenza in termini di parole "verdi" e "rosse" tra un testo prodotto da un LLM con sistema di soft watermarking e uno senza. (Kirchenbauer et al. 2023)

Come aggirare un watermark

Beh... no. Per applicare questa tecnica è necessario che gli LLM che generano il testo la implementino, e mentre è possibile regolamentare i maggiori provider (Anthropic, OpenAI, Google...) per obbligarli ad aggiungere nei loro modelli un sistema di watermarking, questo non è possibile nei cosiddetti modelli open-weight, ovvero modelli (generalmente meno potenti) che è possibile scaricare sul proprio computer e su cui è possibile effettuare modifiche a piacimento, compresa la rimozione di un eventuale sistema di watermarking.

Un secondo problema riguarda la possibilità di aggirare la verifica della presenza di watermark effettuando una parafrasi del testo. Ipotizziamo che un autore voglia scrivere un articolo utilizzando ChatGPT in quanto più comodo e potente rispetto ad un modello open-weight. Egli potrà dunque utilizzare un secondo modello più piccolo e veloce per effettuare una parafrasi della risposta. Il sistema di verifica del watermark individuerà dunque un numero di parole "verdi" minore del previsto e finirà per classificare il testo come scritto da un umano, anche se interamente scritto dall'AI.

I lettori più attenti potrebbero qui sollevare un'obiezione: per definizione una parafrasi non è uguale al testo originale, questa potrebbe infatti perdere di qualità o presentare degli errori. Vero, è la stessa obiezione sollevata da Sadasivan et al. 2025: i ricercatori in questione hanno misurato la qualità delle risposte parafrasate secondo diverse metriche e osservato come questa non venisse degradata significativamente. Ad esempio sottoponendo ad un LLM una domanda di cui conoscevano a priori la risposta corretta e un contesto con le informazioni necessarie a rispondere, parafrasato però dall'AI. Hanno osservato come nel 97% dei casi l'LLM riusciva comunque a dare la risposta corretta, dimostrando come l'informazione contestuale venisse preservata anche dopo la parafrasi.

Sembra dunque che aggirare la dicitura "scritto con AI" sia ancora troppo semplice, ma è veramente un problema?

Perchè ci importa così tanto?

È una domanda legittima, c'è chi crede infatti che scrivere non significhi necessariamente battere su tastiera ma raccogliere fonti, combinarle e ricombinarle, produrre diverse bozze per poi finalmente scegliere la versione definitiva. Ricorda qualcosa? Chiunque abbia scritto un testo con l'AI riconosce questo pattern, si potrebbe dunque concludere che tra lo scrivere a mano e lo scrivere con un LLM la differenza non sia così importante e che un sistema di rilevazione dei contenuti scritti con AI non sia necessario. Per altri invece la scrittura "a mano" andrebbe preservata in ogni contesto e credono che qualsiasi testo scritto con l'AI non meriti di essere letto, pretendendo dunque totale trasparenza.

Per quanto mi riguarda dipende dalla finalità per la quale leggo un determinato testo: se il mio interesse sono solo le informazioni al suo interno (come nel caso di un articolo di giornale, un paper scientifico o la ricetta della pasta con le sarde), allora non mi importa che sia stato scritto dall'AI fintantochè non leggo "finocchio da insalata" invece che "finocchietto selvatico". Assumiamo invece che io stia leggendo un romanzo, un racconto o una poesia. In questo caso non vedo perchè dovrei continuare a leggere qualcosa che l'autore non ha scritto. "Perchè non te ne accorgeresti", direbbe qualcuno, ed ha ragione. Ecco perchè credo che in alcuni contesti sia importante poter riconoscere un testo scritto dall'AI e che continuare la ricerca in questa direzione possa essere utile.

Ora qualcuno di voi si sarà chiesto: "E questo articolo?". Posso rispondervi che no, non è scritto dall'AI, e che almeno per ora non potrete far altro che fidarvi di me...

Pasta con le sarde alla palermitana (mi raccomando, usate il finocchietto selvatico)
Pasta con le sarde alla palermitana (mi raccomando, usate il finocchietto selvatico)