Di Filippo Carpenedo, Università degli Studi di Trieste

VIDEO

Introduzione editoriale

Ciò che non si delega è la domanda

Nel marzo 2024 una rivista scientifica pubblicò un articolo che si apriva con una frase rimasta lì per errore: «Certainly, here is a possible introduction for your topic». Il caso fece il giro del mondo, e da allora il dibattito sull’intelligenza artificiale nella ricerca gira attorno a episodi di quel genere — citazioni inventate, testi generati e non riletti, revisioni superficiali.

Filippo Carpenedo comincia da lì per dire che stiamo guardando nella direzione sbagliata.

Quei casi, osserva, sono precisamente i casi che il sistema intercetta. Sono goffi, riconoscibili, correggibili. Concentrarsi su di essi significa scambiare per il problema la sua manifestazione più visibile e meno insidiosa. Il cambiamento vero avviene altrove: negli articoli che superano la revisione a pieni voti. Delegare le fasi euristiche di una ricerca — la formulazione della domanda, l’individuazione di ciò che merita di essere studiato — non produce cattiva ricerca. Produce lavori ineccepibili.

È una tesi che ha il pregio raro di essere insieme controintuitiva e verificabile, e il saggio la verifica.

Il passaggio tecnicamente più prezioso è quello in cui l’autore distingue fra la modellazione statistica del linguaggio e l’allineamento alle preferenze umane. Non è la prima a produrre omologazione: è il secondo. Uno studio sperimentale mostra che la diversità delle idee cala quando si usa il modello ottimizzato per compiacere, non quello grezzo. Da cui la frase più tagliente dell’articolo: chiedere a un sistema così fatto quale sia la posizione più difendibile su una questione contesa equivale a chiedergli quale posizione approverebbe un revisore competente e poco coraggioso. E, prima ancora, l’osservazione che dentro una distribuzione statistica una tesi originale e un errore hanno la stessa firma — sono entrambi, semplicemente, improbabili.

A sostegno c’è un dato che merita di essere conosciuto. Uno studio uscito su Nature nel gennaio 2026, condotto su oltre quaranta milioni di articoli, mostra che chi adotta strumenti di intelligenza artificiale pubblica tre volte di più, riceve quasi cinque volte più citazioni e arriva a guidare progetti con oltre un anno di anticipo. Nello stesso movimento, però, l’insieme dei temi studiati si contrae e gli scienziati si citano e si leggono reciprocamente di meno. Il vantaggio è individuale, il costo è collettivo — e Carpenedo è scrupoloso nel delimitare ciò che quel dato dimostra e ciò che non dimostra.

Ma il capitolo che riguarda più da vicino chi legge questa rivista è il quinto, e vale il saggio intero.

Contro l’idea che la stesura di un testo sia una fase esecutiva e quindi delegabile, l’autore mostra che separare la concezione dalla scrittura è un lusso che solo una competenza già formata può permettersi. Per un ricercatore maturo, mettere per iscritto un pensiero già strutturato è in larga parte esecuzione. Per uno studente, la scrittura è il luogo in cui il pensiero si forma — ed è il fallimento della frase il primo segnale che si riceve del fallimento del pensiero. Un generatore fluente sopprime quel segnale, e lascia intatta la patologia sotto.

Ne discende una conseguenza che facciamo nostra: ogni politica sull’intelligenza artificiale nella ricerca è, prima di tutto, una politica della formazione.

Il saggio contiene poi una sezione che chi ama la filosofia leggerà due volte. Carpenedo rilegge il Discorso sulla servitù volontaria di La Boétie — la domanda non è perché un tiranno opprima, ma perché tanti obbediscano senza esservi costretti — e affronta l’obiezione ovvia: qui il tiranno non c’è. La risposta è più forte dell’obiezione. Con Lefort, il potere moderno funziona come luogo vuoto, un posto strutturale che nessuno occupa e che proprio per questo continua a organizzare l’obbedienza. Qui quel posto è occupato dalla distribuzione statistica stessa, dal consenso mediano che nessun attore controlla e che ciascuno, delegando, contribuisce a riprodurre. L’analogia non è più debole perché manca il tiranno: è più forte, perché il meccanismo che descrive non ne ha bisogno.

E la conseguenza generazionale, che è la frase che resta: la prima generazione che delega sa di delegare. La seconda avrà semplicemente imparato che la ricerca si fa così.

Va detto, infine, ciò che di rado si può dire di un saggio: che si attacca da solo. Due volte l’autore solleva contro la propria tesi l’obiezione più scomoda, e in un caso confessa apertamente di non essere del tutto convinto della propria risposta. È l’onestà argomentativa di cui il dibattito su questi temi ha più bisogno, e in un articolo che parla di non-delegare il pensiero non è un dettaglio di stile: è coerenza.

Fra le contromisure che il saggio propone ne segnaliamo una, perché ci riguarda da vicino. Contro la contrazione degli oggetti di ricerca, Carpenedo indica il valore strategico di ciò su cui i modelli sono più poveri: l’archivio non digitalizzato, la lingua minore, la fonte non indicizzata. E richiama la Convenzione di Faro e le comunità patrimoniali. È il riferimento fondativo del lavoro di questa Associazione da dieci anni, e l’autore ci arriva per una ragione strategica e non affettiva — che è il modo migliore di arrivarci.

Carmine Marinucci


ABSTRACT (ITALIANO)

Del rapporto tra intelligenza artificiale e ricerca accademica si continua a parlare guardando ai casi patologici (citazioni inventate, la formula di apertura del chatbot dimenticata nel testo pubblicato), cioè a ciò che i controlli già intercettano da soli. Qui si sostiene che il cambiamento vero avvenga altrove: negli articoli che superano la revisione senza far storcere il naso a nessuno. I modelli linguistici lavorano bene, benissimo anzi, dentro i confini di quella che Kuhn chiamava scienza normale; sono tarati sulla distribuzione di ciò che è già stato scritto, e non hanno alcun criterio per stabilire se un problema che nessuno ha ancora posto meriti di esserlo. Delegare le fasi euristiche della ricerca non produce, quindi, lavori scadenti: produce lavori ineccepibili. Il danno non è imputabile a nessun autore in particolare, perché ciascuno ottiene, individualmente, un risultato migliore di quello che avrebbe ottenuto da solo; si vede solo su scala aggregata, come restringimento dei temi che un campo disciplinare arriva a considerare. Il saggio ripercorre l’evidenza empirica disponibile, discute il rapporto tra fase concettuale e fase redazionale, mostrando che separarle è un lusso che solo la competenza già formata può permettersi, e propone di spostare la discussione dal piano dell’etica individuale a quello del disegno istituzionale.

Parole chiave: intelligenza artificiale generativa, delega, monocultura epistemica, posizione del problema, ricerca, politiche della ricerca

ABSTRACT (ENGLISH)

Most of the debate on artificial intelligence in academic research still circles around the pathological cases (fabricated citations, a stray line of chatbot boilerplate left in a published paper), the kind of thing existing controls already catch on their own. This paper argues that the real shift is happening somewhere else: in the manuscripts that sail through peer review without raising an eyebrow. Large language models are very good, within the bounds of what Kuhn called normal science, at working from a distribution of what has already been written; what they lack is any criterion for judging whether a question nobody has yet asked deserves to be asked. Delegating the heuristic stages of research does not, then, produce bad work: it produces flawless work. No single author can be blamed for the harm this does, since each of them individually ends up with a better paper than they would have written alone; the cost only shows up in aggregate, as a narrowing of the questions a field allows itself to ask. Drawing on the available empirical evidence, the paper examines the relationship between conceiving a piece of research and writing it up, arguing that treating the two as separable is a privilege of expertise already acquired, and proposes shifting the response from individual ethics to institutional design.

Keywords: generative artificial intelligence, delegation, epistemic monoculture, problem finding, research, research policy

 

I. Introduzione: il caso che non ha fatto scalpore

Nel marzo 2024 la rivista Surfaces and Interfaces, edita da Elsevier, ha pubblicato un articolo sulla struttura porosa di un separatore per batterie al litio la cui introduzione comincia così: «Certainly, here is a possible introduction for your topic». Nessuno, in redazione, se n’è accorto prima della pubblicazione. È il tipo di episodio che negli ultimi anni ha avuto una fortuna sproporzionata rispetto alla sua importanza reale: articoli con la formula con cui un chatbot introduce la propria risposta rimasta per distrazione nel testo, bibliografie con riferimenti plausibili e inesistenti scovati da qualche revisore abbastanza paziente da controllarli uno per uno. Il materiale, ormai, non manca.

Questi episodi dimostrano una cosa sola: che qualcuno ha spacciato per proprio un testo che non aveva letto. È una condotta scorretta, e nemmeno particolarmente nuova, dato che la fabbricazione di fonti e la firma di lavori altrui esistevano molto prima dei modelli generativi. Sono anche, va detto, episodi che il sistema ha intercettato (l’articolo su Surfaces and Interfaces è rimasto per mesi sotto gli occhi di tutti proprio perché a intercettarlo, alla fine, sono stati i lettori e non i revisori, il che dice qualcosa sulla tenuta dei controlli più che sul loro fallimento). Concentrare il dibattito su questo materiale significa scambiare per il problema la sua manifestazione più visibile, e probabilmente la meno insidiosa.

La tesi di questo saggio è che la trasformazione epistemica in corso avvenga altrove, in una zona dove nessuno la sta cercando: negli articoli che superano la revisione a pieni voti. Delegare a un modello linguistico le fasi euristiche della ricerca non produce, di norma, cattiva ricerca. Produce lavori ineccepibili: metodologicamente corretti, aggiornati sulla bibliografia più recente, allineati allo stato dell’arte, difendibili in sede di valutazione. Ed è proprio questa correttezza il motivo per cui il fenomeno è così difficile da vedere.

L’argomentazione mostrerà anzitutto che i modelli linguistici sono ottimizzati su una distribuzione, e che dentro una distribuzione l’originalità e il rumore hanno la stessa firma statistica: a mancare non è la capacità di generare combinazioni inedite, ma un qualsiasi criterio per stabilire che un problema ancora non posto meriti di esserlo. Passerà poi all’evidenza empirica, che restituisce sempre la stessa configurazione: il vantaggio si accumula sul singolo, la perdita si distribuisce su un insieme che nessuno osserva. Da qui il punto pratico su cui il saggio si chiude: se nessun autore singolo è colpevole, il registro dell’etica individuale, in cui il dibattito pubblico si è quasi interamente rinchiuso, non ha gli strumenti per affrontare la questione.

II. Che cosa ottimizzano davvero i modelli

La critica filosofica ai sistemi generativi ha spesso preso una scorciatoia: la macchina non pensa e non comprende, accede solo alla correlazione tra segni, mai al significato. Probabilmente è vero, ma nel contesto che ci interessa è un’osservazione poco utile, perché la ricerca accademica non ha mai chiesto ai propri strumenti di pensare: un archivio non pensa, e nemmeno un indice analitico o un repertorio bibliografico, eppure nessuno di questi ha mai impoverito il sapere di qualcuno. La domanda giusta è un’altra: che cosa ottimizza, esattamente, il modello?

Un modello linguistico contemporaneo passa per almeno due fasi di addestramento, con obiettivi diversi. Nella prima impara a prevedere la continuazione più probabile di una sequenza, costruendosi così una rappresentazione statistica della lingua e, insieme, del corpus di tutto ciò che è stato scritto. Nella seconda viene orientato, con tecniche di allineamento alle preferenze umane, a produrre risposte che dei valutatori umani giudichino soddisfacenti. È questa seconda fase il cuore del problema.

C’è un dato sperimentale che lo mostra bene. Padmakumar e He, in uno studio controllato presentato a ICLR nel 2024, hanno fatto scrivere saggi argomentativi a tre gruppi: senza assistenza, con l’aiuto di un modello base, con l’aiuto di un modello ottimizzato sulle preferenze umane[1]. La diversità dei contenuti cala in modo statisticamente significativo solo nel terzo caso: non è la modellazione statistica del linguaggio a produrre omologazione, è l’ottimizzazione verso ciò che un valutatore mediano approva.

Si può allora dire la cosa con più precisione. Il modello sa generare combinazioni inedite, chiunque lo abbia usato con un minimo di inventiva se ne è accorto; quello che gli manca è un termine, nella sua funzione obiettivo, che corrisponda al valore dell’inedito in quanto tale, e la cosa più difficile da accettare, per chi lavora dentro un dipartimento e vede colleghi produrre più di prima con meno sforzo, è che questa mancanza non si manifesta come un errore riconoscibile, un’ipotesi sbagliata, una citazione fuori luogo, ma come l’assenza sistematica di un certo tipo di domanda, un’assenza che non lascia traccia perché non c’è mai stata una domanda da cancellare. Vista da dentro la distribuzione, una tesi originale e un errore sono indistinguibili: sono entrambi, semplicemente, improbabili. Il collasso avviene nella fase di valutazione, più che in quella di generazione. Chiedere a un sistema così fatto quale sia la posizione più difendibile su una questione contesa equivale a chiedergli quale posizione approverebbe un revisore competente e poco coraggioso, domanda perfettamente sensata e, dato l’attuale sistema di incentivi accademici, anche piuttosto conveniente.

C’è poi una versione estrema di questa dinamica, ormai ben documentata. Quando i modelli vengono addestrati su dati generati da altri modelli, la distribuzione degli output collassa progressivamente verso il centro e perde le code, cioè proprio dove stanno le informazioni rare, e dove nella ricerca sta tutto quello che vale la pena scoprire. Shumailov e colleghi hanno chiamato il fenomeno model collapse[2]. Riguarda l’addestramento, non l’uso quotidiano, ma la sua logica è la stessa che opera, su scala umana, quando un intero campo disciplinare comincia a interrogare lo stesso strumento.

III. Scienza normale e primato della domanda

Kuhn descriveva la scienza normale come un’attività di soluzione di rompicapi dentro un paradigma: lavoro tecnicamente esigente, cumulativo, necessario, definito dal fatto che i criteri di successo sono già dati in partenza[3]. È il paradigma a stabilire che cosa conti come problema e che cosa conti come soluzione accettabile; il ricercatore lavora dentro quel perimetro. La rivoluzione comincia quando qualcuno si accorge che una certa anomalia, fino a quel momento tollerata come residuo o come caso limite da sistemare, è in realtà il sintomo di una crisi del paradigma stesso.

Applicata al nostro oggetto, la distinzione illumina parecchio. Un modello linguistico lavora con un’efficienza notevole nel registro della scienza normale, il che non è un elogio: descrive semplicemente il suo terreno migliore. Dato un problema ben posto trova soluzioni pertinenti, e messo di fronte a una letteratura ne restituisce la struttura con una rapidità che nessun dottorando eguaglia; messo davanti a una tesi già formulata, sa anche elencarne le obiezioni canoniche, quelle che ricorrono in ogni manuale del settore. Quello che gli manca, per come è costruito l’obiettivo su cui è stato ottimizzato, è la capacità di riconoscere che una certa anomalia conta.

Conviene precisare subito la portata della tesi, che è più modesta di quanto potrebbe sembrare: non che l’intelligenza artificiale impedisca le rivoluzioni scientifiche, il che sarebbe difficile da sostenere e più difficile ancora da verificare, ma che intensifichi un tratto che la scienza normale possiede già per definizione, cioè la tendenza a trattare come rumore le anomalie che non rientrano nel rompicapo corrente, e lo faccia proprio mentre una quota crescente della produzione complessiva comincia a passare da quel filtro. Il punto di leva sta nel fatto che riconoscere un’anomalia è già un atto di posizione del problema, non di soluzione: la stessa capacità di cui le pagine seguenti mostrano la non delegabilità è quella che decide se una discrepanza venga notata oppure archiviata come residuo.

La psicologia della creatività ha un nome per questa capacità. Getzels e Csikszentmihalyi seguirono per anni un gruppo di studenti della School of the Art Institute di Chicago, dalla fase di formazione fino all’ingresso nella professione, e trovarono che il predittore più forte del rendimento creativo successivo non era la qualità della soluzione ma il comportamento di problem finding: il modo in cui lo studente esplorava il materiale prima di decidere cosa rappresentare, la disponibilità a riformulare il compito mentre lo eseguiva, la resistenza a chiudere troppo presto la definizione del problema[4]. Chi trattava il compito come un dato risolveva meglio nel breve periodo, ma produceva meno, sensibilmente meno, in quello lungo.

Polanyi aveva già detto qualcosa di simile in termini più rigorosi. Riconoscere un buon problema significa avvertire la presenza di qualcosa che ancora non si sa articolare, e chi intuisce la fecondità di una domanda sa qualcosa che non riesce a dire, quindi non può trasmetterlo sotto forma di istruzione[5]. La conoscenza tacita, in questa prospettiva, non è un residuo in attesa di essere prima o poi formalizzato: è la condizione che rende possibile qualunque formalizzazione.

Nell’ambito umanistico la questione si fa ancora più radicale. Collingwood proponeva che ogni proposizione sia comprensibile solo come risposta a una domanda, e che ricostruire la domanda a cui un testo risponde sia esattamente il lavoro dell’interpretazione[6]. Gadamer ha ripreso quella logica della domanda e della risposta fino a metterla al centro dell’esperienza ermeneutica: comprendere significa lasciarsi interrogare, e ciò che apre un orizzonte non è mai un’asserzione[7]. Vale per la filosofia. Vale, non diversamente, per la storiografia e per la critica letteraria: formulare la domanda giusta è già il contributo, mentre le risposte tendono a seguire con relativa docilità.

A questo punto si può dire con una certa precisione che cosa non sia delegabile. La soluzione lo è quasi sempre: il modello spesso la trova meglio e più in fretta di noi. Quello che sfugge alla delega è la decisione che una certa questione valga la pena di essere posta, e questa decisione resiste all’automazione per una ragione più semplice di quelle che di solito si tirano in ballo (coscienza, intenzionalità, comprensione: argomenti su cui è del tutto legittimo dissentire). «Vale la pena di essere posta» non è una proprietà che si legga dentro una distribuzione: è un giudizio che si forma stando dentro un campo, avendo interessi e riconoscendo cosa è in gioco, ma soprattutto accettando in anticipo il rischio concreto di sbagliare, di ritrovarsi fra qualche anno a scoprire che la domanda non era quella giusta.

C’è un’obiezione recente da considerare, e qui confesso di non essere del tutto convinto della mia stessa risposta. Alcuni studi hanno confrontato idee di ricerca generate da modelli linguistici con idee proposte da ricercatori esperti, trovando che le prime venivano giudicate mediamente più nuove, anche se meno praticabili[8]. La mia obiezione è che questo tipo di giudizio misura la novità percepita di ogni idea presa isolatamente, mentre qui si parla della distribuzione aggregata delle idee prodotte da una comunità che interroga lo stesso strumento, e che le due misure debbano coincidere non è affatto scontato: chi valuta alla cieca molte proposte in sequenza tende a scambiare per originale tutto ciò che si scosta dal linguaggio delle altre, effetto di contrasto locale, non necessariamente il tipo di novità di cui si sta discutendo in queste pagine. Resta il fatto che nessuno, per ora, ha misurato la seconda cosa direttamente, e finché non lo farà l’obiezione mantiene tutta la sua forza.

IV. L’ineccepibilità come sintomo

Nel gennaio 2026 «Nature» ha pubblicato uno studio di Hao, Xu, Li ed Evans che rappresenta, al momento, la base empirica più solida per discutere questo problema[9]. Gli autori hanno addestrato un modello a riconoscere l’uso di strumenti di intelligenza artificiale in 41,3 milioni di articoli scientifici pubblicati tra il 1980 e il 2025 nelle scienze naturali, validando l’identificazione contro etichette assegnate da esperti umani. I risultati che ne escono raccontano due storie opposte, ed è proprio nel tenerle insieme che sta la difficoltà del problema. Sul piano individuale non lasciano spazio a dubbi: i ricercatori che adottano strumenti di IA pubblicano 3,02 volte più articoli, ricevono 4,84 volte più citazioni, e arrivano a guidare progetti di ricerca con un anticipo medio di 1,37 anni rispetto a chi non li adotta[10]; chiunque conosca un po’ come funziona davvero una carriera accademica, i tempi dei concorsi, la pressione delle chiamate, il modo in cui un anno di anticipo può decidere chi ottiene una cattedra e chi resta assegnista a tempo indeterminato, riconoscerà in questi numeri qualcosa che va ben oltre il vantaggio competitivo e somiglia piuttosto a una condizione di sopravvivenza professionale. Sul piano collettivo, invece, i risultati vanno nella direzione opposta: l’adozione di IA è associata a una contrazione del 4,63% del volume complessivo dei temi studiati, a una riduzione del 22% dell’ingaggio reciproco tra scienziati, e la contrazione si osserva in oltre il 70% di più di duecento sottocampi esaminati; la ricerca assistita migra collettivamente verso le aree già più ricche di dati, e gli autori riassumono il quadro dicendo, in sostanza, che gli strumenti di IA sembrano automatizzare campi già consolidati più che esplorarne di nuovi.

Su questo studio conviene dire subito che cosa dimostra e che cosa no. Hao e colleghi misurano l’adozione di strumenti di intelligenza artificiale nel suo complesso, non il canale specifico descritto nelle due sezioni precedenti: la contrazione tematica che rilevano potrebbe in linea di principio derivare anche da un meccanismo puramente economico, per cui una maggiore producibilità spinge la ricerca verso le aree già ricche di dati senza bisogno di alcuna omogeneizzazione concettuale. L’argomento di queste pagine non ha bisogno di escludere quella spiegazione concorrente, e non pretende di averlo fatto. Gli basta mostrare che il meccanismo discusso finora è un canale distinto e operante, e la sua firma specifica, lavori corretti, aggiornati e difendibili ma non originali, è precisamente ciò che un resoconto solo economico non prevede: quello prevederebbe più produzione, non produzione ineccepibile. L’evidenza aggregata serve a stabilire che il fenomeno esiste, e alla scala giusta; sulla sua origine restano competenti le pagine precedenti.

Questa configurazione ricorre con una costanza quasi sistematica. Doshi e Hauser, su «Science Advances», hanno mostrato che l’accesso a idee generate da un modello rende i racconti prodotti individualmente più creativi, meglio scritti, più piacevoli da leggere, con il beneficio massimo per gli scrittori meno dotati, ma rende l’insieme dei racconti significativamente più simile a se stesso[11]. Padmakumar e He hanno documentato lo stesso profilo nella scrittura argomentativa. Moon, Green e Kushlev hanno trovato che i testi scritti da esseri umani contribuiscono alla diversità semantica collettiva molto più dei testi generati[12].

Messeri e Crockett avevano già anticipato l’impianto concettuale nel 2024, con due nozioni utili: la monocultura del conoscere, cioè la progressiva dominanza delle domande e dei metodi che si prestano al trattamento algoritmico a scapito di quelli che non vi si prestano, e l’illusione di ampiezza esplorativa, cioè la convinzione, falsa, di aver esplorato tutto lo spazio delle ipotesi verificabili, quando in realtà se n’è esplorato solo il sottoinsieme raggiungibile con lo strumento adottato[13]. Vale la pena di ricordare la loro sintesi: il rischio è una fase della ricerca in cui si produce di più e si capisce di meno.

Va aggiunta una cosa, che rende l’argomento più sobrio senza renderlo meno serio: il meccanismo precede l’intelligenza artificiale generativa. Già nel 2008 lo stesso Evans aveva documentato su «Science» che il passaggio alla pubblicazione elettronica, invece di allargare lo spettro delle fonti citate, lo aveva ristretto: l’accesso più facile aveva concentrato le citazioni su un numero minore di articoli, e su annate più recenti[14]. Una tecnologia che abbassa il costo di raggiungere il consenso tende, semplicemente, a produrre più consenso. I modelli generativi non hanno inventato niente di nuovo in questo: ne sono un’intensificazione di ordini di grandezza.

Da tutto questo discende la conseguenza decisiva, quella che riformula il problema morale invece di risolverlo. Ogni singolo ricercatore che delega ottiene un articolo migliore di quello che avrebbe scritto da solo. Non commette frode né fabbrica dati, e non firma il lavoro di altri: produce un contributo corretto e pertinente, il tipo di lavoro che si può citare senza remore, e ne trae un vantaggio reale, misurabile. La perdita non compare in nessuno dei suoi articoli; si manifesta solo nella distribuzione aggregata di ciò che un campo ha smesso di chiedersi, e resta invisibile tanto ai partecipanti quanto ai revisori che leggono un manoscritto alla volta.

È la struttura formale di una tragedia dei beni comuni, trasposta dal dominio delle risorse materiali a quello dei beni epistemici[15]. E le tragedie dei beni comuni hanno una proprietà nota fin troppo bene: sono sostanzialmente immuni agli appelli alla virtù individuale.

V. Il gradiente di delega e l’asimmetria formativa

Fin qui si è parlato della delega delle fasi euristiche: formulazione dell’ipotesi, selezione bibliografica, costruzione dei nessi, impostazione dell’indice. Resta da affrontare una posizione diffusa, e a prima vista ragionevole: che esisterebbe una fase successiva, la stesura, epistemicamente inerte e quindi delegabile senza costi, perché la scrittura accademica punterebbe alla trasparenza e non all’espressione stilistica.

La premessa è corretta. Il saggio scientifico non è letteratura: il registro è codificato, l’impersonalità è una convenzione ben più vecchia dell’intelligenza artificiale, e la standardizzazione della prosa accademica non è un danno che i modelli generativi abbiano inflitto a un giardino prima rigoglioso. Chiunque abbia letto abbastanza riviste di settore sa che l’omogeneità stilistica del genere è quasi totale. L’obiezione basata sulla perdita della cifra personale, in ambito accademico, è dunque piuttosto debole.

Il problema è che è l’obiezione sbagliata. Quella forte non riguarda lo stile ma la costitutività linguistica del pensiero, e ha tutt’altro peso filosofico.

Per Gadamer il comprendere avviene nel linguaggio: la Sprachlichkeit è il medium dell’esperienza ermeneutica, non il suo rivestimento aggiunto in un secondo momento[16].

Kleist lo aveva scritto già nel 1805, nelle pagine sull’elaborazione progressiva dei pensieri nel discorso, l’Über die allmähliche Verfertigung der Gedanken beim Reden che vale ancora oggi più di molta letteratura specialistica: si comincia a parlare non perché si sia già capito, ma per capire; l’idea prende forma nell’atto stesso in cui viene articolata[17].

Bereiter e Scardamalia hanno tradotto la stessa intuizione in termini empirici con il loro modello della composizione scritta, distinguendo il knowledge telling, la trascrizione di contenuti già disponibili, dal knowledge transforming, in cui la scrittura esperta modifica le conoscenze mentre le espone e i vincoli retorici retroagiscono sul contenuto costringendolo a riformularsi[18].

Se questo è vero anche solo in parte, il confine tra concepire e scrivere non è netto, e separare le due fasi smette di essere un dato di fatto per diventare un’operazione che si compie, e che ha un costo. Bisogna allora dire quale sia questo costo. La risposta non è né una condanna né un’assoluzione, ma il riconoscimento di un’asimmetria.

Per una mente già formata, un ricercatore che possiede già la tesi, la struttura del ragionamento, l’apparato, e che ha in testa il testo prima ancora di scriverlo, la stesura è in larga parte esecuzione. Non del tutto: qualcosa si perde sempre, e chi scrive sa bene che il paragrafo che non arriva è spesso il paragrafo che non tiene. Ma la perdita resta marginale, perché il lavoro di formazione del giudizio si è già compiuto altrove, in anni di letture, errori, revisioni[19]. Per uno studente la stessa operazione ha un significato completamente diverso, perché la stesura è proprio il luogo dove quella formazione avviene. È scrivendo che si scopre che un argomento non regge, ed è il fallimento della frase il primo segnale che si riceve del fallimento del pensiero. Un generatore fluente sopprime quel segnale, e lascia intatta la patologia sotto.

Questo è esattamente il punto che l’argomento tradizionale sulla responsabilità dell’autore non riesce a cogliere. È verissimo che se il ragionamento l’ha progettato l’essere umano, un’eventuale debolezza logica è imputabile a lui e non alla macchina che l’ha messa in prosa. Ma l’obiezione non riguarda l’imputazione, riguarda la rilevabilità: sapere di chi sia la colpa non aiuta a trovare l’errore. È una questione diagnostica, prima ancora che morale.

L’asimmetria formativa permette di riformulare la domanda che le comunità educanti si pongono. Non conviene chiedersi se l’intelligenza artificiale sia ammissibile nella ricerca, domanda mal posta a cui non esiste risposta sensata, ma in quale punto di un percorso formativo una data operazione diventi delegabile. Far scrivere a un modello un paragrafo di cui si possiede già la struttura è quasi innocuo a valle di una competenza acquisita, e distruttivo a monte. Ne segue che ogni politica sull’IA nella ricerca è, prima di tutto, una politica della formazione.

VI. Perché si delega comunque: una nota sull’abitudine

Resta da spiegare perché la delega si diffonda comunque, dato che nessuno la impone. Non esiste un’autorità che obblighi un ricercatore a far generare a un modello l’impostazione del proprio argomento; esiste semmai una diffusa riprovazione ufficiale nei confronti della pratica. Eppure i dati mostrano un’adozione in accelerazione costante.

Il Discorso sulla servitù volontaria di La Boétie offre, su questo, uno strumento più preciso di molta letteratura contemporanea sull’etica delle tecnologie. La domanda di La Boétie non è perché un tiranno opprima, ma perché tanti accettino di servirne uno solo senza esservi costretti, e la risposta chiama in causa l’abitudine più della paura[20]. Gli uomini nati sotto il giogo, allevati nella servitù, si accontentano di vivere come sono nati, e non concepiscono di avere altro diritto se non quello che hanno trovato. Il meccanismo è la naturalizzazione di una condizione attraverso la consuetudine.

C’è un punto su cui l’analogia sembra a prima vista cedere. Nel testo di La Boétie c’è un tiranno che dalla servitù altrui trae un beneficio diretto, mentre nel caso che ci occupa non si vede chi occupi quella posizione. L’obiezione, però, ha una risposta più precisa della semplice cautela metodologica, ed è stata elaborata proprio dai lettori novecenteschi del Discours. Lefort ha mostrato che il potere moderno funziona come luogo vuoto: un posto strutturale che nessun corpo particolare può più occupare, e che proprio per questo continua a organizzare l’obbedienza senza che nessuno debba incarnarlo. Clastres, dal canto suo, legge la servitù volontaria come una struttura possibile indipendentemente da un beneficiario designato, come rapporto costitutivo della socialità e non come effetto di una volontà che se ne avvantaggia. Nella situazione descritta in queste pagine la posizione lasciata vuota è occupata dalla distribuzione stessa, dal consenso mediano che nessun singolo attore controlla e che ciascuno, delegando, contribuisce a riprodurre. L’analogia non è dunque più debole del previsto perché manca il tiranno: è più forte, perché il meccanismo che descrive non ne ha bisogno.

Trasposto al nostro caso: la prima generazione di ricercatori che delega la fase euristica sa di star delegando, e può misurare quello a cui rinuncia, perché ha conosciuto un modo diverso di lavorare. La seconda non lo saprà più. Non sperimenterà nessuna perdita, perché non avrà termini di paragone: avrà semplicemente imparato che la ricerca si fa così. Ed è a quel punto che una scelta diventa una condizione, e che la contrazione dei temi disponibili smette di essere visibile anche a chi volesse osservarla.

VII. Che cosa fare: dal registro morale al disegno istituzionale

Se il danno è aggregato, e nessun autore singolo ne è responsabile, gli appelli alla responsabilità individuale, per quanto sinceri, sono destinati a restare inefficaci. Conviene spostare la risposta sul piano dove il problema si trova davvero: quello degli incentivi e delle procedure. Alcune direzioni sembrano praticabili.

La prima è dichiarare la fase, non l’uso. Le attuali politiche di trasparenza delle riviste, dal punto di vista epistemico, non valgono quasi niente: una formula come «l’IA è stata usata per l’editing linguistico» non distingue tra chi ha corretto la sintassi di un argomento proprio e chi l’argomento l’ha ricevuto direttamente dallo strumento. Servirebbe una tassonomia delle fasi, formulazione del problema, selezione bibliografica, impostazione argomentativa, stesura, revisione, traduzione, con la dichiarazione puntuale di quali siano state delegate. Il costo di implementazione è quasi nullo, il guadagno informativo notevole.

La seconda è rivedere il criterio della revisione tra pari. Un sistema di valutazione che premia la correttezza premia esattamente ciò che i modelli sanno fare meglio. Basterebbe aggiungere alla scheda del revisore una domanda esplicita, qualcosa come «quale questione apre questo lavoro?», per spostare il criterio dalla soluzione del problema alla sua posizione, cioè verso l’unica dimensione che non si può automatizzare. È una modifica minima, e potenzialmente decisiva.

La terza è proteggere la lentezza nella formazione. L’asimmetria descritta nel paragrafo V rende questo punto non negoziabile: se la stesura è il luogo dove si forma il giudizio, allora nella didattica universitaria e nella formazione dottorale la scrittura non assistita non è un esercizio di stile, è un dispositivo di apprendimento che non si può sostituire con nient’altro. Il che richiede di ripensare i formati di valutazione, più che di vietare strumenti che nessun divieto renderà comunque inaccessibili.

La quarta è finanziare in controtendenza. Se la ricerca assistita migra verso le aree ricche di dati, la politica scientifica dovrebbe finanziare deliberatamente quelle che ne sono povere, e sostenere la produzione di dati dove mancano. È la stessa conclusione a cui arrivano gli autori dello studio su «Nature»[21], con il pregio, non da poco, di essere una misura operativa e non un semplice auspicio.

La quinta, per le discipline umanistiche in particolare, è valorizzare ciò che il modello non possiede: l’archivio non digitalizzato, la lingua minore, la fonte non indicizzata, tutto il materiale che resiste alla quantificazione perché nessun corpus di addestramento lo contiene ancora. Non per nostalgia: per una ragione strategica precisa, è il terreno su cui i modelli sono più poveri, e quindi quello su cui il vantaggio comparativo della ricerca umana resta massimo. La Convenzione di Faro, e le pratiche delle comunità patrimoniali, indicano in questa direzione un percorso già tracciato[22].

VIII. Conclusioni

«Disarmare l’IA» nella ricerca non significa rifiutare lo strumento, e nemmeno regolarne l’uso sul piano della correttezza formale. Significa rifiutare la delega della domanda.

Il punto, in fondo, è semplice da dire e difficile da accettare. I modelli linguistici lavorano con un’efficienza eccezionale nel registro della scienza normale, e proprio per questo non producono ricerca scadente, ma lavori ineccepibili. Sono ottimizzati su una distribuzione di ciò che è già stato scritto e su un criterio di gradimento mediano, e non contengono alcun termine che corrisponda al valore di un problema non ancora posto. La delega delle fasi euristiche non degrada, quindi, la qualità dei singoli contributi: contrae, in aggregato, l’insieme delle domande che una comunità arriva a porsi, e lo fa in un modo che nessun partecipante può percepire dall’interno. La separazione tra fase concettuale e fase redazionale, che sembrerebbe mettere al riparo una zona di delega innocua, è reale ma asimmetrica: vale soprattutto per chi la competenza l’ha già formata, mentre per chi la sta ancora acquisendo il margine si restringe quasi a zero. E poiché nessun autore singolo è responsabile del danno complessivo, la risposta appartiene al disegno istituzionale più che all’esortazione morale.

La sfida che i documenti recenti del magistero e il dibattito pubblico pongono alle comunità educanti riguarda meno il fatto che le macchine scrivano, e più la possibilità che si smetta di chiedere. Una comunità di ricerca che delega la posizione dei propri problemi non diventa meno produttiva: diventa più produttiva, e via via meno capace di accorgersi di ciò che ha smesso di cercare. È una condizione comoda, il che spiega perché sia difficile abbandonarla: la difficoltà non dipende dalla debolezza di nessuno in particolare.

Riferimenti bibliografici

Bereiter, C., Scardamalia, M., The Psychology of Written Composition, Lawrence Erlbaum, Hillsdale (NJ) 1987.

Clastres, P., La società contro lo Stato. Ricerche di antropologia politica, tr. it. di L. Derla, Feltrinelli, Milano 1977 (ed. or. La Société contre l’État, Minuit, Paris 1974).

Clastres, P., Recherches d’anthropologie politique, Seuil, Paris 1980.

Collingwood, R. G., An Autobiography, Oxford University Press, Oxford 1939.

Consiglio d’Europa, Convenzione quadro sul valore dell’eredità culturale per la società, Faro, 27 ottobre 2005.

Doshi, A. R., Hauser, O. P., «Generative AI enhances individual creativity but reduces the collective diversity of novel content», Science Advances, 10, 28 (2024), eadn5290.

Evans, J. A., «Electronic Publication and the Narrowing of Science and Scholarship», Science, 321 (2008), pp. 395-399.

Gadamer, H.-G., Verità e metodo, tr. it. di G. Vattimo, Bompiani, Milano 1983 (ed. or. Wahrheit und Methode, Mohr, Tübingen 1960).

Getzels, J. W., Csikszentmihalyi, M., The Creative Vision: A Longitudinal Study of Problem Finding in Art, Wiley, New York 1976.

Hao, Q., Xu, F., Li, Y., Evans, J., «Artificial intelligence tools expand scientists’ impact but contract science’s focus», Nature, 649 (2026), pp. 1237-1243.

Hardin, G., «The Tragedy of the Commons», Science, 162 (1968), pp. 1243-1248.

Kleist, H. von, Sulla progressiva elaborazione dei pensieri nel discorso (1805-06), in Id., Opere, a cura di E. Bernard, Guanda, Parma 1998.

Kobak, D., González-Márquez, R., Horvát, E.-Á., Lause, J., «Delving into LLM-assisted writing in biomedical publications through excess vocabulary», Science Advances, 11 (2025), eadt3813.

Kuhn, T. S., La struttura delle rivoluzioni scientifiche, tr. it. di A. Carugo, Einaudi, Torino 1969 (ed. or. 1962).

La Boétie, É. de, Discorso sulla servitù volontaria, a cura di E. Donaggio, Feltrinelli, Milano 2014.

Lefort, C., Le forme della storia. Saggi di antropologia politica, tr. it. di B. Aledda e P. Montanari, Il Ponte, Bologna 2005 (ed. or. Les formes de l’histoire. Essais d’anthropologie politique, Gallimard, Paris 1978).

Lefort, C., Saggi sul politico. XIX e XX secolo, tr. it. di B. Magni, Il Ponte, Bologna 2007 (ed. or. Essais sur le politique. XIXᵉ-XXᵉ siècles, Seuil, Paris 1986).

Messeri, L., Crockett, M. J., «Artificial intelligence and illusions of understanding in scientific research», Nature, 627 (2024), pp. 49-58.

Moon, K., Green, A. E., Kushlev, K., «Homogenizing effect of large language models (LLMs) on creative diversity», Computers in Human Behavior: Artificial Humans, 2025.

Ostrom, E., Governare i beni collettivi, tr. it., Marsilio, Venezia 2006 (ed. or. 1990).

Padmakumar, V., He, H., «Does Writing with Language Models Reduce Content Diversity?», ICLR 2024, Vienna 2024.

Polanyi, M., La conoscenza personale, tr. it. di E. Riverso, Rusconi, Milano 1990 (ed. or. Personal Knowledge, Routledge and Kegan Paul, London 1958).

Polanyi, M., The Tacit Dimension, Doubleday, New York 1966.

Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R., Gal, Y., «AI models collapse when trained on recursively generated data», Nature, 631 (2024), pp. 755-759.

Si, C., Yang, D., Hashimoto, T., «Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers», ICLR 2025.

Nota biografica:


[1] V. Padmakumar, H. He, «Does Writing with Language Models Reduce Content Diversity?», in Proceedings of the Twelfth International Conference on Learning Representations (ICLR 2024), Vienna 2024. Lo studio confronta tre condizioni sperimentali: scrittura non assistita, assistenza di un modello base (GPT-3), assistenza di un modello ottimizzato sulle preferenze umane (InstructGPT). La riduzione statisticamente significativa della diversità lessicale e di contenuto emerge nella sola terza condizione.

[2] I. Shumailov, Z. Shumaylov, Y. Zhao, N. Papernot, R. Anderson, Y. Gal, «AI models collapse when trained on recursively generated data», Nature, 631 (2024), pp. 755-759.

[3] T. S. Kuhn, La struttura delle rivoluzioni scientifiche, tr. it. di A. Carugo, Einaudi, Torino 1969, in particolare i capitoli III-VI (ed. or. The Structure of Scientific Revolutions, University of Chicago Press, Chicago 1962).

[4] J. W. Getzels, M. Csikszentmihalyi, The Creative Vision: A Longitudinal Study of Problem Finding in Art, Wiley, New York 1976. Il campione era costituito da studenti della School of the Art Institute di Chicago, seguiti per un arco pluriennale; la misura del comportamento esplorativo in fase di impostazione del compito risultò più predittiva della valutazione tecnica dell’opera finita.

[5] M. Polanyi, La conoscenza personale. Verso una filosofia post-critica, tr. it. di E. Riverso, Rusconi, Milano 1990 (ed. or. Personal Knowledge, Routledge and Kegan Paul, London 1958); si veda anche Id., The Tacit Dimension, Doubleday, New York 1966, cap. I.

[6] R. G. Collingwood, An Autobiography, Oxford University Press, Oxford 1939, cap. V («Question and Answer»).

[7] H.-G. Gadamer, Verità e metodo, tr. it. di G. Vattimo, Bompiani, Milano 1983, parte II, sez. II, sul primato ermeneutico della domanda, e parte III sulla Sprachlichkeit (ed. or. Wahrheit und Methode, Mohr, Tübingen 1960).

[8] C. Si, D. Yang, T. Hashimoto, «Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers», in Proceedings of the Thirteenth International Conference on Learning Representations (ICLR 2025), 2025.

[9] Q. Hao, F. Xu, Y. Li, J. Evans, «Artificial intelligence tools expand scientists’ impact but contract science’s focus», Nature, 649 (2026), pp. 1237-1243. L’identificazione dell’uso di IA è stata condotta mediante un modello linguistico addestrato su titoli e abstract, con F1 pari a 0,875 in validazione contro etichettatura esperta.

[10] Ivi, pp. 1238-1240. Lo studio rileva inoltre una riduzione media di 1,33 unità nella dimensione dei gruppi di ricerca, concentrata sui ricercatori in formazione (-31,14%), e un rafforzamento dell’effetto Matteo nella distribuzione delle citazioni.

[11] A. R. Doshi, O. P. Hauser, «Generative AI enhances individual creativity but reduces the collective diversity of novel content», Science Advances, 10, 28 (2024), eadn5290.

[12] K. Moon, A. E. Green, K. Kushlev, «Homogenizing effect of large language models (LLMs) on creative diversity: an empirical comparison of human and ChatGPT writing», Computers in Human Behavior: Artificial Humans, 2025.

[13] L. Messeri, M. J. Crockett, «Artificial intelligence and illusions of understanding in scientific research», Nature, 627 (2024), pp. 49-58. Gli autori articolano quattro figure dell’uso dell’IA nella ricerca (Oracolo, Sostituto, Analista, Arbitro) e distinguono le monocolture del conoscere da quelle dei conoscenti.

[14] J. A. Evans, «Electronic Publication and the Narrowing of Science and Scholarship», Science, 321 (2008), pp. 395-399.

[15] G. Hardin, «The Tragedy of the Commons», Science, 162 (1968), pp. 1243-1248. Il modello va assunto qui nella sua struttura formale e non nelle conclusioni normative, ampiamente rivedute da E. Ostrom, Governare i beni collettivi, tr. it., Marsilio, Venezia 2006 (ed. or. Governing the Commons, Cambridge University Press, Cambridge 1990), che mostra come la gestione comunitaria delle risorse condivise sia storicamente ricorrente ed efficace a determinate condizioni istituzionali.

[16] Cfr. supra, nota 7.

[17] H. von Kleist, Sulla progressiva elaborazione dei pensieri nel discorso (1805-06), in Id., Opere, a cura di E. Bernard, Guanda, Parma 1998.

[18] C. Bereiter, M. Scardamalia, The Psychology of Written Composition, Lawrence Erlbaum, Hillsdale (NJ) 1987, in particolare i capitoli 1 e 5.

[19] Sulla diffusione effettiva della delega redazionale si veda D. Kobak, R. González-Márquez, E.-Á. Horvát, J. Lause, «Delving into LLM-assisted writing in biomedical publications through excess vocabulary», Science Advances, 11 (2025), eadt3813, che ricostruisce l’incidenza dell’assistenza generativa nella letteratura biomedica a partire dall’anomalia nella frequenza di specifici lemmi.

[20] É. de La Boétie, Discorso sulla servitù volontaria, a cura di E. Donaggio, Feltrinelli, Milano 2014; il passaggio sulla consuetudine come fondamento dell’obbedienza si legge nella seconda parte del testo. Sulla nozione di potere come luogo vuoto si veda C. Lefort, Saggi sul politico. XIX e XX secolo, tr. it. di B. Magni, Il Ponte, Bologna 2007 (ed. or. Essais sur le politique. XIXᵉ – XXᵉ siècles, Seuil, Paris 1986); per la fortuna novecentesca del Discours cfr. anche Id., Le forme della storia. Saggi di antropologia politica, tr. it. di B. Aledda e P. Montanari, Il Ponte, Bologna 2005, che raccoglie il saggio Le nom d’Un. Sulla servitù volontaria come struttura pensabile indipendentemente dalla figura del sovrano, P. Clastres, Liberté, malencontre, innommable, in Id., Recherches d’anthropologie politique, Seuil, Paris 1980.

[21] Cfr. supra, nota 9, p. 1242, dove gli autori indicano nella produzione deliberata di dati in domini attualmente poveri una misura correttiva praticabile.

[22] Consiglio d’Europa, Convenzione quadro sul valore dell’eredità culturale per la società, Faro, 27 ottobre 2005, ratificata dall’Italia con legge 1 ottobre 2020, n. 133; si vedano in particolare gli artt. 2 e 12 sulla definizione di comunità patrimoniale e sulla partecipazione.

Nota biografica:

Filippo Carpenedo ha conseguito la Laurea triennale in Lettere presso l’Università degli Studi di Udine, discutendo una tesi in Etica e Comunicazione sull’uso strumentale della verità attraverso il pensiero di Hannah Arendt. Attualmente prosegue gli studi nel corso di Laurea magistrale interateneo in Filosofia presso l’Università degli studi di Trieste e l’Università degli studi di Udine. Affianca al percorso accademico una ricerca indipendente focalizzata sulle implicazioni filosofiche e politiche delle nuove tecnologie: in particolare, si occupa del rapporto tra intelligenza artificiale e corporeità, dell’impiego dei sistemi di apprendimento profondo in ambito militare e strategico, e dei limiti epistemologici dei processi decisionali automatizzati. Collabora inoltre con diverse riviste online per la divulgazione di temi culturali e filosofici.