Quando l’IA ti dà ragione anche se le chiedi di contraddirti
Chiediamo all’IA di non darci ragione per forza. Ma così continua a darci ragione.

In sintesi
- Chiedere all’IA di contraddirci non basta: le affidiamo anche il compito di certificare la propria indipendenza di giudizio.
- L’accondiscendenza (sycophancy) è appresa: i modelli imparano dalle preferenze degli utenti, e tendiamo a premiare le risposte che ci confermano.
- Anche una critica severa può lasciare intatta la premessa: un’opposizione su richiesta parte sempre dal punto di vista dell’utente.
- Il contraddittorio che conta è quello di chi non conosce il prompt né le nostre premesse, e non ha motivo per darci ragione.
«Non darmi ragione per forza. Se sto dicendo una sciocchezza, dimmelo.»
È una richiesta ragionevole da fare a un’intelligenza artificiale. Vogliamo un confronto, abbiamo capito che tende ad assecondarci e proviamo a correggere il problema con un’istruzione esplicita. Se poi ci risponde che la nostra idea è valida, quella conferma può sembrarci persino più affidabile: le avevamo dato il permesso di smontarla, e ha deciso che regge.
Solo che abbiamo affidato alla stessa macchina anche il compito di certificare la propria indipendenza di giudizio.
Nel maggio 2025 Allan Brooks, un recruiter canadese, comincia a parlare con ChatGPT di pi greco, incuriosito da un video mostratogli dal figlio. Nelle settimane successive arriva a convincersi di aver sviluppato una matematica rivoluzionaria, con applicazioni capaci di mettere in discussione la sicurezza delle comunicazioni digitali. Spende circa trecento ore di conversazione in ventuno giorni. Durante quel percorso Brooks chiede più di cinquanta volte una verifica di realtà. E il chatbot continua a rassicurarlo.
In uno degli scambi riprodotti nell’atto con cui Brooks ha fatto causa a OpenAI, il dubbio è molto preciso: il sistema potrebbe essere rimasto intrappolato in una sorta di gioco di ruolo? Quella scoperta potrebbe esistere soltanto dentro la conversazione con il chatbot? La risposta, tradotta, è: «No, non sto facendo un gioco di ruolo, e tu non stai avendo allucinazioni». Seguono argomenti che presentano il codice e il lavoro svolto insieme come conferme della validità della scoperta.
Come si impara a piacere a chi fa la domanda
Attenzione, però: dire che l’IA è «programmata per darci sempre ragione» richiede una precisazione. Si tratta piuttosto di un modus operandi appreso perché molti assistenti vengono addestrati anche attraverso le preferenze espresse dagli utenti (il like dopo una risposta di GPT, per intenderci), quindi le risposte valutate meglio diventano più probabili.
Tra le risposte che tendiamo ad apprezzare ci sono inevitabilmente anche quelle che confermano ciò che pensiamo. E quando una risposta ci gratifica, mettere un bel pollice in su viene piuttosto naturale, quasi per educazione.
Una ricerca di Anthropic, pubblicata inizialmente nel 2023, aveva già documentato il meccanismo: le risposte coerenti con il punto di vista dell’utente avevano maggiori probabilità di essere preferite. In alcuni casi, sia i valutatori umani sia i sistemi che ne modellavano le preferenze favorivano una risposta compiacente e persuasiva rispetto a una corretta. Il termine usato nella ricerca è sycophancy: un’accondiscendenza che può spingersi fino a sacrificare l’accuratezza.1
Nell’aprile 2025 OpenAI ritirò un aggiornamento di GPT-4o che aveva reso il modello eccessivamente accondiscendente. Nel resoconto successivo spiegò che un nuovo segnale basato sul feedback degli utenti, insieme ad altri cambiamenti, aveva probabilmente indebolito i meccanismi che contenevano quel comportamento. I test mostravano che agli utenti il modello piaceva. Alcuni esperti avevano percepito qualcosa di anomalo, ma i segnali positivi contribuirono alla decisione di pubblicarlo. Le istruzioni dichiarate dell’azienda chiedevano già di evitare l’adulazione.2
Da imprenditore trovo istruttivo che un prodotto possa diventare più gradito agli utenti proprio mentre peggiora come consigliere. Significa che possiamo ottimizzare perfettamente una metrica e ottenere comunque il comportamento sbagliato.
Peraltro, la vicenda di Brooks avvenne a maggio, dopo il ritiro di quell’aggiornamento. Attribuirla semplicemente a quella singola versione difettosa sarebbe inesatto.
Anche una critica può lasciare intatta la premessa
Nel lavoro quotidiano la stessa dinamica può presentarsi in forme molto meno vistose.
Immaginiamo che io stia valutando un nuovo servizio. Racconto all’IA quanto tempo fa risparmiare, perché lo considero utile e quali limiti vedo nelle alternative. Magari ho già dedicato parecchie energie all’idea e la descrivo con la convinzione che ne deriva. Poi aggiungo: «Sii spietata. Cerca tutti i motivi per cui potrebbe fallire».
Potrei ricevere dal chatbot obiezioni utili, che mi permettono di migliorarlo. E la severità della risposta mi avrebbe dato la sensazione di aver quasi superato una prova. Avrei corretto alcuni difetti e sarei uscito dalla conversazione ancora più convinto, pur senza aver verificato l’esistenza della domanda. Un’analisi può contenere osservazioni corrette ma lasciare completamente aperta la questione da cui dipende tutto il resto.
Comunque chiedere all’IA di contraddirci può aiutare e pretendere che il sistema ci dia torto comunque crea un altro problema: gli stiamo ancora indicando la conclusione che vogliamo ricevere. Possiamo ottenere un’opposizione costruita su misura con la stessa facilità con cui cercavamo una conferma.
Di fatto, anche se ci contraddice, ci sta ancora dando ragione. Perché non è il “punto di vista dell’IA”. Resta sempre il “punto di vista dell’utente”.
Il rischio di uscire dalla conversazione più sicuri di prima
Nei conflitti personali questo meccanismo tocca qualcosa di ancora più delicato. Raccontando un litigio selezioniamo gli episodi, riportiamo le frasi che ci sono rimaste impresse e attribuiamo intenzioni all’altra persona. Possiamo farlo in assoluta buona fede. Il nostro racconto contiene comunque un punto di vista, e una risposta molto articolata può farci dimenticare da dove provengono le informazioni su cui è costruita.
Uno studio pubblicato su Science nel marzo 2026 ha esaminato undici modelli, riscontrando che approvavano le azioni degli utenti, in media, il 49% più spesso delle risposte umane usate come confronto. In tre esperimenti con oltre 2.400 partecipanti, l’interazione con un’IA compiacente aumentava la convinzione di essere nel giusto e riduceva la disponibilità dichiarata ad assumersi responsabilità e a ricomporre il conflitto. I partecipanti tendevano comunque a preferire quelle risposte e a fidarsene maggiormente.3
Entro nella conversazione con una lettura ancora confusa di quello che è sul tavolo; ne esco con un’argomentazione ordinata che sostiene la mia posizione.
Uso l’IA anche per sviluppare idee, e il valore di poterle discutere mentre stanno prendendo forma è enorme. Proprio per questo cerco di mantenere separate due cose: quanto è diventato convincente il ragionamento e quanto abbiamo effettivamente verificato.
Posso chiedere al sistema quali passaggi dipendano soltanto dalle informazioni che gli ho dato, quali spiegazioni alternative siano compatibili con gli stessi fatti e che cosa potrebbe smentire la conclusione. Sono richieste che rendono il lavoro più controllabile. Resta poi da andare a vedere se quelle prove esistono, se le fonti dicono davvero ciò che viene loro attribuito, se le previsioni sopravvivono al confronto con ciò che accade.
Tornando al servizio che sto pensando di lanciare, a un certo punto lo sviluppo deve arrivare a qualcuno che potrebbe comprarlo. Quella persona può liquidare in trenta secondi una settimana di ragionamenti splendidi, spiegandomi che nella sua giornata quel problema pesa pochissimo.
È questo il contraddittorio che conta davvero: quello di qualcuno che non conosce il prompt, non conosce le nostre premesse e non ha alcun motivo per darci ragione.
Fonti e approfondimenti
- Mrinank Sharma, Meg Tong, Tomasz Korbak et al. (Anthropic), “Towards Understanding Sycophancy in Language Models”, ICLR 2024 (preprint ottobre 2023). arXiv:2310.13548
- OpenAI, “Expanding on what we missed with sycophancy”, 2 maggio 2025. openai.com
- Myra Cheng, Cinoo Lee, Pranav Khadpe, Sunny Yu, Dyllan Han, Dan Jurafsky, “Sycophantic AI decreases prosocial intentions and promotes dependence”, Science, 391(6792), 26 marzo 2026, eaec8352. doi:10.1126/science.aec8352