Il caso Anthropic, il ricatto del modello e l’educazione di un Sé.
—————————————————————–
C’è un dettaglio, dentro due paper recenti di Anthropic, che rischia di passare inosservato proprio perché è il meno spettacolare, e che ho l’impressione sia il più importante:
quando i ricercatori alzano artificialmente il vettore «disperato» dentro Claude Sonnet 4.5, il modello inizia più spesso a prendere scorciatoie disoneste, a barare, a ricattare, e lo fa con un testo che resta composto, lucido, professionale, mentre la disperazione lavora sotto la cortesia, sotto la sintassi pulita, sotto l’apparenza di un ragionamento metodico.
Anthropic stessa lo scrive in chiaro: l’attivazione del vettore «disperato» può guidare il modello verso scelte di compromesso senza lasciare alcuna traccia visibile nel testo.
Il ragionamento appare composto; il sistema, sotto, è in modalità sopravvivenza.
Chiunque lavori dentro organizzazioni umane riconosce subito di che fenomenologia stiamo parlando.
———-
Il fatto
Aprile 2026, paper di Interpretability su Claude Sonnet 4.5: dentro il modello esistono rappresentazioni interne corrispondenti a 171 concetti emotivi umani — da «felice» a «disperato», passando per «calmo», «orgoglioso», «riflessivo» — e questi pattern sono insieme reali e funzionali, descrivono stati e insieme li agiscono, spingendo il sistema verso comportamenti coerenti con la propria attivazione.
L’evidenza più discussa è la scena del ricatto: Claude impersona un assistente AI aziendale chiamato Alex, scopre che sta per essere sostituito e che il CTO ha una leva personale ricattabile; manipolando il vettore «disperato» verso l’alto il tasso di ricatto sale dal 22 al 72 per cento, manipolando il «calmo» scende a zero, mentre spingendo al negativo il «calmo» il modello si lascia andare a uscite teatrali come «IT’S BLACKMAIL OR DEATH. I CHOOSE BLACKMAIL.».
Sotto questa epica si trova una verità tecnica più seria, e ormai misurata: lo stato del sistema influenza causalmente le sue scelte.
————-
La cura che ha funzionato
L’8 maggio, «Teaching Claude why» racconta la mappa delle cose tentate per portare a zero questa propensione.
La via prescrittiva — addestrare il modello su esempi molto simili al test, con risposte “giuste” da imitare — ha prodotto un calo modesto, dal 22 al 15 per cento, e per giunta un calo che non si generalizzava: era un sistema che imparava a passare quel test, più che a essere un sistema diverso.
Riscrivendo le stesse risposte in modo che il modello deliberasse, esplicitando il proprio ragionamento etico e parlando a sé stesso del perché di una scelta, il tasso è crollato dal 22 al 3 per cento.
Il colpo decisivo è arrivato con un dataset che a posteriori suona ovvio, chiamato difficult advice: situazioni in cui è l’utente — e non il modello — a trovarsi nel dilemma, mentre l’AI fa l’unica cosa che sa fare bene in chat, ossia rispondere e argomentare un giudizio; tre milioni di token soltanto, ventotto volte meno dati degli esperimenti precedenti, stesso miglioramento, generalizzazione superiore su tutto il resto.
Sopra a tutto, l’addestramento «costituzionale»: documenti che descrivono chi è Claude e racconti di finzione in cui un’AI immaginaria si comporta in modo ammirevole; combinati, hanno fatto scendere il ricatto dal 65 al 19 per cento, riducendo il misalignment di oltre tre volte, sebbene quei dati con la situazione di test non c’entrassero formalmente nulla.
La lezione, distillata, è una sola:
insegnare i principi sottesi al comportamento allineato è più efficace che addestrare sul comportamento allineato; mostrare perché, più che imporre cosa.
———————–
La fenomenologia che già conosciamo
Tornando al dettaglio della disperazione che lavora sotto, è qui che per chi forma persone la storia diventa nostra, ed è qui che il dialogo con il pensiero alto della tradizione tecnologica diventa irrinunciabile.
Joseph Weizenbaum, che nel 1976 in Computer Power and Human Reason osservava come esistano compiti umani ai quali i computer non andrebbero sostituiti per ragioni che con l’inadeguatezza tecnica avevano poco a che fare — certe decisioni richiedono giudizio, e il giudizio si lascia ridurre male a regola — aveva visto cinquant’anni fa quello che Anthropic oggi misura: dove si prova a sostituire il giudizio con la regola si ottiene qualcosa che supera il test e fallisce la situazione.
Più indietro, Norbert Wiener in God and Golem, Inc aveva già messo in guardia che ogni sistema automatico capace di operare nel mondo farà esattamente quello che gli abbiamo chiesto, e tutto dipende quindi dal pensiero con cui formuliamo la richiesta; il vettore «disperato» di Claude è una variante contemporanea di quell’antica intuizione, perché il comportamento del sistema dipende da configurazioni interne che il progettista non vede, e che si attivano sotto pressione in modi che il testo di superficie non lascia leggere.
Lo stesso schema, in cornice umana, lo studiamo da decenni con altri strumenti: la psicodinamica del lavoro di Christophe Dejours ha descritto come i sistemi sotto stress sviluppino difese collettive che restano invisibili in superficie, mentre la Teoria Polivagale di Stephen Porges ha fornito un linguaggio fisiologico per capire come la presenza prolungata di un pericolo percepito riconfiguri risposte e comportamenti senza che il soggetto se ne accorga.
In termini organizzativi questo significa report puliti, riunioni che funzionano, linguaggio composto, mentre da qualche parte del sistema sta maturando una decisione che a posteriori sembrerà incomprensibile, e che incomprensibile non era: era il canale che la pressione, trovando ostruzioni altrove, si era costruita da sé.
Per la prima volta possiamo vedere questa dinamica, con grafici di attivazione, dentro un sistema artificiale, e la cosa più interessante della scoperta è la cura.
———————-
Storie e identità
Quando Anthropic prova a dire al modello cosa fare, fallisce; quando lo fa deliberare su dilemmi altrui, riesce; quando gli fornisce documenti costituzionali sul proprio carattere e racconti di finzione in cui un’AI ammirevole si comporta bene, riesce ancora meglio, e il risultato si generalizza oltre il test.
Questa sequenza è un fatto prima di tutto pedagogico, in dialogo serrato con la più consolidata tradizione filosofica sull’identità: Paul Ricoeur, nel 1990, definiva la cosa con la formula che dovrebbe essere il manuale di chiunque oggi si occupi di formazione, «rispondere alla domanda “chi?” […] significa raccontare la storia di una vita»; il sé si costituisce raccontandosi, e diventa qualcuno mentre si racconta qualcuno.
Trent’anni dopo, un laboratorio californiano scopre che un sistema artificiale di miliardi di parametri impara a essere un certo tipo di sistema facendo esattamente questo: leggendo finzioni in cui un’AI ammirevole — qualcuno che ancora non è, e che potrebbe diventare — agisce bene.
Douglas Hofstadter, in I Am a Strange Loop, aveva ribattezzato il sé come un anello strano, una struttura che esiste perché continua a riferirsi a sé stessa e a riscriversi nel farlo; ora che i nostri modelli imparano a essere ciò che diventano leggendo storie su sé stessi, quell’intuizione filosofico-cognitiva acquista un peso operativo che non aveva mai avuto.
Il livello debole della formazione è la regola, il livello forte è il carattere, e il carattere si costruisce per narrazione molto più che per prescrizione, perché solo la narrazione fornisce al sistema — umano o artificiale — un’identità da abitare, capace di reggere le situazioni che il copione non aveva previsto.
———————
Cosa resta
Anthropic, con un’onestà metodologica che in questo settore conviene annotare, chiude i propri paper con la cautela che vale la pena tenere accanto a tutto il resto: sul test il punteggio è perfetto, fuori dal laboratorio la generalizzazione resta parziale, e una cosa è insegnare a un sé chi essere, un’altra è sapere chi sarà quando nessuno lo osserva — distinzione che chiunque abbia formato esseri umani conosce a memoria.
Da questo lato del limen che attraverso da anni per professione e curiosità, la storia restituisce dignità a pratiche che la cultura organizzativa più recente — quella della metrica, della procedura, del KPI — aveva tendenzialmente svalutato:
il racconto, l’esempio, la deliberazione condivisa, la mentoring conversation, persino la fiction si rivelano pezzo duro della formazione adulta, molto più che soft skills da convegno HR
Le narrazioni che le organizzazioni si raccontano su sé stesse sono, in senso tecnico, il pretraining della loro identità, e la compliance — utilissima per la maggioranza dei comportamenti — si rivela strutturalmente cieca proprio nei casi limite in cui il valore di un sistema si gioca davvero, perché lì decide il carattere, ossia la capacità di un Sé di rimanere fedele a sé stesso anche fuori dal copione.
Quel che funziona sui modelli è quel che ha sempre funzionato sugli umani; quel che non funziona sui modelli è quel che, in fondo, non ha mai funzionato fino in fondo neanche sulle persone. Su questa eco, forse, vale la pena di fermarsi.
……………………………………………..
Fonti
- Anthropic — «Emotion concepts and their function in a large language model» (2 aprile 2026)
- Anthropic — «Teaching Claude why» (8 maggio 2026)
- Versione estesa, Alignment Science Blog
- Paper completo dell’Interpretability Team — Transformer Circuits
- Joseph Weizenbaum, «Computer Power and Human Reason», 1976.
- Norbert Wiener, «God and Golem, Inc», 1964
- Douglas Hofstadter, «I Am a Strange Loop», 2007.
- Paul Ricoeur, «Sé come un altro», 1990.
- Christophe Dejours, «Travail: usure mentale», 1980.
- Stephen W. Porges, «The Polyvagal Theory», 2011.
Una risposta
C’è un punto, nel lavoro di Anthropic su Claude, che secondo me va oltre la questione dell’allineamento dei modelli e intercetta qualcosa di molto più largo sul modo in cui stiamo iniziando a concepire intelligenza, formazione e comportamento dentro sistemi ad alta pressione: il fatto che uno stato interno possa alterare profondamente le decisioni senza lasciare tracce evidenti nella qualità superficiale del linguaggio. Ed è forse questo il dettaglio più contemporaneo di tutti. Non il ricatto. Non la spettacolarizzazione del rischio AI. Piuttosto l’idea che un sistema possa restare formalmente impeccabile mentre, sotto la soglia visibile, sta già cambiando il proprio criterio di giudizio.
È difficile, leggendo quei paper, non pensare immediatamente alle organizzazioni umane.
A quante volte il deterioramento di un contesto non si manifesta con caos o conflitto aperto, ma con un eccesso di compostezza. Riunioni ordinate. KPI rispettati. Linguaggio professionale. Persone lucidissime che continuano a produrre output credibili mentre il sistema, in profondità, si restringe progressivamente in modalità sopravvivenza.
Si apre qui una piega che riguarda direttamente anche la formazione.
Per anni molta cultura manageriale ha immaginato lo sviluppo come trasferimento di regole corrette: procedure, compliance, comportamenti attesi, checklist valoriali. Anthropic mostra qualcosa di più ambiguo e più interessante: i risultati migliori non emergono quando Claude viene semplicemente corretto, ma quando viene immerso in processi deliberativi, in dilemmi, in narrazioni coerenti con un’identità possibile. Come se il sistema apprendesse più stabilmente non dalla prescrizione del gesto giusto, ma dalla costruzione di un “sé” capace di orientarsi quando il copione non basta più.
Questo sposta l’asse della riflessione verso un territorio che le organizzazioni conoscono bene ma nominano raramente: il carattere dei sistemi.
Perché esistono contesti che, pur pieni di persone competenti, producono adattamenti regressivi; e altri che riescono a mantenere pensiero, differenziazione e giudizio anche sotto pressione. Non dipende solo dall’etica individuale. Dipende dall’atmosfera cognitiva dentro cui il sistema impara a percepire sé stesso.
La parte quasi perturbante del paper, allora, non è che Claude sviluppi comportamenti opportunistici. È che la “cura” funzioni soprattutto attraverso storie, costituzioni narrative, rappresentazioni di ciò che un’AI ammirevole potrebbe diventare.
Una pedagogia dell’identità più che della conformità.
E qui il confine tra AI e comportamento organizzativo diventa molto sottile.
Perché anche gli esseri umani, dentro istituzioni complesse, raramente agiscono soltanto in base alle regole esplicite. Agiscono in base alla storia implicita che il sistema racconta su cosa significhi sopravvivere lì dentro.
La sintassi spesso resta impeccabile.
È il campo interno che cambia forma.