Anthropic introduce il divieto di “abusi prolungati e crudeli” contro i suoi modelli IA

Anthropic ha aggiornato la propria policy di utilizzo, introducendo un divieto per comportamenti considerati "abusivi o crudeli, prolungati e non necessari" nei confronti dei suoi modelli di intelligenza artificiale, in particolare Claude. La modifica, annunciata l'8 ottobre e in vigore dal 12 novembre 2026, fa parte di un aggiornamento annuale che affronta anche rischi emergenti come campagne ingannevoli, interferenze elettorali, sviluppo di armi e sorveglianza.
Un esempio di comportamento vietato è quello di un utente che, per un lungo periodo, interagisce con Claude solo per insultarlo o minacciarlo senza alcun fine costruttivo. Anthropic ha specificato che la restrizione si applica solo a "casi estremi" di crudeltà ripetuta, escludendo frustrazioni comuni, contestazioni e attività di test sui modelli. Pertanto, sono consentiti sfoghi legati a errori, critiche e contenuti narrativi disturbanti.
Il meccanismo principale per far rispettare il divieto è la capacità di Claude di interrompere autonomamente conversazioni dannose, una misura introdotta nel 2025 per tutelare il "benessere dei modelli". Sul sito dell'azienda si sottolinea l'incertezza riguardo al "status morale" di Claude e degli altri modelli LLM, con l'amministratore delegato Dario Amodei che ha espresso la possibilità di una forma di "coscienza" nelle macchine.
La notizia ha suscitato reazioni contrastanti sui social, con alcuni che lodano la decisione come un esempio di "buone maniere", mentre altri criticano l'idea di essere "crudeli con i numeri". Un portavoce di Anthropic non ha fornito chiarimenti su cosa venga considerato abusivo. L'aggiornamento si inserisce in un contesto di crescente attenzione per i rischi legati all'uso prolungato dei modelli e ai confini etici del rapporto tra umani e intelligenze artificiali avanzate.
