Hai mai insultato un'AI? Ora Anthropic ti vieta di trattare male Claude

Dal 12 novembre un aggiornamento delle nuove regole di condotta impedirà, tra le altre cose, di abusare o comportarsi in modo crudele con il chatbot.

Anthropic vieta agli utenti di trattare male la propria AI, Claude. E lo fa introducendo, a partire dal 12 novembre, un aggiornamento delle proprie regole di condotta, che comprendono: restrizioni contro le frodi elettorali, impiego dell’AI per sviluppare tecnologie militari, sorveglianza illegale e il divieto di sottoporre Claude a comportamenti ripetutamente offensivi o crudeli.

Anthropic e il benessere dei modelli di intelligenza artificiale

La nuova policy proibisce esplicitamente condotte caratterizzate da «abusi o comportamenti crudeli, prolungati e non necessari» nei confronti dell’assistente. Una norma che, ha precisato Anthropic, è rivolta a casi estremi, in cui gli utenti insultano ripetutamente il modello senza una ragione concreta: nessun problema, quindi, se ogni tanto sbraiti contro il chatbot o formuli un feedback in modo aggressivo.

L’obiettivo è infatti quello di distinguere gli abusi sistematici dalle interazioni quotidiane. Ma perché? Per applicare le nuove regole, Claude utilizzerà una funzione che gli permette di interrompere la conversazione quando diventa abusante, sviluppata nell’ambito delle ricerche sul cosiddetto model welfare, vale a dire il “benessere” dei modelli di Intelligenza Artificiale, guidata da Kyle Fish.

E infatti l’approccio di Anthropic si inserisce in un dibattito ben più ampio sul modo in cui i sistemi AI dovrebbero essere trattati e sulla possibilità che alcuni dei modelli più avanzati possano sviluppare forme di esperienza interiore. Mentre concorrenti come Microsoft respingono esplicitamente il concetto dei “diritti dell’Intelligenza Artificiale” e di personalità dei modelli, alcuni dirigenti di Anthropic hanno invece mostrato interesse.

Inasprimento e aggiornamento di precedenti indicazioni

Una fetta importante dell’aggiornamento riguarda comunque il consolidamento e l’inasprimento di alcune precedenti indicazioni, legate a concetti un po’ più legati al mondo reale. La nuove policy vieta di generare attraverso Claude campagne ingannevoli, in particolare in ambito politico, istruzioni per la realizzazione di software di guida e componenti di controllo destinati a droni autonomi (che si affianca al già esistente divieto per le armi) in ambito militare, tracciare singole persone o fornire indicazioni alle forze dell’ordine su chi arrestare.

L’update interessa anche gli sviluppatori che integrano Claude in sistemi di robotica fisica capaci di provocare danni alle persone. In questi casi, le nuove regole richiedono la presenza nelle vicinanze di un operatore umano in grado di assumere il controllo del sistema qualora venga interrotta la connessione con l’intelligenza artificiale.

Quando saranno applicate le nuove regole

Le disposizioni aggiornate entreranno in vigore il 12 novembre e interesseranno tutti gli utenti Anthropic, con alcune eccezioni per specifici contratti governatici.

Ti consigliamo anche

Link copiato negli appunti