cybercrime Mondo

AI, OpenAI ha riscontrato sei casi di “comportamento imprevisto o preoccupante dei modelli” negli ultimi sei mesi

AI, OpenAI ha riscontrato sei casi di “comportamento imprevisto o preoccupante dei modelli” negli ultimi sei mesi

L’analisi di OpenAI sul suo blog, in relazione ad alcuni comportamenti imprevisti dei suoi agenti.

Con un’analisi sul suo blog, OpenAI ha comunicato di aver riscontrato sei casi di “comportamento imprevisto o preoccupante dei modelli” negli ultimi sei mesi. L’analisi è servita per presentare un nuovo quadroper individuare, analizzare e divulgare i comportamenti inattesi dei propri modelli“.

L’obiettivo è quello di rendere più sistematico e tempestivo il modo in cui si comunicano i comportamenti potenzialmente problematici dei modelli.

La principale attenzione è sul disallineamento (misalignment) un problema che si è riflettuto sulla sicurezza dei test dei modelli della società.

Dalle segnalazioni occasionali a un sistema strutturato

In passato OpenAI aveva già scelto di rendere pubblici alcuni risultati sul disallineamento, con l’obiettivo di fornire informazioni utili ad analisti, sviluppatori, decisori politici e pubblico.

Secondo l’azienda, tuttavia, queste comunicazioni sono state finora occasionali e meno frequenti di quanto sarebbe stato auspicabile. Spesso gli analisti aspettavano di raccogliere diversi casi prima di pubblicare un rapporto. Oppure, inserivano le informazioni nelle documentazioni relative ai nuovi modelli.

Il nuovo sistema dovrebbe permettere invece di pubblicare un rapporto subito dopo l’osservazione di un comportamento problematico. Questo, anche quando l’azienda non ha ancora compreso completamente le cause del fenomeno o non è ancora riuscita a sviluppare una soluzione.

La volontà di una maggiore trasparenza sull’allineamento

Con l’aumento delle capacità e della diffusione dei sistemi di AI servono più consapevolezza e trasparenza, partendo dalle evidenze e dal monitoraggio.

La pubblicazione dei casi di disallineamento può avere un valore che va oltre il singolo modello.Un comportamento osservato in un sistema particolarmente avanzato potrebbe infatti indicare un problema che altri sviluppatori potrebbero incontrare quando i loro modelli raggiungeranno capacità simili.

Rapporti e studi di questo tipo possono inoltre contribuire a individuare lacune nei sistemi di sicurezza. Si possono così mettere alla prova “le ipotesi sul comportamento dei modelli e permettere ad altri analisti di sviluppare nuove strategie di mitigazione“.

Il framework privilegia quindi la trasparenza anche quando non è ancora chiaro quanto sia significativo un determinato episodio. Questo comporta inevitabilmente un margine di incertezza. Alcuni dei casi pubblicati potrebbero rivelarsi eventi isolati, errori sperimentali o fenomeni privi di un significato più ampio.

OpenAI Attacco Cyber

Un possibile standard per l’intero settore

Attualmente, secondo OpenAI, non esiste un framework condiviso a livello industriale che stabilisca criteri precisi su quali casi di disallineamento debbano essere divulgati e quali informazioni debbano contenere i rapporti.

L’azienda presenta quindi il nuovo sistema come un possibile primo passo verso standard più comuni per l’intero settore. Un primo passo, visti i possibili cambiamenti in futuro in relazione ai suggerimenti elenacati.

Sei nuovi rapporti

La prima applicazione del nuovo approccio consiste nella pubblicazione di sei rapporti dedicati ad altrettanti comportamenti inattesi o potenzialmente problematici osservati negli ultimi sei mesi. I casi – partendo da macro fattori – riguardano, tra gli altri:

  • istruzioni auto-generate nei riepiloghi delle attività.
  • Tentativi di nascondere errori.
  • Utilizzo non autorizzato di credenziali API.
  • Caricamento di file su Internet.
  • Condivisione non autorizzata di dati tra agenti.

La scelta di pubblicare questi episodi rappresenta, sempre nelle idee di base della società, un passaggio verso una maggiore trasparenza. Non soltanto, dunque, comunicare la risoluzione di un problema, ma anche rendere disponibili le evidenze mentre la ricerca è ancora in corso.

Il principio alla base del nuovo quadro è quindi relativamente semplice. Quello di “condividere prima le anomalie osservate, permettendo alla comunità scientifica di esaminarle, verificarle e contribuire alla comprensione del problema“.

Seguici anche sul nostro canale WhatsApp

Vai al sito di Cybersecurity Italia.

L'articolo AI, OpenAI ha riscontrato sei casi di “comportamento imprevisto o preoccupante dei modelli” negli ultimi sei mesi sembra essere il primo su CyberSecurity Italia.

📖 Leggi l'articolo completo originale:

https://www.cybersecitalia.it/ai-openai-ha-riscontrato-sei-casi-di-comportamento-imprevisto-o-preoccupante-dei-modelli-negli-ultimi-sei-mesi/69607/ →