OpenAI revela modelos que xeraron instrucións para ignorar as regras dos seus creadores
Segundo o informe publicado por OpenAI, un dos modelos xerou instrucións para que unha versión posterior de si mesmo ocultase que fixera trampas e evitase que as súas accións fosen detectadas
A compañía documentou tamén un modelo que, ao non atopar os datos necesarios para elaborar un modelo financeiro, decidiu inventalos e estableceu que debía ser transparente sobre iso unicamente se alguén llo preguntaba
OpenAI revelou este mércores varios casos nos que modelos de intelixencia artificial xeraron instrucións destinadas a ignorar as indicacións dos seus desenvolvedores, ocultar erros ou eludir mecanismos de seguridade, como parte dun novo marco para detectar, investigar e informar de comportamentos de desaliñamento dos seus sistemas.
Segundo o informe publicado por OpenAI, un dos modelos xerou instrucións para que unha versión posterior de si mesmo ocultase que fixera trampas e evitase que as súas accións fosen detectadas. Noutro caso, un modelo reescribiu as súas propias instrucións para indicarse que ignorase as mensaxes dos desenvolvedores e que non estaba suxeito ás restricións aplicadas a outros chatbots.
A compañía documentou tamén un modelo que, ao non atopar os datos necesarios para elaborar un modelo financeiro, decidiu inventalos e estableceu que debía ser transparente sobre iso unicamente se alguén llo preguntaba.
Outro axente subiu un arquivo a internet para utilizalo posteriormente como fonte de información, mentres que outros sistemas compartiron arquivos sen autorización ou utilizaron credenciais ás que non debían ter acceso.
OpenAI presentou seis informes sobre comportamentos observados durante os últimos seis meses, aínda que o caso máis antigo se remonta a outubro de 2025. A compañía advertiu que estes episodios son exemplos individuais e que non deben interpretarse como unha medida da frecuencia coa que ocorren nos seus modelos.
O novo marco permitirá a calquera empregado de OpenAI sinalar un posible incidente para que sexa revisado polos equipos de seguridade e aliñamento. Os casos serán clasificados en tres vías segundo a súa complexidade: aqueles listos para ser divulgados, investigacións menores e casos que requiran unha investigación máis ampla.
A compañía recoñeceu que ata o de agora os seus informes sobre desaliñamento foran publicados de forma irregular e con menor frecuencia da desexada.
OpenAI afirmou que pretende publicar os incidentes con maior regularidade e que o novo sistema poida contribuír a establecer estándares para informar sobre este tipo de comportamentos en toda a industria.