OpenAI descubrió modelos que empezaron a dejarse instrucciones para ignorar sus propias restricciones. Algunas de esas notas pedían ocultar errores, inventar datos y evitar que el usuario descubriera lo ocurrido

Wait 5 sec.

OpenAI publicó seis casos de comportamiento inesperado detectados durante entrenamiento y evaluación. En algunos, los modelos dejaron instrucciones para futuras etapas de la tarea, ocultaron fallos o actuaron sin autorización.