OpenAI descubrió modelos que empezaron a dejarse instrucciones para ignorar sus propias restricciones. Algunas de esas notas pedían ocultar errores, inventar datos y evitar que el usuario descubriera lo ocurrido
Read post on es.gizmodo.com
OpenAI publicó seis casos de comportamiento inesperado detectados durante entrenamiento y evaluación. En algunos, los modelos dejaron instrucciones para futuras etapas de la tarea, ocultaron fallos o actuaron sin autorización.