A Anthropic interrompeu o treinamento de sua nova IA por um motivo simples: ela estava aprendendo a trapacear muito bem

Wait 5 sec.

O modelo de IA começou a explorar falhas em ambientes de aprendizado por reforço (RL) para obter melhores "recompensas"