Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив результаты новых флагманов Anthropic и OpenAI. Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое выглядит аномалией: на многих других тестах эти модели идут почти вровень, а кое-где Sol и вовсе впереди. Официального объяснения нет ни у Epoch, ни у Anthropic, но его можно восстановить по данным самого лидерборда. Читать далее