Z.ai выпустила GLM-5.3-Flash — первую нативно мультимодальную модель семейства GLM-5. Она сочетает 320 млрд параметров, из которых на каждом токене активируется около 18 млрд, и гибридную архитектуру, рассчитанную на снижение стоимости инференса при работе с длинным контекстом.Главная архитектурная особенность — комбинация sparse attention и linear attention. Решение снижает объем вычислений attention, по сравнению с GLM-5.3, в 3,01 раза, а размер KV-cache — в 4,44 раза. Для длинного контекста это особенно важно: KV-cache занимает значительную часть памяти при генерации, поэтому его сокращение позволяет эффективнее обслуживать большие последовательности.Контекстное окно модели достигает 1 млн токенов. GLM-5.3-Flash при этом работает не только с текстом: визуальные возможности встроены непосредственно в цикл выполнения задач. Модель может анализировать интерфейс, учитывать результат своих действий и использовать эту информацию для следующего шага.Z.ai ориентирует модель прежде всего на агентные сценарии. Среди заявленных задач — программирование, работа с браузером и GUI, создание сцен в Blender, взаимодействие с Office-документами, финансовые исследования и обработка профессиональных документов. Модель может разбивать задачу на этапы, вызывать инструменты, анализировать промежуточные результаты и корректировать собственные действия.Для разработчиков модель доступна под идентификатором glm-5.3-flash. API поддерживает изображения через image_url, несколько изображений в одном запросе и контекст до 1 млн токенов. Читать далее