Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель.Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard. Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные.В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике. Читать далее