Guardrails для LLM: open source, оценка моделей и новые возможности HiveTrace

Разработка и оценка guardrail-моделей для защиты LLM- и Agentic-приложений.
Guardrails помогают контролировать взаимодействие с LLM и выявлять потенциально опасные запросы и ответы. Но как оценить качество разных моделей, выбрать подходящую под свой сценарий и настроить детекцию под реальные задачи?
На вебинаре команда HiveTrace поделится своими наработками в области Guardrails: поговорим об open-source разработках, инструментах для оценки и сравнения моделей и новых возможностях HiveTrace.
Никита Облаков расскажет о новой open source guardrail-модели.
Расскажем о новой guardrail-модели HiveTrace - HiveTraceGuard-Pro. Она будет полностью открытой вместе с подробным техническим отчётом: модель можно будет изучить, забрать к себе или использовать через API Cloud.ru. На вебинаре расскажем, как мы её разрабатывали и что получилось.
Софья Балаба расскажет как сравнивать guardrail-модели в равных условиях.
Расскажем про GuardRate Leaderboard — наш инструмент, который автоматизирует оценку guardrail-моделей. Мы его используем в процессе дообучения наших внутренних моделей, что позволяет выбрать лучшую и сравнивать их с opensource.
Даниил Капустин о новых возможностях HiveTrace
Новая multilabel-модель в HiveTrace - она определяет вероятности по 15 классам вредоносности и позволяет отдельно настраивать пороги блокировки для каждого класса.
Кому будет полезно
MLSecOps, ML/DS/LLM-специалистам и ИБ-командам, а также специалистам и менеджерам компаний, которые уже используют LLM- и Agentic-приложения в проде или планируют их внедрение.
В конце вебинара оставим время на вопросы участникам и обсуждение с командой HiveTrace.


