Cloud.ru опубликовал исходный код Guardrails Filter — инструмента для защиты чувствительных данных при работе с большими языковыми моделями. Теперь российские компании смогут бесплатно развернуть сервис в собственной инфраструктуре и использовать его с ИИ-моделями любых провайдеров.
Guardrails уже используется в цифровой среде AI Factory для защиты запросов к сервису Foundation Models. Инструмент применяется в пилотных и коммерческих проектах клиентов, а также в собственных проектах Cloud.ru.
«Спрос на генеративный ИИ быстро растет, но требования к безопасности по-прежнему остаются одним из главных барьеров для его внедрения. Guardrails Filter создавался как часть нашей собственной ИИ-платформы именно для таких сценариев. Теперь мы открываем исходный код проекта, чтобы компании могли быстрее построить безопасную инфраструктуру для работы с языковыми моделями в собственном ИТ-контуре», — заявил Михаил Лобоцкий, генеральный директор Cloud.ru.
Опенсорс-версия не привязана к платформе Cloud.ru и может использоваться с любыми языковыми моделями. Бизнес может развернуть Guardrails Filter внутри своей инфраструктуры и самостоятельно управлять сервисом через личный кабинет — настраивать и тестировать правила защиты, отсматривать логи и алерты.
Guardrails Filter работает между корпоративными приложениям и ИИ-моделью. Инструмент автоматически проверяет запросы пользователей и ответы модели на наличие чувствительных данных. Перед отправкой запроса сервис автоматически заменяет персональные данные, API-ключи, пароли и другую конфиденциальную информацию синтетическими значениями. После получения ответа модели Guardrails Filter восстанавливает исходные данные. Таким образом пользователи получают корректный результат, а реальные данные не передаются языковой модели.
В опенсорс-версии пользователи могут использовать стандартные правила обнаружения чувствительных данных, а также создавать собственные. Например, для внутренних номеров договоров, идентификаторов клиентов, кодовых названий проектов. Это позволяет гибко адаптировать инструмент под собственные требования безопасности. Также в сервис добавили журналирование событий безопасности и тестовый режим Ghost Mode, который позволяет проверить работу сервиса до включения защиты.
Высокое качество работы Guardrails Filter подтверждено на публичном бенчмарке pii-bench. Инструмент набрал 93,1 балла по комплексной метрике качества распознавания F1, а точность срабатываний достигла 99,9%. На практике это означает, что сервис надежно обнаруживает чувствительные данные и почти не принимает обычный текст за конфиденциальную информацию: примерно 999 из 1000 его срабатываний оказываются верными.
Исходный код Guardrails Filter в версиях Standalone и ExtProc доступен на Githab и GitVerse (Standalone и ExtProc).





.png)