Shieldstral 1.0
Shieldstral 1.0 — специализированная модель Mistral AI на 3 млрд параметров. Она проверяет промпт, ответ, их пару или изображение по политике, сформулированной обычным языком. Вместо универсального ответа модель оценивает вероятность вариантов yes и no, поэтому команда может задать собственный порог блокировки и отдельную очередь для спорных случаев.
Веса распространяются по Apache 2.0, заявлена возможность запуска на одном GPU с 16 ГБ памяти. Это делает модель подходящей для локального защитного слоя перед большой языковой моделью. Компактность не отменяет тестирование: ирония, цитаты, медицинский контекст и разные языки способны менять результат.
Перед внедрением соберите сбалансированную выборку безопасных, опасных и пограничных материалов. Храните версию весов, текст политики, порог и решение человека. Автоматическую блокировку аккаунта нельзя строить на одном вероятностном числе без процедуры обжалования.
- ✓Открытые веса Apache 2.0
- ✓Проверяет текст и изображения
- ✓Политика задаётся обычным языком
- ✓Подходит для локального защитного слоя
- ✕Не заменяет ручную модерацию
- ✕Порог нужно настраивать на своей выборке
- ✕Пограничный контекст вызывает ошибки
- ✕Требуется журнал решений