Mistral's Shieldstral: 3B open-weights model for multimodal moderation
Shieldstral — это открытая 3‑модель‑классификатор, способная оценивать текст и изображения с точностью, сопоставимой с моделями в семь раз крупнее. Она работает как единый «вопрос‑ответ»‑модуль: в запросе задаётся контекст политики, конкретный вопрос («Эта реплика пропагандирует насилие?») и сам материал. На выходе модель выдаёт единственную цифру — вероятность «да», калиброванную в диапазон [0,1]. Такой подход позволяет менять правила в реальном времени, не тренируя модель заново, и использовать один набор весов для всех типов контента.
Ключевые цифры: 3 B параметров, работает на одной видеокарте с 16 ГБ памяти, обучена на смеси реальных и синтетических датасетов, поддерживает как текст, так и изображения, возвращает непрерывный safety‑score. В открытом доступе под лицензией Apache 2.0, а также в составе Open Secure AI Alliance с NVIDIA. Это первый шаг к гибкой, контекстно‑зависимой модерации, где политика задаётся простым языком, а не фиксированным набором категорий.