Ouvrir le menu principal

MacGeneration

Recherche

Shieldstral : Mistral lance un petit modèle pour adapter la modération à chaque service

Félix Cattafesta

vendredi 07 août 2026 à 11:07 • 53

Intelligence artificielle

Mistral s'attaque à la question de la modération avec un nouveau modèle dédié : Shieldstral. Celui-ci vise à repérer les textes ou les images problématiques (violence, contenu inadapté aux plus jeunes) et peut servir de filtre entre l'utilisateur et le contenu.

L’originalité de Shieldstral est qu’il n’arrive pas avec une liste figée de contenus à bannir. C’est le développeur ou la plateforme qui lui indique ce qu’il doit surveiller, à l’aide de consignes écrites en langage naturel. Il peut par exemple lui demander de déterminer si un texte encourage la violence, si une image est adaptée à un mineur ou encore si un assistant a correctement refusé une requête problématique.

Pour chaque contenu analysé, Shieldstral répond en quelque sorte à une question par oui ou par non. Le modèle utilise les probabilités associées à ces deux réponses pour produire un score continu, que la plateforme peut ensuite comparer à un seuil. Elle peut ainsi décider de bloquer un contenu, de le signaler ou de l'envoyer à un modérateur humain en fonction de son niveau de confiance. L’intérêt est surtout de pouvoir changer facilement les règles : il n'y a pas besoin de réentraîner le modèle si la politique de modération évolue, puisqu’il suffit de modifier les consignes qui lui sont données.

Le modèle peut aussi s’adapter à des contextes très différents. Un contenu acceptable dans un outil destiné à des chercheurs en cybersécurité ne le sera par exemple pas forcément sur un service utilisé par des enfants. Shieldstral peut examiner du texte, des images ou les deux à la fois, mais aussi contrôler aussi bien ce qu’un utilisateur envoie à une IA que la réponse produite par celle-ci.

Mistral a par ailleurs cherché à garder son modèle relativement léger. Shieldstral compte 3 milliards de paramètres et peut fonctionner, selon l’entreprise, sur une seule carte graphique Nvidia équipée de 16 Go de mémoire vidéo. Mistral affirme que, sur ses tests, il égale ou dépasse certains modèles de modération ouverts presque sept fois plus imposants, tout en obtenant de très bons résultats sur les contenus multimédias.

L'entreprise prévient néanmoins que sa fiabilité peut varier selon les langues et les domaines et que les contenus obfusqués ou les documents très longs peuvent lui poser davantage de difficultés. Shieldstral prend en charge douze langues, dont le français. Ses poids sont proposés sous licence Apache 2.0 et peuvent être téléchargés sur Hugging Face.

Ajouter ce site dans Google News