Un assistant qui comprend un dépôt de code, examine un document technique et utilise des outils pour avancer dans une tâche : c’est sur ce terrain que Mistral veut se mesurer aux grands acteurs de l’IA. L’entreprise française a annoncé Mistral Large 4 le 6 octobre 2026. Surnommé « le Chonk », ce nouveau modèle est accessible par une API en préversion publique, avant une publication de ses poids annoncée pour la fin du mois.
Son intérêt dépasse le simple lancement d’un chatbot supplémentaire. Mistral vise des usages professionnels, avec une IA multimodale et des capacités agentiques. Les premiers résultats indépendants montrent des points forts, particulièrement en cybersécurité, mais aussi des performances variables selon les tâches. Je vois dans cette annonce une alternative française à prendre au sérieux, sans lui attribuer d’avance une victoire générale sur tous ses concurrents.
Un modèle qui veut travailler sur vos fichiers, pas seulement répondre à vos questions
La fiche technique décrit un modèle capable de traiter du texte et des images, avec une architecture dite Mixture-of-Experts, ou mélange d’experts. Elle affiche environ 1 050 milliards de paramètres au total. Le mot « paramètres » désigne les valeurs apprises pendant l’entraînement : ce nombre donne une indication de taille, pas une mesure directe de l’intelligence.
Le fonctionnement d’un mélange d’experts permet de solliciter une partie du modèle pour chaque portion de texte traitée. Une comparaison utile serait une équipe de spécialistes dont on mobilise certains membres selon le problème. Cela limite le calcul par rapport à l’activation systématique de l’ensemble, mais ne transforme pas automatiquement un très grand modèle en petit logiciel facile à installer.
Pour comprendre l’objectif, imaginons un développeur qui doit corriger une anomalie dans une application. Une aide réellement utile doit trouver les fichiers concernés, comprendre leurs dépendances, proposer une modification et vérifier ses conséquences. Générer une fonction isolée ne suffit pas. C’est cette différence entre une réponse et une tâche menée à terme qui rend les modèles agentiques intéressants.
Un agent associe le modèle à des outils et à un environnement d’exécution. Il peut, selon l’application qui l’intègre, consulter des fichiers, lancer des vérifications ou interroger des services. Le modèle seul n’obtient pas magiquement ces accès : le logiciel qui l’entoure doit les fournir et définir les permissions. Cette distinction compte pour évaluer aussi bien la qualité que les risques d’une intégration.
SUR LA CHAÎNE · NOUVELLE VIDÉO JBL Charge 3 : NON à l’obsolescence programmée ! je change la batterie et port de charge Voir la vidéo → Les premiers scores racontent une histoire plus précise que « meilleur modèle »
Mistral met en avant le code, les workflows professionnels et la compréhension visuelle. Dans ses évaluations publiées, l’entreprise annonce notamment 61,7 % sur DeepSWE v1.1 et 59,9 % sur AutomationBench. Ces résultats portent sur des protocoles précis ; ils ne constituent pas un taux de réussite applicable à n’importe quel projet.
Les évaluations extérieures permettent de compléter ce discours. Voici quelques repères relevés au lancement, qui portent sur la préversion et peuvent évoluer :
| Évaluation | Résultat relevé | Ce que le résultat permet de regarder |
|---|---|---|
| Artificial Analysis Intelligence Index | 38 points | Un indice agrégé, comparable dans cette évaluation à GPT-6 Luna en configuration maximale. |
| CyberGym-E2E-AA | 81,7 % | Un résultat particulièrement fort sur un protocole de reproduction et correction de vulnérabilités. |
| Finance Agent v2, chez Vals AI | 54,68 % | Des tâches financières, avec plusieurs concurrents devant lui dans le classement consulté. |
| Harvey’s Legal Agent Benchmark, chez Vals AI | 6e sur 75 modèles | Un bon positionnement relatif sur cette évaluation juridique particulière. |
Le tableau ne désigne donc pas un vainqueur universel. Un système peut être très bon pour résoudre un problème de sécurité et moins convaincant pour une autre famille de tâches. Le choix dépend aussi de la vitesse, du coût, du niveau de raisonnement demandé et des outils utilisés pendant l’évaluation.
Il faut également regarder ce que le test mesure vraiment. Dans CyberGym-E2E-AA, le protocole vérifie notamment qu’un exemple reproduit un plantage, que le correctif élimine ce plantage et que les tests fonctionnels passent. La réparation effective de la vulnérabilité sous-jacente est suivie séparément comme diagnostic. Un score élevé reste intéressant, mais ce n’est pas une certification de sécurité pour le code produit.
Pour un lecteur qui veut choisir son prochain assistant de développement, j’utiliserais ces classements comme une sélection de candidats. Le verdict utile arrive ensuite sur quelques tâches représentatives de votre travail : corriger un bug réel, respecter une convention du projet ou comprendre une erreur de compilation. La meilleure démonstration reste celle que l’on peut reproduire dans son propre contexte.
La compréhension des documents devient aussi importante que la rédaction
L’entrée multimodale ouvre des usages qui ne se limitent pas à discuter d’une image. Dans un dossier technique, une information peut se trouver dans un tableau, un schéma ou une annotation. Un assistant doit pouvoir relier cet élément visuel au texte environnant, puis expliquer sur quoi repose sa réponse.
Prenons un exemple hypothétique : vous fournissez une documentation de plusieurs équipements et demandez lesquels satisfont un ensemble de contraintes. Une réponse pratique doit différencier les modèles, vérifier les unités et retrouver les conditions qui accompagnent les valeurs. Une synthèse élégante qui oublie une note en bas de tableau peut conduire à un mauvais choix.
C’est pourquoi je regarderais davantage la précision des réponses que leur longueur. Pour évaluer ce type d’outil, demandez-lui de retrouver un détail connu, de comparer deux passages éloignés et d’indiquer quand une information manque. Vous saurez rapidement s’il exploite les documents ou s’il comble les trous avec une formulation plausible.
La taille du contexte mérite elle aussi une lecture attentive. La documentation de Mistral affiche jusqu’à un million de tokens, alors que des fiches d’évaluateurs décrivent la préversion avec environ 512 000 tokens. Ces indications ne coïncident pas au lancement : il faut vérifier la limite effective de l’accès utilisé avant de dimensionner une application.
Un token est une unité de découpage du contenu, pas nécessairement un mot. Une grande fenêtre permet de fournir davantage d’éléments dans une requête, mais ne garantit ni que chaque détail sera exploité correctement, ni qu’il sera pertinent d’envoyer tout un dossier à chaque question. Sélectionner les bonnes pièces peut rester plus efficace que multiplier le volume.
Des poids ouverts, avec un calendrier à bien comprendre
Au 7 octobre, la voie publique annoncée pour tester Large 4 est l’API en préversion. Les poids publics sont promis pour la fin octobre. Il faut donc distinguer un modèle annoncé à poids ouverts et un modèle dont les fichiers sont déjà librement téléchargeables.
Les poids correspondent aux valeurs apprises que le logiciel charge pour exécuter le modèle. Leur mise à disposition peut permettre à une organisation de déployer l’IA dans son propre environnement, de choisir son infrastructure et de conserver davantage de maîtrise sur son exploitation. Les possibilités exactes dépendent cependant de la licence qui accompagne la distribution.
« Open-weight » ne signifie pas automatiquement que toutes les données d’entraînement, tous les outils et toutes les étapes de fabrication seront publiés. Ce n’est pas non plus une garantie de gratuité de l’usage : faire fonctionner le modèle nécessite du matériel, de l’énergie et une administration. L’ouverture concerne d’abord l’accès aux fichiers et les droits accordés sur ceux-ci.
Pour les amateurs d’IA locale, le chiffre des paramètres mérite un calcul simple. À titre d’ordre de grandeur théorique, mille milliards de paramètres stockés sur quatre bits représentent environ 500 Go pour les valeurs seules, avant les autres besoins d’exécution. Ce calcul n’est pas une configuration recommandée pour Large 4 ; il montre pourquoi l’ouverture d’un modèle de cette taille vise surtout des infrastructures importantes.
Le nombre de paramètres actifs réduit une partie du calcul, mais les autres poids doivent rester accessibles d’une manière ou d’une autre. Quantification, répartition entre plusieurs machines et transferts peuvent modifier les compromis. Il faudra attendre les fichiers et les recommandations de déploiement pour juger les configurations possibles. Une carte graphique grand public ne devient pas adaptée simplement parce que le modèle utilise des experts.
Une API à prix réduit pendant le lancement
Le tarif standard affiché est de 1,36 dollar par million de tokens en entrée et de 4,18 dollars par million de tokens en sortie. Mistral annonce une réduction de 50 % pendant les deux premières semaines du lancement :
| Consommation | Prix standard par million de tokens | Prix de lancement |
|---|---|---|
| Entrée | 1,36 $ | 0,68 $ |
| Sortie | 4,18 $ | 2,09 $ |
| Entrée mise en cache | 0,14 $ | 0,07 $ |
Exemple purement illustratif : une consommation de 100 000 tokens d’entrée et de 10 000 tokens de sortie représente environ 0,18 dollar au tarif standard, ou 0,09 dollar au tarif promotionnel. Ce calcul suppose uniquement ces volumes, sans cache ni autre service facturé ; ce n’est pas le prix garanti d’une tâche complète.
Une tâche agentique peut demander plusieurs appels, relire des fichiers et produire beaucoup de contenu avant d’aboutir. Le coût par million de tokens ne dit donc pas combien coûtera réellement la correction d’un bug ou le traitement d’un dossier. Pour comparer deux modèles, regardez le prix d’un résultat utilisable, avec les reprises nécessaires et le temps de vérification.
L’alternative française se joue aussi sur la maîtrise de l’infrastructure
Mistral indique avoir entraîné Large 4 dans ses centres de données européens, où la préversion est également servie. Ce volet constitue un autre axe de concurrence : certaines organisations cherchent autant à maîtriser leur environnement informatique qu’à obtenir le meilleur score sur un classement.
La possibilité future de déployer les poids peut rendre un changement de fournisseur moins contraignant. Elle peut également aider à adapter le modèle à une activité ou à une politique interne. En contrepartie, l’organisation qui héberge assume le suivi des versions, la disponibilité et une partie du travail d’exploitation.
Je trouve cette liberté de choix intéressante, même pour ceux qui continueront à utiliser une API. Une concurrence portant sur l’accès au modèle, les infrastructures et les conditions d’exploitation apporte davantage qu’une bataille de démonstrations. Elle permet de comparer plusieurs manières d’intégrer l’IA dans un produit.
Le choix pratique reste donc lié au besoin : un développeur peut expérimenter par API, une entreprise peut évaluer un futur déploiement privé, et un utilisateur quotidien peut attendre de voir comment ces capacités seront intégrées aux applications qu’il utilise. L’annonce du modèle ne décrit pas à elle seule toutes ces expériences.
Ce que j’attends maintenant de Mistral Large 4
Large 4 mérite des essais concrets : les premiers résultats lui donnent des arguments, sans régler toutes les comparaisons. La prochaine étape importante sera la publication des poids, de leurs conditions d’utilisation et des informations permettant de reproduire les performances annoncées.
Pour le tester utilement dès maintenant, je choisirais un petit ensemble de tâches dont vous connaissez la difficulté et le résultat attendu. Gardez les mêmes données, les mêmes outils et un budget comparable pour chaque candidat. Notez les erreurs, les interventions nécessaires et le coût final, au lieu de juger uniquement la fluidité de la réponse.
Mon avis à ce stade : Mistral Large 4 renforce l’intérêt d’une alternative française capable de viser des usages exigeants. Son potentiel se vérifiera dans les projets où il fournit des résultats fiables à un coût acceptable, avec un niveau de contrôle adapté. C’est sur cette combinaison que je le jugerais, bien plus que sur une promesse de battre tout le monde.
À lire aussi
ARTICLE · 5 OCT. Gemini gratuit limité à Flash-Lite dès le 9 octobre : ce qui change vraiment
ARTICLE · 10 SEPT. OpenAI booste la création d’images dans ChatGPT avec Images 2.5
ARTICLE · 21 JUIL. DLSS 5 : Nvidia dévoile trois modèles d’IA capables de changer en temps réel
ARTICLE · 3 JUIL. Isaac 1 : ce robot domestique veut plier le linge, faire les lits et ranger la maison

Commentaires
0