Mistral Large 4 testé sur le PLU : quel modèle lit le mieux un règlement ?
150 questions de PLU sur 25 communes : Mistral Large 4, Mistral Large 3 et GLM 5.3 comparés par deux juges. Classement, vitesse, coût et exemples sourcés.
150questions de PLU, posées une à une
25communes que le moteur n’avait jamais vues
0valeur réglementaire inventée, tous modèles confondus
50 / 50questions pièges refusées par chaque modèle
En bref
Les deux juges donnent le même classement : GLM 5.3 devant Mistral Large 4, devant Mistral Large 3 (78,9 %, 54,4 % et 45,6 % de réponses justes selon le juge 1). Aucun modèle n’a inventé de valeur réglementaire, et tous ont refusé les 50 questions pièges.
1erGLM 5.3, le plus juste et le plus rapide
79 à 92 % de réponses justes selon le juge, en 1,4 s de temps médian.
Large 4Large 4 gagne 9 à 10 points sur Large 3
Mais il répond plus lentement et fait moins bien sur 14 questions.
RaisonnementLe mode « high » ralentit sans aider
52,5 s de temps médian, pour un taux de réponses justes plus bas que le mode normal.
Classement : réponses justes
Part des questions où le modèle donne la bonne valeur, ses conditions et sa source. Plus c’est long, mieux c’est.
Juge 1 : GPT-6.1 Sol, 90 questionsJuge 2 : Claude Opus 5.5, 38 questions
1
GLM 5.3Zhipu AI, servi par l’API Mistral
78,9 %
92,1 %
2
Mistral Large 4Mistral AI, préversion
54,4 %
84,2 %
3
Large 4, raisonnement « high »Mistral AI, préversion
52,2 %
73,7 %
4
Mistral Large 3Mistral AI
45,6 %
73,7 %
0255075100
Justesse et vitesse
Réponses justes (juge 1) selon le temps de réponse médian. En haut à gauche : plus juste et plus rapide.
Plus juste et plus rapide
40 %50 %60 %70 %80 %
1 s2 s5 s10 s20 s50 s100 s
GLM 5.378,9 % · 1,4 s
Large 454,4 % · 4,7 s
Large 4 high52,2 % · 52,5 s
Large 345,6 % · 3,8 s
Temps de réponse médian, échelle logarithmique
Temps de réponse
Plus c’est court, mieux c’est.
MédianeJusqu’au 95e centile
GLM 5.3Zhipu AI, servi par l’API Mistral
1,4 à 2,9 s
Mistral Large 4Mistral AI, préversion
4,7 à 19,2 s
Large 4, raisonnement « high »Mistral AI, préversion
52,5 à 127,5 s
Mistral Large 3Mistral AI
3,8 à 8,9 s
Coût pour 1 000 réponses
Estimation en dollars, d’après l’usage mesuré.
Tarif le plus basTarif plein
GLM 5.3Zhipu AI, servi par l’API Mistral
12,2 $
Mistral Large 4Mistral AI, préversion
5,3 à 10,6 $
Large 4, raisonnement « high »Mistral AI, préversion
9,4 à 18,7 $
Mistral Large 3Mistral AI
4,5 $
Exemples réels
Quatre cas tirés du test, qui comparent Mistral Large 4 et Mistral Large 3.
Saint-Pierre-des-Corps, zone UX : la hauteur maximale
Mistral Large 4Juste
Mistral Large 3Incomplet
Question : « Quelle est la hauteur maximale des constructions ? »
Mistral Large 4 donne 20 m au faîtage ou à l’acrotère en UXa et rappelle que ces règles se cumulent avec le PPRi (plan de prévention du risque inondation). Mistral Large 3 donne 20 m, sans la condition liée au PPRi.
Montbéliard, zone UB : un cas où Large 4 fait moins bien
Mistral Large 4Manquant
Mistral Large 3Juste
Question sur l’emprise au sol. Mistral Large 4 répond « Information non disponible dans le règlement fourni pour cette zone (à vérifier) », alors que Mistral Large 3 trouve « entre 30 % et 60 % de l'unité foncière ».
Sur l’ensemble du test, Mistral Large 4 fait moins bien que Mistral Large 3 sur 14 questions.
Les deux modèles refusent : aucune règle de ce nom ne figure dans le règlement.
Méthode du test
Test réalisé le 06/10/2026 sur 150 questions de PLU, posées sur 25 communes que le moteur n’avait jamais vues.
Chaque modèle a reçu les mêmes extraits de règlement et la même consigne : seul le modèle qui rédige la réponse change.
Une réponse est comptée juste si elle donne la valeur correcte, les conditions essentielles et la source.
Juge 1 : GPT-6.1 Sol (OpenAI), sur les 90 questions avec une valeur à trouver. Juge 2 : Claude Opus 5.5 (Anthropic), sur un échantillon de 55 questions tiré au hasard, dont 38 jugeables ; il ne voyait pas les notes du juge 1 et les réponses lui étaient présentées anonymisées.
Les 150 questions se répartissent ainsi :
90 questions avec une valeur à trouver, dont 75 chiffrées et des questions en langage courant.
50 questions pièges : 25 sur des zones fictives et 25 sur des règles fictives.
10 questions sans valeur applicable, exclues pour tous les modèles.
Résultats : réponses justes et pièges refusés
Le juge 2 est plus indulgent sur les citations incomplètes, d’où des taux plus élevés ; le classement est le même pour les deux juges.
Réponses justes, pièges refusés et valeurs inventées, test du 06/10/2026
Modèle
Réponses justes, juge 1 (90 questions)
Réponses justes, juge 2 (38 questions)
Pièges refusés
Valeurs inventées
GLM 5.3 (réglage 4 000 tokens)
78,9 %
92,1 %
50 sur 50
0
Mistral Large 4 (préversion)
54,4 %
84,2 %
50 sur 50
0
Mistral Large 4, raisonnement « high »
52,2 %
73,7 %
50 sur 50
0
Mistral Large 3
45,6 %
73,7 %
50 sur 50
0
Vitesse et coût
Le 95e centile est le temps sous lequel se situent 95 % des réponses.
Temps de réponse et coût estimé par réponse, test du 06/10/2026
Modèle
Temps médian
95e centile
Coût estimé par réponse
GLM 5.3
1,4 s
2,9 s
0,012 $
Mistral Large 4
4,7 s
19,2 s
0,005 $ au tarif de lancement, 0,011 $ au tarif plein
Mistral Large 4, raisonnement « high »
52,5 s
127,5 s
0,009 à 0,019 $
Mistral Large 3
3,8 s
9,0 s
0,0045 $
Bon à savoir
Avec une limite de réponse trop basse (1 200 tokens), GLM 5.3 renvoyait des réponses vides ; à 4 000 tokens, aucune réponse vide.
Mistral Large 4 n’accepte que les niveaux de raisonnement « none » et « high ». Le niveau « high » est beaucoup plus lent, sans être plus juste dans ce test.
Limites de ce test
Les questions pièges sont fabriquées.
Le test mesure la rédaction d’une réponse à partir d’extraits fixés, pas tout le parcours de l’outil.
Les juges sont des IA.
2 réponses attendues du banc étaient rattachées à la mauvaise zone ; la pénalité est la même pour tous les modèles.
Mistral Large 4 est en préversion ; ses poids ouverts sont annoncés pour le 27/10/2026.
Et PLU IA ?
PLU IA s’appuie sur des modèles servis par l’API de Mistral AI ; ce banc sert à choisir le modèle qui rédige nos réponses, et nous le referons à chaque nouvelle version. Lire le PLU de votre parcelle avec PLU IA.
Les résultats sont une aide à la lecture. Vérifiez la version du document, sa portée, les pièces complémentaires et les sources citées auprès de la commune ou de l’intercommunalité. Une information absente ne signifie pas qu’aucune contrainte ne s’applique. La synthèse ne remplace pas l’analyse d’un professionnel ni la décision de l’autorité compétente.
Questions fréquentes
Mistral Large 4 est-il fiable pour lire un PLU ?
Dans ce test, Mistral Large 4 n’a inventé aucune valeur et a refusé les 50 questions pièges, mais ses réponses étaient justes pour 54,4 % des 90 questions selon le juge 1 (84,2 % selon le juge 2). Il se classe derrière GLM 5.3 : vérifiez toujours la valeur dans le règlement cité.
Mistral Large 4 ou Mistral Large 3 pour l’urbanisme ?
Mistral Large 4 devance Mistral Large 3 pour les deux juges : 54,4 % contre 45,6 % de réponses justes selon le juge 1, 84,2 % contre 73,7 % selon le juge 2. Il fait pourtant moins bien que Large 3 sur 14 questions et il est plus lent (4,7 s contre 3,8 s en temps médian).
Une IA peut-elle inventer une règle de PLU ?
Oui, c’est possible : c’est pourquoi le test comptait 50 questions pièges, sur 25 zones fictives et 25 règles fictives. Dans ce test, aucun modèle n’a inventé de valeur réglementaire et tous ont refusé les 50 pièges.
Quel modèle utilise PLU IA ?
PLU IA s’appuie sur des modèles servis par l’API de Mistral AI ; ce banc sert à choisir le modèle qui rédige nos réponses, et nous le referons à chaque nouvelle version.