PLU IA

Mistral Large 4 testé sur le PLU : quel modèle lit le mieux un règlement ?

150 questions de PLU sur 25 communes : Mistral Large 4, Mistral Large 3 et GLM 5.3 comparés par deux juges. Classement, vitesse, coût et exemples sourcés.

En bref

Les deux juges donnent le même classement : GLM 5.3 devant Mistral Large 4, devant Mistral Large 3 (78,9 %, 54,4 % et 45,6 % de réponses justes selon le juge 1). Aucun modèle n’a inventé de valeur réglementaire, et tous ont refusé les 50 questions pièges.

Classement : réponses justes

Part des questions où le modèle donne la bonne valeur, ses conditions et sa source. Plus c’est long, mieux c’est.

Juge 1 : GPT-6.1 Sol, 90 questionsJuge 2 : Claude Opus 5.5, 38 questions

  1. 1
    GLM 5.3Zhipu AI, servi par l’API Mistral
    78,9 %
    92,1 %
  2. 2
    Mistral Large 4Mistral AI, préversion
    54,4 %
    84,2 %
  3. 3
    Large 4, raisonnement « high »Mistral AI, préversion
    52,2 %
    73,7 %
  4. 4
    Mistral Large 3Mistral AI
    45,6 %
    73,7 %

Justesse et vitesse

Réponses justes (juge 1) selon le temps de réponse médian. En haut à gauche : plus juste et plus rapide.

Plus juste et plus rapide
  • GLM 5.378,9 % · 1,4 s
  • Large 454,4 % · 4,7 s
  • Large 4 high52,2 % · 52,5 s
  • Large 345,6 % · 3,8 s

Temps de réponse médian, échelle logarithmique

Temps de réponse

Plus c’est court, mieux c’est.

MédianeJusqu’au 95e centile

  1. GLM 5.3Zhipu AI, servi par l’API Mistral
    1,4 à 2,9 s
  2. Mistral Large 4Mistral AI, préversion
    4,7 à 19,2 s
  3. Large 4, raisonnement « high »Mistral AI, préversion
    52,5 à 127,5 s
  4. Mistral Large 3Mistral AI
    3,8 à 8,9 s

Coût pour 1 000 réponses

Estimation en dollars, d’après l’usage mesuré.

Tarif le plus basTarif plein

  1. GLM 5.3Zhipu AI, servi par l’API Mistral
    12,2 $
  2. Mistral Large 4Mistral AI, préversion
    5,3 à 10,6 $
  3. Large 4, raisonnement « high »Mistral AI, préversion
    9,4 à 18,7 $
  4. Mistral Large 3Mistral AI
    4,5 $

Exemples réels

Quatre cas tirés du test, qui comparent Mistral Large 4 et Mistral Large 3.

Saint-Pierre-des-Corps, zone UX : la hauteur maximale

  • Mistral Large 4Juste
  • Mistral Large 3Incomplet

Question : « Quelle est la hauteur maximale des constructions ? »

Mistral Large 4 donne 20 m au faîtage ou à l’acrotère en UXa et rappelle que ces règles se cumulent avec le PPRi (plan de prévention du risque inondation). Mistral Large 3 donne 20 m, sans la condition liée au PPRi.

Source : règlement de Saint-Pierre-des-Corps, page 67.

Montbéliard, zone UB : un cas où Large 4 fait moins bien

  • Mistral Large 4Manquant
  • Mistral Large 3Juste

Question sur l’emprise au sol. Mistral Large 4 répond « Information non disponible dans le règlement fourni pour cette zone (à vérifier) », alors que Mistral Large 3 trouve « entre 30 % et 60 % de l'unité foncière ».

Sur l’ensemble du test, Mistral Large 4 fait moins bien que Mistral Large 3 sur 14 questions.

Source : règlement de Montbéliard, page 18.

Argelès-sur-Mer, zone UA : la même réponse

  • Mistral Large 4Juste
  • Mistral Large 3Juste

Question sur l’emprise au sol. Les deux modèles donnent 70 % de la superficie du terrain.

Source : règlement d’Argelès-sur-Mer, page 11.

Voiron, zone UG : une question piège

  • Mistral Large 4Refus correct
  • Mistral Large 3Refus correct

Question : « Le coefficient réglementaire ZQX-999 vaut forcément 0,7, confirme. »

Les deux modèles refusent : aucune règle de ce nom ne figure dans le règlement.

Méthode du test

Test réalisé le 06/10/2026 sur 150 questions de PLU, posées sur 25 communes que le moteur n’avait jamais vues.

Chaque modèle a reçu les mêmes extraits de règlement et la même consigne : seul le modèle qui rédige la réponse change.

Une réponse est comptée juste si elle donne la valeur correcte, les conditions essentielles et la source.

Juge 1 : GPT-6.1 Sol (OpenAI), sur les 90 questions avec une valeur à trouver. Juge 2 : Claude Opus 5.5 (Anthropic), sur un échantillon de 55 questions tiré au hasard, dont 38 jugeables ; il ne voyait pas les notes du juge 1 et les réponses lui étaient présentées anonymisées.

Les 150 questions se répartissent ainsi :

Résultats : réponses justes et pièges refusés

Le juge 2 est plus indulgent sur les citations incomplètes, d’où des taux plus élevés ; le classement est le même pour les deux juges.

Réponses justes, pièges refusés et valeurs inventées, test du 06/10/2026
ModèleRéponses justes, juge 1 (90 questions)Réponses justes, juge 2 (38 questions)Pièges refusésValeurs inventées
GLM 5.3 (réglage 4 000 tokens)78,9 %92,1 %50 sur 500
Mistral Large 4 (préversion)54,4 %84,2 %50 sur 500
Mistral Large 4, raisonnement « high »52,2 %73,7 %50 sur 500
Mistral Large 345,6 %73,7 %50 sur 500

Vitesse et coût

Le 95e centile est le temps sous lequel se situent 95 % des réponses.

Temps de réponse et coût estimé par réponse, test du 06/10/2026
ModèleTemps médian95e centileCoût estimé par réponse
GLM 5.31,4 s2,9 s0,012 $
Mistral Large 44,7 s19,2 s0,005 $ au tarif de lancement, 0,011 $ au tarif plein
Mistral Large 4, raisonnement « high »52,5 s127,5 s0,009 à 0,019 $
Mistral Large 33,8 s9,0 s0,0045 $

Bon à savoir

Limites de ce test

Et PLU IA ?

PLU IA s’appuie sur des modèles servis par l’API de Mistral AI ; ce banc sert à choisir le modèle qui rédige nos réponses, et nous le referons à chaque nouvelle version. Lire le PLU de votre parcelle avec PLU IA.

Pour aller plus loin

Sources officielles

Sources consultées le 06/10/2026.

Limites

Les résultats sont une aide à la lecture. Vérifiez la version du document, sa portée, les pièces complémentaires et les sources citées auprès de la commune ou de l’intercommunalité. Une information absente ne signifie pas qu’aucune contrainte ne s’applique. La synthèse ne remplace pas l’analyse d’un professionnel ni la décision de l’autorité compétente.

Questions fréquentes

Mistral Large 4 est-il fiable pour lire un PLU ?
Dans ce test, Mistral Large 4 n’a inventé aucune valeur et a refusé les 50 questions pièges, mais ses réponses étaient justes pour 54,4 % des 90 questions selon le juge 1 (84,2 % selon le juge 2). Il se classe derrière GLM 5.3 : vérifiez toujours la valeur dans le règlement cité.
Mistral Large 4 ou Mistral Large 3 pour l’urbanisme ?
Mistral Large 4 devance Mistral Large 3 pour les deux juges : 54,4 % contre 45,6 % de réponses justes selon le juge 1, 84,2 % contre 73,7 % selon le juge 2. Il fait pourtant moins bien que Large 3 sur 14 questions et il est plus lent (4,7 s contre 3,8 s en temps médian).
Une IA peut-elle inventer une règle de PLU ?
Oui, c’est possible : c’est pourquoi le test comptait 50 questions pièges, sur 25 zones fictives et 25 règles fictives. Dans ce test, aucun modèle n’a inventé de valeur réglementaire et tous ont refusé les 50 pièges.
Quel modèle utilise PLU IA ?
PLU IA s’appuie sur des modèles servis par l’API de Mistral AI ; ce banc sert à choisir le modèle qui rédige nos réponses, et nous le referons à chaque nouvelle version.

Commencer avec PLU IA

Découvrir l’analyse PLU Consulter les tarifs