Journal
Recherche

28 juillet 2026 · 9 min · Julien Marceau

Recherche : orchestration multi-agent et qualité des décisions de conception

Protocole, métriques et résultats de nos essais internes comparant un agent unique à un studio de sept agents spécialisés.

Cette note de recherche documente un protocole interne visant à mesurer si la spécialisation d'agents améliore réellement la qualité d'un dossier de conception, ou si elle ne fait qu'allonger la délibération.

Protocole

Nous comparons deux configurations sur un même corpus de briefs produits : (A) un modèle unique répondant en une passe, (B) un orchestrateur pilotant six agents spécialisés (ingénierie, design, matériaux, fabrication, simulation, coût) suivi d'un arbitre chargé de résoudre les conflits.

  • Corpus : 42 briefs produits internes, du mobilier technique au boîtier électronique.
  • Contraintes dures imposées : budget unitaire, matériaux autorisés, délai de fabrication.
  • Évaluation en aveugle par trois relecteurs (designer, ingénieur, décideur business).

Métriques

Quatre axes sont notés de 0 à 100 : fabricabilité, cohérence de la spécification, traçabilité des arbitrages, et respect des contraintes dures. La traçabilité mesure la proportion de décisions accompagnées d'une justification explicite et vérifiable.

Résultats observés

La configuration multi-agent produit systématiquement plus de conflits explicités — ce qui est l'effet recherché. Là où l'agent unique lisse les tensions coût/performance en une recommandation moyenne, le studio les expose sous forme d'options A/B/C avec impact attendu.

« Un désaccord visible entre agents vaut mieux qu'un consensus fabriqué par un seul modèle. »

Le gain le plus net porte sur la traçabilité : chaque arbitrage renvoie à la contrainte qui l'a motivé. Le coût est un temps de génération plus long et une consommation de tokens supérieure, à mettre en regard du temps de relecture humaine économisé.

Limites

  • Corpus interne, non public : les résultats ne sont pas encore reproductibles à l'extérieur.
  • Évaluation humaine, donc sensible aux préférences des relecteurs malgré l'aveugle.
  • Aucune validation physique : la fabricabilité reste estimée, pas prototypée.

Méthodologie complète et jeux de briefs anonymisés disponibles sur demande.

Références

  • [1] Notes de protocole interne — NF-RP-2026-04
  • [2] Grille d'évaluation en aveugle (v3)

Articles similaires