28 juillet 2026 · 9 min · Julien Marceau
Recherche : orchestration multi-agent et qualité des décisions de conception
Protocole, métriques et résultats de nos essais internes comparant un agent unique à un studio de sept agents spécialisés.
Cette note de recherche documente un protocole interne visant à mesurer si la spécialisation d'agents améliore réellement la qualité d'un dossier de conception, ou si elle ne fait qu'allonger la délibération.
Protocole
Nous comparons deux configurations sur un même corpus de briefs produits : (A) un modèle unique répondant en une passe, (B) un orchestrateur pilotant six agents spécialisés (ingénierie, design, matériaux, fabrication, simulation, coût) suivi d'un arbitre chargé de résoudre les conflits.
- Corpus : 42 briefs produits internes, du mobilier technique au boîtier électronique.
- Contraintes dures imposées : budget unitaire, matériaux autorisés, délai de fabrication.
- Évaluation en aveugle par trois relecteurs (designer, ingénieur, décideur business).
Métriques
Quatre axes sont notés de 0 à 100 : fabricabilité, cohérence de la spécification, traçabilité des arbitrages, et respect des contraintes dures. La traçabilité mesure la proportion de décisions accompagnées d'une justification explicite et vérifiable.
Résultats observés
La configuration multi-agent produit systématiquement plus de conflits explicités — ce qui est l'effet recherché. Là où l'agent unique lisse les tensions coût/performance en une recommandation moyenne, le studio les expose sous forme d'options A/B/C avec impact attendu.
« Un désaccord visible entre agents vaut mieux qu'un consensus fabriqué par un seul modèle. »
Le gain le plus net porte sur la traçabilité : chaque arbitrage renvoie à la contrainte qui l'a motivé. Le coût est un temps de génération plus long et une consommation de tokens supérieure, à mettre en regard du temps de relecture humaine économisé.
Limites
- Corpus interne, non public : les résultats ne sont pas encore reproductibles à l'extérieur.
- Évaluation humaine, donc sensible aux préférences des relecteurs malgré l'aveugle.
- Aucune validation physique : la fabricabilité reste estimée, pas prototypée.
Méthodologie complète et jeux de briefs anonymisés disponibles sur demande.
Références
- [1] Notes de protocole interne — NF-RP-2026-04
- [2] Grille d'évaluation en aveugle (v3)
Articles similaires
Engineering · 7 min
Anatomie d'une délibération d'agents
Rounds, désaccords, convergences : ce qu'on voit vraiment dans les logs.
Pourquoi : 3 tags en commun (multi-agent, orchestration, traçabilité) · score 30
Product · 6 min
Pourquoi un seul LLM ne conçoit pas un produit
Un chatbot répond. Un studio délibère. On explique pourquoi la spécialisation multi-agent change tout.
Pourquoi : 2 tags en commun (multi-agent, orchestration) · score 20
Recherche · 8 min
Recherche : un modèle de scoring de fabricabilité en quatre couches
Comment nous convertissons tolérances, procédés, géométrie et volume en un score comparable entre variantes.
Pourquoi : 1 tag en commun (méthodologie) · même catégorie (Recherche) · score 13