Pilote de délibération — 10 décisions vérifiées en production
Publié le 17 septembre 2026. Toutes les mesures qui suivent viennent de la production oroni.fr, sceau de release fa0dd966.
En un coup d'œil
| Délibérations exécutées | 10 / 10 |
|---|---|
| Coût total observé | 0,0359 € |
| Coût moyen par délibération | 0,0036 € |
| Seuil budgétaire fixé | 0,50 € |
| Marge sous le plafond | × 138 |
| Désaccords quantifiés par délibération | 6 à 22 points |
| Panel réel | mistralai/mistral-large-2512 + z-ai/glm-5.3-flash, via OpenRouter |
| Durée par délibération | 23 s à 112 s selon le mode |
Pourquoi nous publions ces chiffres
Avant de proposer notre outil de délibération à des clients, nous l'avons utilisé sur nos propres décisions produit. Dix questions internes, tranchées avec le même outil que nous mettons en production.
L'objectif : mesurer trois choses simples.
- Le coût réel d'une délibération complète, panel hétérogène, en euros observés (pas modélisés).
- La qualité des désaccords entre modèles — une délibération sans désaccord n'apprend rien.
- L'actionnabilité de la recommandation finale — trancher, pas juste résumer.
Nous publions le résultat parce que le principe fondateur d'ORONI est simple : vous devez pouvoir vérifier ce que nous affirmons.
Comment se lit une délibération
Chaque délibération produit trois blocs, dans cet ordre :
- Consensus. Les points sur lesquels tous les modèles du panel convergent, formulés en langage direct.
- Désaccords. Les axes non résolus au terme du débat, chacun étayé par un argument opposant nommé et une conséquence chiffrable ou observable.
- Recommandation. Une option tranchée, avec la justification et — si pertinent — les modalités pratiques de mise en œuvre.
Un point non négociable : une délibération sans désaccords non vides est écartée. Le silence n'est pas de la sagesse, c'est un biais.
Les 10 délibérations mesurées
Deux modes ont été employés :
- light — 2 tours de débat, panel de 2 modèles, ~25–35 s, ~0,003 €.
- full — 3 tours de débat, panel de 2 modèles, 50–112 s, ~0,006 €.
| # | Mode | Coût | Durée |
|---|---|---|---|
| 01 | light | 0,003 € | 24,4 s |
| 02 | light | 0,0029 € | 33,4 s |
| 03 | light | 0,0032 € | 37,7 s |
| 04 | light | 0,0027 € | 28,5 s |
| 05 | light | 0,0028 € | 27,2 s |
| 06 | full | 0,0062 € | 111,6 s |
| 07 | light | 0,0029 € | 23,3 s |
| 08 | light | 0,0031 € | 31,4 s |
| 09 | light | 0,0027 € | 29,3 s |
| 10 | full | 0,0064 € | 51,4 s |
Les sujets traités couvraient cinq familles internes : sécurité et accès dirigeants, portabilité et anti-lock-in, priorisation de la feuille de route produit, ergonomie de l'agent (mémoire, résumé de mission, langue), et méta (dans quels cas déclencher une délibération, comment mesurer qu'elle a servi à quelqu'un). Les questions précises restent internes.
Deux illustrations, en résumé neutre
Illustration A — Faut-il déclencher une délibération automatiquement, ou seulement à la demande ?
Délibération n°6, mode full, 111,6 s, 0,0062 €.
- Consensus — Personne ne défend qu'un agent tranche seul un cas de flou stratégique ; la chaîne de responsabilité humaine ne se coupe pas.
- Désaccord principal — Automatiser dès qu'un seuil d'incertitude est franchi, ou n'agir que sur demande explicite ? Chaque option a un coût vérifiable : latence contre dépendance passive.
- Sortie utilisable — Une recommandation tranchée, assortie de conditions d'application. L'arbitrage final revient au dirigeant qui l'a demandée.
Illustration B — Qui juge qu'une délibération a « servi » ?
Délibération n°10, mode full, 51,4 s, 0,0064 €.
- Consensus — L'apprentissage d'un dirigeant ne peut pas être auto-déclaré. La restitution à un tiers (« le test du menteur ») est un indicateur plus solide que le ressenti.
- Désaccord principal — Faut-il un seuil quantitatif minimal de désaccords, ou une exigence purement qualitative ? Un seul désaccord profond peut suffire ; ou pas.
- Sortie utilisable — Un protocole hybride en 3 étapes, subjectif + objectif, validé en externe.
Les recommandations opérationnelles issues de ces deux délibérations sont archivées en interne ; elles nourrissent les prochaines cérémonies produit.
Ce que ces chiffres prouvent
- Le plafond ferme n'est pas une promesse marketing. Sur 10 exécutions, la marge sous le seuil budgétaire est de facteur 138. Le mécanisme de plafond a fonctionné dans 100 % des cas.
- Le coût unitaire d'une délibération de raisonnement est ordre-de-grandeur inférieur à 1 centime. C'est le coût technique interne du panel de modèles, pas le prix facturé par mission client.
- Les désaccords sont réels et quantifiés. Aucune délibération n'a produit un consensus vide. Le nombre de points de désaccord identifiés varie entre 6 et 22 selon le sujet.
Ce que ces chiffres NE prouvent PAS
- Aucune mission client externe n'a encore été mesurée sur ce protocole. Les 10 délibérations sont internes.
- Le critère « le dirigeant a appris quelque chose » (seuil ≥ 7/10) attend une évaluation dirigeant formelle. Il n'est pas encore validé.
- Le coût de mission client (matière produite, actions exécutées, outils utilisés) est différent du coût de délibération. Il sera publié séparément à l'ouverture du pilote élargi.
Sources et preuves
- Environnement d'exécution : production oroni.fr, release r29-unified-production-candidate.1-04e2b14, sceau fa0dd966, 14/14 preuves de conformité passées avant scellement.
- Contrôle isolé : exécution sur le conteneur de production, sans modification du service actif.
- Panel :
mistralai/mistral-large-2512(Mistral) etz-ai/glm-5.3-flash(Zhipu), via OpenRouter, panel hétérogène volontaire. - Archive des preuves : dépôt de scellement et artefacts d'exécution conservés sur l'infrastructure de production ORONI.
Une requête auditive circonstanciée (juriste, DSI, RSSI d'un pilote signé) peut donner lieu à une revue supervisée de ces preuves. Nous contacter à pdg@oroni.fr.