Entonnoir UNIVERSE → ACTIVE
Sans perte d'information : sortir d'un etage ne supprime jamais un modele, il reste visible a l'etage superieur et garde son historique.
Modes de ligne
Un meme modele a des couts, latences, quotas et performances differents selon la route. Les lignes mock-a1 et mock-a2 de la table ci-dessus sont le meme modele sur deux routes : les fusionner fabriquerait un faux.
Global filter bar — 23 filtres
Presente sur toutes les vues. Chaque filtre declare ce qu'il fait des lignes dont la valeur est inconnue : un filtre ne fait jamais disparaitre en silence ce qu'il ne sait pas.
Vue partageable : ?accessible=1&lifecycle=ACTIVE|PREVIEW&min_sample=30&period=7d&workload=coding.refactor
1 — MARKET · table du marche
66 colonnes definies en 8 groupes ; 23 visibles par defaut. Grain : Execution Profile.
valeur connue · — UNKNOWN (survol : la raison) · n/a UNAVAILABLE. Les trois sont distincts : un quota inconnu n'est pas un quota vide.
| Identity | Technical | External Evidence | HERMES | Efficiency | Runtime | Access | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Lab / Provider | Family | Version | Lifecycle | Execution profile | Context | Tool calling | Local compatible | Evidence freshness | Conflits | Category success | Accepted-result rate | N | Last test | Validation status | Cout / resultat accepte | p95 | 429 rate | Provider health | Accessible | Route | Quota pool | Quota restant | |
| ⓘ | MockLab Atlas | Atlas-3 | atlas-3-sonnet-20260801 | ACTIVE | Atlas-3 Sonnet · api · tools | 200k tok | oui | non | 12 j | 0 | 91% | 84% | 142 | 1789740800.00 | HERMES_MEASURED | 0.03 $ | 4.1 s | 0% | OK | oui | api-direct | atlas-team-monthly | 418 000 |
| ⓘ | MockLab Atlas | Atlas-3 | atlas-3-sonnet-20260801 | ACTIVE | Atlas-3 Sonnet · gateway · tools | 200k tok | oui | non | 12 j | 0 | 89% | 81% | 76 | 1789568000.00 | HERMES_MEASURED | 0.05 $ | 6.8 s | 3% | DEGRADED | oui | gateway-tiers | gateway-shared-credits | — |
| ⓘ | MockLab Borealis | Borealis-2 | borealis-2-turbo | ACTIVE | Borealis-2 Turbo · api | 128k tok | oui | non | 21 j | 0 | 78% | 69% | 54 | 1789222400.00 | HERMES_MEASURED | 0.01 $ | 2.4 s | 0% | OK | oui | api-direct | borealis-subscription | — |
| ⓘ | MockLab Cirrus | Cirrus-1 | cirrus-1-mini | PREVIEW | Cirrus-1 Mini · api | 64k tok | non | non | 4 j | 0 | 100% | 100% | 4 | 1789913600.00 | HERMES_MEASURED | 0.00 $ | 900 ms | 0% | OK | oui | api-direct | cirrus-preview | 1 000 |
| ⓘ | MockLab Drakon | Drakon-4 | drakon-4-20251120 | LEGACY | Drakon-4 · api · reasoning high | 256k tok | oui | non | 214 j | 0 | 86% | 80% | 61 | 1771510400.00 | HERMES_MEASURED | 0.05 $ | 11.5 s | 1% | OK | oui | api-direct | drakon-legacy | 22 000 |
| ⓘ | MockLab Eos | Eos-2 | eos-2-pro | ACTIVE | Eos-2 Pro · api | 400k tok | oui | non | 6 j | 2 | 58% | 49% | 88 | 1789827200.00 | HERMES_MEASURED | 0.08 $ | 9.2 s | 0% | OK | oui | api-direct | eos-team | 95 000 |
| ⓘ | MockLab Fenix | Fenix-Open | fenix-open-70b | ACTIVE | Fenix-Open-70B · mlx · Q4 · Mac Studio | 131k tok | — | oui | 30 j | 0 | — | — | — | — | DECLARED | — | — | — | — | n/a | local-macstudio | n/a | n/a |
| ⓘ | MockLab Gale | Gale-1 | gale-1-20250310 | DEPRECATED | Gale-1 · api (deprecated) | 32k tok | oui | non | 45 j | 0 | 71% | 62% | 310 | 1788444800.00 | HERMES_VALIDATED | 0.01 $ | 1.8 s | 0% | OK | oui | api-direct | gale-legacy | 4 200 |
Interactions
- sort_multi — Tri multi-colonnes, ordre des cles visible et partageable
- freeze — Freeze des colonnes d'identite : lab, family, version, profile_label
- group_by — Group by : lab, family, lifecycle, engine, accessible, route, quota_pool
- compare — Comparer 2 a 10 lignes selectionnees (critere d'acceptation §26.4)
- pin — Epingler une ligne en haut de la table (ecrit)
- add_to_portfolio — Ajouter au portfolio — action utilisateur, pas production (ecrit)
- open_evidence — Ouvrir la vue de preuves de la cellule
- request_benchmark — Demander un benchmark cible — ecrit une file, ne lance aucun appel depuis l'UI (ecrit)
- show_history — Historique de la ligne : prix, contexte, score, lifecycle
2 — LEADERBOARDS · contrat de classement
Categorie Coding, classe par quality. Un classement global sans categorie est refuse par le code (CategoryRequired). Categories disponibles : Coding, Debugging, Code Review, Repo Scanning, Agentic/Tool Use, Research, Long-context, Reasoning, Math, Extraction, Summarization, Translation, Vision, Structured Output, Speed, Cost Efficiency, Token Efficiency, Quota Efficiency, Reliability, Local Mac Studio, Local Mac mini, Overall HERMES Fit.
Composite optionnel, poids affiches : Coding Interactive v1.0.0 = quality 45% + reliability 20% + latency 15% + cost 10% + token_efficiency 10% — un axe inconnu rend le composite inconnu, jamais zero. Les colonnes affichent les valeurs brutes ; le composite est calcule sur des axes normalises (min-max sur le lot compare (normalize_lot/1.0.0)).
| # | Profil | Qualite du rang | quality | N | cout/accepte | p95 | composite | Pourquoi ce rang |
|---|---|---|---|---|---|---|---|---|
| 1 | Atlas-3 Sonnet · api | HERMES | 84% | 142 | 0.03 $ | 4.1 s | 0.67 | toutes les conditions §9 reunies |
| 2 | Atlas-3 Sonnet · gateway | HERMES | 81% | 76 | 0.05 $ | 6.8 s | 0.45 | toutes les conditions §9 reunies |
| 3 | Borealis-2 Turbo | HERMES | 69% | 54 | 0.01 $ | 2.4 s | 0.57 | toutes les conditions §9 reunies |
| 4 | Drakon-4 | provisoire | 80% | 61 | 0.05 $ | 11.5 s | 0.36 | preuve perimee : 214 j > 30 j pour une source S1 |
| 5 | Gale-1 (deprecated) | provisoire | 62% | 310 | 0.01 $ | 1.8 s | 0.57 | protocole 'hermes-bench/v2' != protocole du lot 'hermes-bench/v3' — non comparable ; eval 'jev/1.4' != 'jev/2.1' du lot |
| 6 | Eos-2 Pro | provisoire | 49% | 88 | 0.08 $ | 9.2 s | 0.13 | conflit de preuves non resolu |
| — | Cirrus-1 Mini | preuve insuffisante | 100% | 4 | 0.00 $ | 900 ms | 1.00 | N=4 < 10 (plancher de classement) |
| — | Fenix-Open-70B · Mac Studio | preuve insuffisante | — | — | — | — | — | quality inconnu et aucune preuve externe — non classable |
Les profils non classables restent visibles avec rank = — et leur raison. Aucun candidat n'est silencieusement ecarte.
Ce qui manque encore, et ce qui est interdit
Objets du data contract a construire (5)
- BenchmarkDefinition — EVIDENCE — sans elle, deux scores ne sont pas comparables
- UsageAggregate — HERMES_USAGE — agregat de telemetrie, brique DASH-3
- Portfolio — PORTFOLIOS — listes manuelles et smartlists, brique DASH-2
- Alert — ALERTS — objet d'alerte avec severite et acquittement, brique DASH-6
- MarketEvent — LIFECYCLE / CONTROL_TOWER — flux des changements du marche
Interdits structurels, opposables a DASH-1..9
- un Top 10 global sans categorie
- melanger ModelVersion et ExecutionProfile sur la meme ligne
- confondre adoption externe (popularite) et qualite
- comparer des tokens bruts entre task families differentes
- masquer la taille d'echantillon ou la fraicheur d'un score
- afficher UNKNOWN comme 0, vide, null ou tiret indistinct
- laisser un score composite opaque devenir la verite
- afficher un secret, une cle ou un token dans l'UI, l'API ou les logs
- coupler la disponibilite du Router a celle du dashboard
- ajouter une base de donnees avant l'inventaire LOT-0