La fenêtre de contexte, expliquée simplement
La fenêtre de contexte, c'est la quantité d'information qu'un modèle peut « garder en tête » pendant une conversation. Elle se mesure en tokens (environ 0,75 mot par token en français).
| Ordre de grandeur | Tokens | Équivalent approximatif |
|---|---|---|
| Petit | ~128 000 | ~160 pages |
| Moyen | 200 000 | ~250 pages |
| Grand | 400 000 | ~500 pages |
| Très grand | 1 000 000+ | ~1 250 pages |
En pratique, pour la plupart des usages métier (rédiger un email, analyser un contrat, préparer un brief), 128 000 tokens suffisent largement. Les fenêtres de 400 000 à 1 million de tokens sont utiles pour analyser de très gros documents ou de longues conversations.
Quel modèle pour quel usage ?
Chaque profil Hermes (et chaque usage de Claude Code) est déjà configuré avec le modèle adapté à sa mission. Voici les six modèles réellement utilisés dans notre stack :
| Modèle | Rôle | Quand l'utiliser |
|---|---|---|
| DeepSeek V4 Flash | Modèle principal | Conversations, rédaction, code, raisonnement — le couteau suisse, défaut sur les profils utilisateurs |
| MiniMax M3 | Spécialiste agentic | Jobs automatisés, cron exigeants, workflows multi-tours qui doivent tenir la trajectoire |
| GLM-5.2 | Agentic haut de gamme | Workflows agentic exigeants où M3 plafonne, sans passer au tarif Sonnet — agentique quasi-frontier (78) à prix contenu |
| Claude Sonnet 5 | Premium qualité | Rédaction sensible, revue de code haut niveau, contenu client engageant — quand la qualité prime sur le coût |
| Claude Haiku 4.5 | Rapide | Tâches rapides, classification, extraction, réponses temps réel — le meilleur rapport qualité/vitesse d'Anthropic |
| gpt-oss-120b | Scraping léger | Extraction web, recherche simple, scraping, tâches en volume sans forte exigence de qualité |
Tarification
Prix via OpenRouter, en dollars par million de tokens. Le cached input s'applique aux portions de contexte déjà vues sur des requêtes précédentes — très intéressant en agentic où les instructions et le contexte sont répétés.
| Modèle | Input | Output | Cached input |
|---|---|---|---|
| DeepSeek V4 Flash | $0,0983 | $0,1966 | $0,0197 |
| MiniMax M3 | $0,30 | $1,20 | $0,06 |
| GLM-5.2 | $0,93 | $3,00 | $0,18 |
| Claude Sonnet 5 | $2,00 | $10,00 | $0,20 |
| Claude Haiku 4.5 | $1,00 | $5,00 | $0,0197 |
| gpt-oss-120b | $0,039 | $0,18 | — |
L'écart est massif : Claude Sonnet 5 coûte ~20× plus cher que DeepSeek V4 Flash en input et ~50× plus en output. C'est ce qui justifie le routage par usage — réserver Sonnet aux tâches où sa qualité fait la différence.
Benchmark comparatif
Trois axes pour comparer les modèles : Intelligence (raisonnement et connaissance générale), Coding (génération et compréhension de code), Agentic (capacité à enchaîner des tools et tenir une trajectoire sur plusieurs tours). DeepSeek V4 Flash est mis en avant — c'est le modèle principal du système.
Intelligence
Coding
Agentic
Scores Artificial Analysis (Intelligence Index v4.1, SciCode, Terminal-Bench v2.1) — une seule méthodologie, couverture complète. Les performances réelles varient selon la tâche. Comparer sur OpenRouter →Benchmark complet →
Lecture : Sonnet 5 domine les trois axes (agentic 81, coding 54, intelligence 53). Juste derrière, GLM-5.2 s'impose comme le meilleur agentic non-premium (78, quasi-frontier) pour une fraction du prix de Sonnet — l'option idéale pour de l'autonomie exigeante à budget maîtrisé. MiniMax M3 (agentic 65) et V4 Flash (62) restent très compétitifs et bien moins chers. Haiku 4.5 se tient au milieu (agentic 44, cache le plus avantageux à $0,0197). gpt-oss-120b décroche (agentic 26) mais reste imbattable en coût sur les tâches en volume. À noter : le coding est resserré (39-54) — presque tous écrivent du code correct ; c'est l'agentic qui départage vraiment.
Ce que OpenRouter change
Sans agrégateur, nous devrions multiplier les abonnements, gérer une clé API par fournisseur, et espérer que le bon modèle soit disponible au bon moment.
Avec OpenRouter, un point d'entrée unique donne accès à tous ces modèles. DeepSeek, MiniMax, Anthropic, OpenAI — un seul fournisseur, une seule facture, et la liberté de choisir le meilleur rapport qualité/prix pour chaque tâche.
C'est la différence entre gérer une flotte de véhicules et prendre un taxi à la demande.