3 min de lecture

Benchmark complet

Les modèles OpenRouter courants comparés sur les trois mêmes axes, avec le prix réel et une note de valeur. Une seule méthodologie, couverture complète — aucun trou.

Cette page élargit le comparatif de la page précédente : au-delà des cinq modèles de la stack, on situe l'ensemble des modèles courants du marché, mesurés de façon strictement comparable.

Une seule source. Les trois axes viennent tous d'Artificial Analysis, qui évalue chaque modèle avec la même méthodologie. Mélanger des classements différents crée des trous et des chiffres non comparables — ici chaque case est remplie, sur la même échelle.

Intelligence — raisonnement et connaissances (indice composite de 9 évaluations). Coding — écrire du code correct (SciCode) ; cet axe sature en haut, presque tous les bons modèles s'y valent. Agentic — agir seul en plusieurs étapes, outils et terminal (Terminal-Bench) ; c'est l'axe le plus discriminant, décisif dès qu'un modèle travaille en autonomie.

Valeur = Intelligence ÷ prix mixte (points d'intelligence par dollar) — le tri par défaut du tableau. Un modèle « bon marché et capable » remonte ; un modèle « cher pour ce qu'il fait » descend. Prix mixte = (3×input + output)/4, car un appel coûte surtout en tokens d'entrée. Clique une colonne pour trier selon ton critère.
Modèle $/M in $/M out $/M mixte Intel Coding Agentic Valeur
valeur exceptionnelle très bonne correcte chère premium Intel /100 · Coding & Agentic en %

Choisir selon le profil d'usage

Le bon modèle dépend de deux questions : quel volume d'appels (le prix pèse-t-il ?) et quel niveau d'autonomie (agentic).

ProfilConseilléPourquoi
Volume élevé · agent autonomeDeepSeek V4 FlashAgentic 62 au tarif plancher ($0.11/M mixte). Quand on enchaîne des milliers d'appels, le coût total domine — imbattable ici. C'est le défaut de la stack.
Sweet-spot qualité / prixGLM-5.2Agentic 78, quasi frontier (Opus 85, GPT-5.5 84), sans le tarif premium. Le pas au-dessus quand l'entrée de gamme bute sur du dur.
Milieu de gamme équilibréDeepSeek V4 ProHonnête sur les trois axes (Code 50, Agent 64) pour $0.54/M. L'intermédiaire logique.
Tâches critiques · budget secondaireOpus 4.8 · GPT-5.5Le sommet en agentic (85 / 84) et en coding. À réserver aux cas où une erreur coûte plus cher que les tokens.
Sources & reproductibilité. Prix : OpenRouter API. Scores : Artificial Analysis (Intelligence Index v4.1, SciCode, Terminal-Bench v2.1). Les deux sont publics et mis à jour en continu. Données au 01/07/2026 — rejouer le croisement avec les valeurs du jour pour actualiser.