~/coding-agent-pricing

Coding Agent Pricing

Quel abonnement, quel modèle et quel effort de raisonnement choisir pour votre agent de code — et combien de temps dure votre quota.

Conçu pour les abonnements (Claude Pro/Max, ChatGPT Plus/Pro pour Codex, Google AI Pro/Ultra pour Antigravity, SuperGrok, Kimi, GLM Coding Plan), pas pour les clés API. Les prix API n'apparaissent que parce que les quotas s'usent proportionnellement à eux.

Données vérifiées le 28 septembre 2026 · 96 sources

Quoi utiliser, et quand

Choisissez ce que vous allez faire : vous obtenez le fournisseur, le modèle, l'effort de raisonnement et l'abonnement à utiliser, avec les preuves derrière ce choix.

Que voulez-vous faire ?

Code au quotidien

Fonctionnalités, corrections de bugs, revues, petits refactors — le travail de toute la journée.

  • Corriger un test qui échoue ou un bug signalé
  • Ajouter un endpoint, un formulaire, une option de CLI
  • Relire une pull request
  • Petit refactor sur quelques fichiers
Utiliser
Claude Opus 5.5· Anthropic
Effort
Moyen
Agent
Claude Code
Abonnement
Claude Pro (20 $) ou Max (100 $ / 200 $)

Comment travailler

  1. Pas besoin de plan si vous pouvez décrire la modification en une phrase ; sinon, appuyez sur Shift+Tab pour passer d'abord en mode plan.
  2. Restez en Medium (le défaut). Pour un bug tenace, montez avec /effort high, ou ajoutez ultrathink dans un seul prompt.
  3. Donnez à l'agent un moyen de se vérifier (tests, build, lint) et lancez /clear entre deux tâches sans rapport.
  4. Dans Codex : /model → GPT-6 Sol, effort High ; structurez le prompt en Objectif, Contexte, Contraintes, Critère de fin.

Pourquoi

  • Meilleure qualité par unité de quota : 51,2 à l'indice AA pour 1,34 $ par tâche, devant GPT-6 Astra en High (50,9 pour 1,73 $).
  • Sous-ensemble SWE-bench Pro d'Anthropic : 92,8 % résolus à 0,22 $ par tâche résolue, contre 92,3 % à 1,19 $ pour Fable 5.1 à son réglage par défaut.
  • C'est le modèle et l'effort par défaut de Claude Code depuis le 2026-09-22. Passez en High pour un bug difficile : +4 points sur Terminal-Bench 4.0 (52,5 % → 56,6 %) pour environ 27 % de quota en plus.

Alternatives

  • GPT-6 Sol · ÉlevéCodex · ChatGPT Plus (20 $) ou Pro (100 $ / 200 $)Codex sur ChatGPT Plus : DeepSWE 65,3 % à 0,64 $ par tâche — +8,6 points par rapport à Medium pour +0,26 $ ; Plus permet environ 15 à 150 messages Sol par 5 heures.
  • GLM-5.3 · MaxClaude Code or ZCode · GLM Coding Plan (18 $ / 80 $ / 168 $)Petit budget : GLM Coding Plan Lite (18 $/mois, 2 000 crédits par 5 heures) dans Claude Code ; DeepSWE 69,0 % en max.

Sources : Artificial Analysis model leaderboard · Optimizing for cost and intelligence · Model configuration · DeepSWE v1.1 leaderboard · Introducing GPT-6 Sol and Luna · Codex pricing · GLM Coding Plan

Pas rentable en ce moment

  • Claude Fable 5.1 — Dominé par Opus 5.5 sur tous les benchmarks indépendants, pour 2,5 à 5 fois le coût : indice AA 53,4 en Max pour 7,63 $ contre 53,6 pour 1,82 $ avec Opus 5.5 en High. Sur Max et Team Premium, il est aussi plafonné à 50 % de la limite hebdomadaire.
  • Claude Sonnet 5 — Opus 5.5 en Low bat Sonnet 5 en Max à l'indice AA (42,3 contre 38,2) pour un neuvième du coût (0,55 $ contre 5,09 $), et Opus 5.5 est désormais le modèle par défaut de Claude Code.
  • GPT-6 Astra · Max — Max paie rarement sur Astra : sur Terminal-Bench 4.0 et DeepSWE, Extra high fait aussi bien ou mieux (59,6 % contre 59,1 % ; 74,1 % contre 73,2 %) pour 30 à 40 % de moins.

Combien de temps vos abonnements vont-ils tenir ?

Indiquez vos abonnements et votre façon de travailler : vous obtenez les heures d'agent par fenêtre de 5 h et par semaine, et le moment où le quota sera épuisé.

Démarrage rapide
Vos abonnements
Votre façon de travailler
Heures d'agent par fenêtre de 5 h
2,3 h (1,2–18,1) Claude Pro
Heures d'agent par semaine (tous abonnements)
17,6 h (7,4–89,9)
Votre semaine
16,6 h / 30 h
Premier blocage : Lun 11:15

Quand le quota sera-t-il épuisé ?

Quota hebdomadaire restant sur l'ensemble de vos abonnements au fil de la semaine, pour les calibrages pessimiste, central et optimiste.

Hypothèses : les budgets sont des équivalents en dollars API mesurés par des tiers (aucun éditeur ne publie de quota absolu, sauf les crédits Z.ai) ; la consommation par heure active vient de l'AA Coding Agent Index ; l'effort change peu la consommation par heure (×0,67 en Low à ×1 en Max) mais beaucoup le coût par tâche. Pessimiste = petit budget et forte consommation ; optimiste = l'inverse. L'usage sans interface (claude -p) consomme la fenêtre de 5 h de Claude 1,5 à 2,3 fois plus vite.

Performance face à l'usure du quota

Chaque ligne représente un modèle à travers ses niveaux d'effort de raisonnement. Plus à gauche = la tâche consomme moins de quota ; plus haut = meilleur résultat. La fine ligne en escalier est la frontière efficace : aucune autre combinaison modèle × effort ne fait mieux pour moins cher.

Benchmark

IndépendantTâches agentiques en terminal exécutées par Artificial Analysis avec le même harnais pour tous les modèles, à chaque niveau d'effort.

Source mise à jour en continu · Récupéré le 28 sept. 2026

Mettre en avant des modèles (trait plus épais et étiquette ; utilisez la légende du graphique pour masquer des modèles)

Score selon le coût par tâche

Coût en équivalent API aux prix catalogue, échelle logarithmique — le même ratio que celui de l'usure des quotas d'abonnement.

Molette ou pincement pour zoomer (Maj + molette pour l'axe vertical), faites glisser le curseur, ou utilisez l'outil de zoom en haut à droite. Cliquez sur une entrée de la légende pour la masquer ou l'afficher.

17 résultats sans coût publié n'apparaissent que dans le graphique d'effort et le tableau.

Score selon l'effort de raisonnement

Là où la courbe s'aplatit, le niveau d'effort suivant coûte plus de quota pour un gain faible ou nul.

Afficher le tableau de données
ModèleEffortScoreCoût par tâche (USD, prix API catalogue)Frontière efficace
Claude Fable 5.1Faible40,4%7,32 $US
Claude Fable 5.1Moyen44,95%9,12 $US
Claude Fable 5.1Élevé52,02%11,64 $US
Claude Fable 5.1Très élevé55,05%15,78 $US
Claude Fable 5.1Max52,02%19,22 $US
Claude Opus 5.5Faible31,31%2,08 $US
Claude Opus 5.5Moyen52,53%4,04 $US✓
Claude Opus 5.5Élevé56,57%5,12 $US✓
Claude Opus 5.5Très élevé59,6%8,78 $US
Claude Opus 5.5Max59,6%13,11 $US
Claude Sonnet 5Faible2,53%2,66 $US
Claude Sonnet 5Moyen2,02%5,53 $US
Claude Sonnet 5Élevé5,05%9,4 $US
Claude Sonnet 5Très élevé7,07%12,8 $US
Claude Sonnet 5Max14,14%19,69 $US
Claude Haiku 4.5Élevé0%1,27 $US
GPT-6 AstraFaible41,92%2,25 $US✓
GPT-6 AstraMoyen49,49%4,43 $US
GPT-6 AstraÉlevé54,04%4,05 $US✓
GPT-6 AstraTrès élevé59,6%5,86 $US✓
GPT-6 AstraMax59,09%8,5 $US
GPT-6 SolSans réflexion13,13%1,94 $US
GPT-6 SolFaible9,09%0,49 $US
GPT-6 SolMoyen18,69%1,12 $US
GPT-6 SolÉlevé26,26%1,6 $US
GPT-6 SolTrès élevé30,3%1,91 $US
GPT-6 SolMax43,94%4 $US✓
GPT-6 LunaSans réflexion1,52%0,045 $US✓
GPT-6 LunaFaible0%0,005 $US✓
GPT-6 LunaMoyen2,53%0,072 $US✓
GPT-6 LunaÉlevé4,55%0,12 $US✓
GPT-6 LunaTrès élevé8,08%0,2 $US✓
GPT-6 LunaMax12,63%0,24 $US
Gemini 3.8 FlashFaible10,1%—
Gemini 3.8 FlashMoyen19,7%4,61 $US
Gemini 3.8 FlashÉlevé19,7%5,84 $US
Gemini 3.7 FlashÉlevé13,64%4,31 $US
Gemini 3.1 Pro (preview)Élevé4,04%4,15 $US
Grok 4.7Élevé24,75%8,95 $US
Grok 4.7Très élevé25,76%14,6 $US
Grok 4.6Faible3,03%2,45 $US
Grok 4.6Moyen13,13%6,7 $US
Grok 4.6Élevé21,21%7,51 $US
Grok 4.6Très élevé17,17%8,98 $US
Kimi K3Faible12,63%—
Kimi K3Max12,63%5,09 $US
GLM-5.3Faible34,85%6,4 $US
GLM-5.3Max41,92%8,06 $US
GLM-5.3-FlashMax32,83%0,79 $US
Qwen3 Coder NextSans réflexion0%2,83 $US
Qwen3.5 122B A10BÉlevé0%1,78 $US
Qwen3.5 397B A17BÉlevé0%2,6 $US
Qwen3.6 35B A3BÉlevé0%2,76 $US
Qwen3.7 PlusÉlevé1,01%1,27 $US
Qwen3.8 2.4T A95BÉlevé11,11%11,49 $US
Qwen3.8 27BSans réflexion0%9,39 $US
Qwen3.8 27BFaible2,53%6,14 $US
Qwen3.8 27BMoyen5,05%5,76 $US
Qwen3.8 27BTrès élevé5,56%3,94 $US
Qwen3.8 MaxÉlevé38,89%18,68 $US
Qwen3.8-Flash-NextÉlevé25,25%0,88 $US
Claude Fable 5Max42,42%34,91 $US
Claude Opus 4.8Max21,72%18,15 $US
Claude Opus 5Faible26,26%5,18 $US
Claude Opus 5Moyen34,34%9,18 $US
Claude Opus 5Élevé45,96%13,14 $US
Claude Opus 5Très élevé46,46%17,35 $US
Claude Opus 5Max48,99%19,29 $US
Claude Sonnet 4.6Max3,03%13,28 $US
Apodex 1.1Élevé0%2,05 $US
Trinity Large ThinkingÉlevé0,51%0,62 $US
Celeris-1Sans réflexion0%0,17 $US
Command A+Élevé0,51%0 $US
North Mini CodeÉlevé0,51%0 $US
DeepSeek V4 Flash 0731Max12,12%0,92 $US
DeepSeek V4 Flash VisionMax12,12%1,28 $US
DeepSeek V4 Pro 0813Max14,14%3,76 $US
DeepSeek V4.1 FlashSans réflexion5,56%1,06 $US
DeepSeek V4.1 FlashMax26,77%1,16 $US
Gemini 3.5 FlashÉlevé6,57%6,47 $US
Gemini 3.5 Flash-LiteÉlevé1,01%0,71 $US
Gemini 3.6 FlashÉlevé7,07%6,67 $US
Gemma 4 31BÉlevé0%—
Granite 4.2 3BÉlevé0%0,018 $US
Granite 4.2 8BÉlevé0%0,04 $US
Mercury 2.5Élevé0%0,82 $US
Ling 3.0 FlashÉlevé0%—
Ling 3.0 TinyÉlevé0%—
Ling-3.0-flash-FinÉlevé0%—
Ling-3.0-flash-VLÉlevé0%—
Ring-2.6-1TTrès élevé0,51%0,92 $US
K2 Horizon 0.9BÉlevé0%—
K2 Horizon 3.7BÉlevé0%—
K2 Horizon 375B A23BÉlevé1,52%—
K2 Horizon 7BÉlevé1,01%—
K2 Horizon MoVA 36B A4BÉlevé0%—
LongCat 2.0Élevé0%0,078 $US
Muse GlimmerÉlevé0,51%0,27 $US
Muse Spark 1.1Très élevé6,06%8,57 $US
Muse Spark 1.2Très élevé7,07%4,98 $US
Muse Spark 1.3Très élevé16,67%6,23 $US
Muse Spark 1.3Max33,33%6,94 $US
MiniMax-M3Élevé2,02%3,04 $US
Ministral 3 14BSans réflexion0%0,048 $US
Ministral 3 3BSans réflexion0%0,01 $US
Ministral 3 8BSans réflexion0%0,042 $US
Mistral Large 3Sans réflexion0%0,13 $US
Mistral Medium 3.5Élevé0%2,14 $US
Mistral Small 4Élevé0%0,048 $US
Kimi K2.6Élevé0,51%4,15 $US
Kimi K2.7 CodeÉlevé1,01%3,05 $US
Quasar 438BMax1,01%12,14 $US
NVIDIA Nemotron 3 Nano 30B A3BÉlevé0%0,012 $US
Nemotron 3 Super 120B A12BÉlevé0%2,07 $US
Nemotron 3 Ultra 550B A55BÉlevé0,51%3,06 $US
Nemotron 3.5 LightningÉlevé0,51%0,37 $US
GPT-5.5Moyen5,05%2,99 $US
GPT-5.5Élevé9,09%5,59 $US
GPT-5.5Très élevé14,65%11,56 $US
GPT-5.5 Instant (June 2026)Élevé12,63%3,8 $US
GPT-5.6 LunaSans réflexion1,01%0,016 $US✓
GPT-5.6 LunaFaible0%0,012 $US
GPT-5.6 LunaMoyen0,51%0,025 $US
GPT-5.6 LunaÉlevé2,53%0,11 $US
GPT-5.6 LunaTrès élevé3,54%0,3 $US
GPT-5.6 LunaMax11,62%0,85 $US
GPT-5.6 SolFaible1,01%0,52 $US
GPT-5.6 SolMoyen14,65%1,64 $US
GPT-5.6 SolÉlevé20,71%2,22 $US
GPT-5.6 SolTrès élevé24,75%3,46 $US
GPT-5.6 SolMax39,9%8,09 $US
GPT-5.6 TerraSans réflexion0,51%0,23 $US
GPT-5.6 TerraFaible1,52%0,24 $US
GPT-5.6 TerraMoyen1,01%0,34 $US
GPT-5.6 TerraÉlevé1,52%0,63 $US
GPT-5.6 TerraTrès élevé10,1%1,57 $US
GPT-5.6 TerraMax35,35%6,39 $US
gpt-oss-120bÉlevé0%0,064 $US
gpt-oss-20bÉlevé0%0,009 $US
MiniCPM5-2BÉlevé0%—
Step 5 PreviewÉlevé33,33%3,48 $US
Hy3Élevé0,51%0,41 $US
InklingTrès élevé1,01%—
Inkling SmallÉlevé1,01%—
Solar Pro 4Élevé0,51%—
Grok 4.5Élevé10,61%6,95 $US
MiMo-V2.5Élevé0%—
MiMo-V2.5-ProÉlevé0%0,24 $US
MiMo-V2.6-FlashÉlevé22,73%0,23 $US✓
MiMo-V2.6-ProÉlevé34,85%0,44 $US✓
GLM-5.2Max1,01%7,81 $US

Classements du code

Classements indépendants des agents de code et du développement web. Activez ou désactivez chaque classement ; faites défiler ou zoomez dans un graphique, et cliquez sur un fournisseur dans sa légende pour le masquer.

Classements à afficher

Artificial Analysis Coding Agent Index v1.5

Chaque agent de code avec le modèle de son éditeur (Claude Code, Codex, Grok Build, Kimi Code, Antigravity, OpenCode) sur DeepSWE, Terminal-Bench 4.0 et SWE-Atlas-QnA — l'indicateur le plus proche de ce qu'un abonnement vous donne.

Source mise à jour le 6 sept. 2026 · Récupéré le 28 sept. 2026 · 20 modèles

Couverture incomplète — ces données n'incluent pas Claude Sonnet 5. Des modèles importants actuels manquent : le classement présenté ici n'est donc pas entièrement pertinent.

Arena Code: WebDev

Votes humains à l'aveugle, par paires, sur des tâches de développement web (795 514 votes, arrêtés au 2026-09-25).

Source mise à jour le 25 sept. 2026 · Récupéré le 28 sept. 2026 · 134 modèles

Design Arena: agentic web app, full-stack

Deux agents construisent la même application full-stack (React, Supabase, déployée sur Vercel) dans un bac à sable avec 23 outils ; des personnes votent pour la meilleure.

Source mise à jour le 28 sept. 2026 · Récupéré le 28 sept. 2026 · 49 modèles

Couverture incomplète — ces données n'incluent pas Claude Opus 5.5, Grok 4.7, GLM-5.3. Des modèles importants actuels manquent : le classement présenté ici n'est donc pas entièrement pertinent.

Chiffres officiels de lancement

Ce que chaque éditeur a publié pour son propre modèle à sa sortie, avec l'effort utilisé. Chaque éditeur choisit son agent, son harnais et ses réglages : ces chiffres sont en général plus élevés que les mesures indépendantes. Servez-vous-en pour connaître les annonces de chacun, et des graphiques ci-dessus pour comparer.

ModelSWE-bench VerifiedSWE-bench ProTerminal-Bench 2.xTerminal-Bench 4.0DeepSWE v1.1FrontierCode 1.1
Claude Fable 5.1Anthropic—81,2%↗Max—55,8%↗Max—50,3%↗Max
Claude Opus 5.5Anthropic—89,9%↗Max—66,4%↗Très élevé74,2%↗Max54,4%↗Max
Claude Sonnet 5Anthropic85,2%↗Max63,2%↗Max80,4%↗Très élevé · 2.1———
Claude Haiku 4.5Anthropic73,3%↗—————
GPT-6 AstraOpenAI———57,88%↗Élevé74,12%↗Très élevé53,3%↗Max
GPT-6 SolOpenAI————68,81%↗Max49,27%↗Max
GPT-6 LunaOpenAI————66,59%↗Max42,42%↗Max
Gemini 3.8 FlashGoogle——89,4%↗Moyen · 2.119,1%↗73,7%↗Élevé—
Gemini 3.7 FlashGoogle——85,8%↗Moyen · 2.111,2%↗65,3%↗—
Gemini 3.1 Pro (preview)Google80,6%↗Élevé54,2%↗Élevé68,5%↗Élevé · 2.0———
Grok 4.7xAI———38%↗Très élevé71%↗Élevé—
Grok 4.6xAI———20,3%↗Élevé65,9%↗Élevé—
Kimi K3Moonshot AI——88,3%↗Max · 2.1—67,5%↗Max—
GLM-5.3Z.ai——88,2%↗Max · 2.1—66,9%↗Max—
GLM-5.3-FlashZ.ai——84,3%↗2.1—63,4%↗—

Distant ou local ?

Au-delà des six fournisseurs ci-dessus : les autres abonnements qui valent le coup, et quand faire tourner un modèle sur sa propre machine a du sens.

Les autres abonnements à connaître

AbonnementPrix / moisQuotaVerdict
GitHub Copilot↗↗$10 / $39 / $100Crédits en dollars aux prix API : 15 $ sur Pro, 70 $ sur Pro+, 200 $ sur Max ; complétions gratuites.à considérerDeuxième agent de code le plus utilisé (21 %) ; GPT-6, Opus 5.5, Fable 5.1, Gemini 3.8 Flash, Grok 4.7 et Kimi K3 dans VS Code, JetBrains et la CLI.
Alibaba Qwen Coding Plan↗↗↗$506 000 requêtes par 5 heures, 45 000 par semaine, 90 000 par mois.à considérerQuotas publiés ; Qwen3.8 Max est 6e d'Arena WebDev et à 43,3 à l'AA Coding Agent Index ; fonctionne dans Claude Code, Codex et OpenCode.
OpenCode Go↗$10Par 5 heures : Kimi K3 110 requêtes, Qwen3.8 Max 160, GLM-5.3 220, DeepSeek V4.1 Flash 26 000.à considérerLe moyen le moins cher d'utiliser les meilleurs modèles à poids ouverts dans un bon agent (OpenCode est le harnais utilisé par AA pour GLM).
MiniMax Token Plan↗↗↗$22 / $55 / $132Fenêtres de 5 heures et hebdomadaire, en tokens.à surveillerPlan clair et 47,2 % sur SWE-rebench, mais seulement 2,0 % sur Terminal-Bench 4.0 selon AA : à surveiller au prochain modèle.
Meta Muse Code↗↗$5 / $15 / $5010 à 50 prompts par 5 heures sur Everyday ; 5× et 20× au-dessus.de niche54,3 à l'AA Coding Agent Index (au-dessus de Kimi K3) pour un petit prix.
Xiaomi MiMo Token Plan↗↗$6 – $100Crédits, −20 % en heures creuses.de nicheTrès bon marché ; MiMo-V2.6-Pro atteint 34,8 % sur Terminal-Bench 4.0 selon AA.
Cursor↗$20 / $60 / $200Deux pools (modèles Cursor, autres modèles), tailles non publiées.de nicheUne surface IDE pour de nombreux modèles, dont Grok 4.7 et Composer 2.5.
Devin↗↗$20 / $200Non publié.de nicheDevin Fusion (Fable 5.1 + SWE-2) obtient 61,7 à l'AA Coding Agent Index.
Factory Droid↗$20 / $100 / $200Multiplicateurs par modèle (Opus 5.5 1,6×, GPT-6 Astra 4×).de nicheAgent multi-modèles avec des multiplicateurs explicites.
Mistral Vibe↗↗$14.99 / $24.99Non publié.de nicheOption européenne ; Mistral Medium 3.5 obtient 0 % sur Terminal-Bench 4.0 selon AA.

Faire tourner des modèles en local

Les modèles locaux forment une catégorie à part : ils ne consomment aucun quota, mais les meilleurs atteignent 5 à 33 % sur Terminal-Bench 4.0, contre environ 60 % pour les modèles de pointe. Associez un modèle local pour le travail de routine à un modèle distant de pointe pour les tâches difficiles.

MatérielModèle conseilléMémoireVitesse de générationQualité (indice AA · Terminal-Bench 4.0)
GPU 24 Go (RTX 4090 / 3090)Qwen3.8-27B Q4_K_M16.5 GB38–46 tok/sAA 33.7 · TB4 5.6%↗↗↗
GPU 32 Go (RTX 5090)Qwen3.8-27B Q6 / NVFP422–25 GB23–75 tok/s · MTP 98–134AA 33.7 · TB4 5.6%↗↗
128 Go de mémoire unifiée (Strix Halo, DGX Spark, M5 Max)Qwen3.8-Flash-Next IQ4_XS93.7 GB11–37 tok/s · MTP 47–84AA 39.8 · TB4 25.3%↗↗
256 Go de mémoire unifiée (M5 Ultra, M3 Ultra)GLM-5.3-Flash MLX 4-bit204 GB26–41 tok/sAA 41.8 · TB4 32.8%↗↗

Intéressant pour

  • Du code privé ou réglementé qui ne doit pas quitter la machine
  • Travailler hors ligne
  • Du matériel que vous possédez déjà
  • Du travail de routine en volume : boilerplate, tests, sous-agents
  • Une machine de 256 Go partagée par une équipe

Pas intéressant pour

  • Économiser par rapport à un abonnement à 20 $ (matériel et électricité : 10 à 270 $ par mois)
  • Les tâches agentiques difficiles : l'écart de qualité avec les modèles de pointe est grand

Références

Chaque chiffre de cette page vient de ces pages. Pour chacune : ce que nous y avons pris, et quand.

  1. Model Studio Coding PlanAlibaba CloudOfficielle

    Qwen Coding Plan Pro price and request quotas per 5 hours, week and month.

    Publiée le 11 sept. 2026 · Consultée le 28 sept. 2026

  2. CursorBench 3.2.0 and Terminal-Bench 4.0 score and cost at each effort level for Fable 5.1, Fable 5 and Mythos 5.1.

    Publiée le 1 sept. 2026 · Consultée le 28 sept. 2026

  3. Fable models use limits faster and are capped at 50% of the weekly limit on Max and Team Premium; credits only on Pro and Team Standard.

    Consultée le 28 sept. 2026

  4. Claude Opus 5.5AnthropicOfficielle

    Score and cost per task at each effort level for Opus 5.5, Fable 5.1 and Opus 5 on Terminal-Bench 4.0, FrontierCode v1.1 and CursorBench 4.0; five-hour limit change of 2026-09-22.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  5. Claude Opus 5.5 System CardAnthropicOfficielle

    Headline coding scores (SWE-bench Pro, Terminal-Bench 4.0 at xhigh and max, DeepSWE v1.1, CursorBench 4.0) versus Opus 5, Fable 5.1 and GPT-6 Astra.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  6. Claude pricingAnthropicOfficielle

    Prices of Free, Pro, Max 5x, Max 20x, Team and Enterprise plans and what each includes.

    Consultée le 28 sept. 2026

  7. Claude Sonnet 5 System CardAnthropicOfficielle

    Headline coding scores of Sonnet 5 at max effort (SWE-bench Verified, SWE-bench Pro, Terminal-Bench 2.1).

    Publiée le 30 juin 2026 · Consultée le 28 sept. 2026

  8. EffortAnthropicOfficielle

    Effort levels available per model and when to use each (xhigh for agentic coding over 30 minutes, low for subagents).

    Consultée le 28 sept. 2026

  9. Five-hour session and weekly limits; no fixed message count; what drives consumption (model, effort, length, tools).

    Consultée le 28 sept. 2026

  10. Introducing Claude Haiku 4.5AnthropicOfficielle

    SWE-bench Verified score of Haiku 4.5.

    Publiée le 15 oct. 2025 · Consultée le 28 sept. 2026

  11. Introducing Claude Sonnet 5AnthropicOfficielle

    Release date, positioning and headline coding scores of Sonnet 5.

    Publiée le 30 juin 2026 · Consultée le 28 sept. 2026

  12. Model configurationAnthropicOfficielle

    Default model (Opus 5.5 on every plan since v2.1.280) and default effort per model in Claude Code.

    Consultée le 28 sept. 2026

  13. Models overviewAnthropicOfficielle

    Model IDs, release dates, context windows, max output and status of every current Claude model.

    Consultée le 28 sept. 2026

  14. Opus uses meaningfully more quota than Sonnet; higher effort reaches limits faster.

    Consultée le 28 sept. 2026

  15. Cost per solved task on a 478-problem SWE-bench Pro subset for Opus 5.5, Fable 5.1 and Sonnet 5 configurations; effort trade-offs for Opus 5.5.

    Consultée le 28 sept. 2026

  16. PricingAnthropicOfficielle

    Input, cache write, cache read and output prices per million tokens; batch and fast-mode prices.

    Consultée le 28 sept. 2026

  17. What is the Max plan?AnthropicOfficielle

    Max 5x and Max 20x usage relative to Pro per five-hour session; monthly billing only.

    Consultée le 28 sept. 2026

  18. 5-hour session limits increaseAnthropic (ClaudeDevs on X)Officielle

    Five-hour limits up 20% on 2026-09-22; Opus 5.5 goes 25% further within limits because it is priced lower.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  19. Arena Code: WebDev leaderboardArena (LMArena)Tierce

    Rating, 95% confidence interval, votes and rank of every model on blind pairwise web-development votes (entries[] in the server-rendered payload; vote cutoff 2026-09-25).

    Publiée le 25 sept. 2026 · Consultée le 28 sept. 2026

  20. Coding Agent Index v1.5 per harness × model (Claude Code, Codex, Grok Build, Kimi Code, Antigravity, OpenCode): score, cost, tokens and time per task.

    Consultée le 28 sept. 2026

  21. Per-model sub-scores embedded in the page payload: Humanity's Last Exam, CritPt, SciCode, GPQA and Terminal-Bench 4.0 for each model × effort.

    Consultée le 28 sept. 2026

  22. Artificial Analysis model leaderboardArtificial AnalysisTierce

    Intelligence Index v4.3 and AA's own Terminal-Bench 4.0 run for every model × effort, with cost per task and output tokens per task (JSON embedded in the page).

    Consultée le 28 sept. 2026

  23. Grok 4.7 usage on SuperGrok HeavyBigGo Finance (reporting a user post)Tierce

    About $40 of Grok 4.7 usage in Grok Build burned about 8% of the Heavy weekly limit.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  24. Weekly budget of Max 5x and Max 20x in API-equivalent dollars (two accounts, /usage vs ccusage).

    Publiée le 20 août 2026 · Consultée le 28 sept. 2026

  25. Codex usage researchcodexusage.devTierce

    Codex Plus 5-hour and weekly budgets in credits and dollars, cost per busy hour by effort level.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  26. Coding plan trackercodingplan.orgTierce

    Current Kimi plan names and CNY prices (Go, Plus, Pro, Max) and the mapping from legacy names.

    Publiée le 24 sept. 2026 · Consultée le 28 sept. 2026

  27. Devin pricingCognitionOfficielle

    Devin Pro and Max prices.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  28. FrontierCode v1.1 score (new_score), cost, tokens and duration for every model × effort, main and extended subsets.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  29. Cursor pricingCursorOfficielle

    Cursor Pro, Pro+ and Ultra prices and their two usage pools.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  30. CursorBench 4.0CursorTierce

    Score, cost per task, tokens and steps for every model × effort (server-rendered results table).

    Publiée le 10 sept. 2026 · Consultée le 28 sept. 2026

  31. pass@1 and mean cost per task for every model × effort (mini-swe-agent harness, 4 runs).

    Consultée le 28 sept. 2026

  32. Lite plan in Claude Code: a 3-hour session used 70% of a 2,000-credit window; one endpoint with tests took 18 minutes and 210 credits.

    Publiée le 29 août 2026 · Consultée le 28 sept. 2026

  33. Elo, standard error, win rate and battles for the full-stack and frontend agentic web-app arenas (embedded boards and /api/leaderboard).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  34. Factory pricingFactoryOfficielle

    Droid Pro, Plus and Max prices and per-model multipliers.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  35. Kimi plans in USDgeotoolbox.aiTierce

    International USD prices of Kimi plans and their Kimi Code usage multipliers (1×, 5×, 15×, 30×).

    Publiée le 5 sept. 2026 · Consultée le 28 sept. 2026

  36. GitHub Copilot plansGitHubOfficielle

    Copilot Pro, Pro+, Max, Business and Enterprise prices and the AI Credits included with each.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  37. Pro 20x weekly meter measurementGitHub user reportTierce

    Weekly meter moved from 64% to 95% for $609 of API-equivalent usage on Pro 20x.

    Publiée le 10 sept. 2026 · Consultée le 28 sept. 2026

  38. Three weekly meters on Pro 5xGitHub user reportTierce

    Three full weekly Pro 5x meters = $959.87 API-equivalent (about $320 per week) and 708 M tokens on GPT-5.6 Sol and Astra.

    Publiée le 7 sept. 2026 · Consultée le 28 sept. 2026

  39. API-equivalent value of a full weekly Pro 20x allowance: about $1,925 on GPT-5.6 Sol, $1,191–1,234 on GPT-6 Astra.

    Publiée le 8 sept. 2026 · Consultée le 28 sept. 2026

  40. Claude Code usage meter measurementsGitHub user reportsTierce

    Controlled A/B measurements of API-equivalent dollars per 1% of the 5-hour and weekly meters (interactive vs headless), Pro and Max.

    Publiée le 27 sept. 2026 · Consultée le 28 sept. 2026

  41. Antigravity modelsGoogleOfficielle

    Models available per plan and thinking options (Low/Medium/High) in Antigravity; two usage pools with five-hour and weekly remaining percentages.

    Consultée le 28 sept. 2026

  42. Antigravity plansGoogleOfficielle

    Quota wording per plan: weekly refresh on Free, five-hour refresh until a weekly limit on Pro and Ultra.

    Consultée le 28 sept. 2026

  43. Ultra $100 = 5× and $200 = 20× the Pro token allowance; the Gemini pool is drawn down at API prices; Claude and GPT models use a separate fixed pool.

    Publiée le 19 mai 2026 · Consultée le 28 sept. 2026

  44. Gemini API pricingGoogleOfficielle

    Prices per million tokens for Gemini 3.8/3.7 Flash (introductory until 2026-12-31) and 3.1 Pro Preview.

    Publiée le 24 sept. 2026 · Consultée le 28 sept. 2026

  45. Gemini thinkingGoogleOfficielle

    Thinking levels and defaults per Gemini model; guidance per level.

    Publiée le 25 sept. 2026 · Consultée le 28 sept. 2026

  46. Google AI subscriptionsGoogleOfficielle

    Prices of Google AI Plus, Pro, Ultra 5x and Ultra 20x; Gemini app usage multipliers.

    Consultée le 28 sept. 2026

  47. Gemini 3.1 Pro model cardGoogle DeepMindOfficielle

    SWE-bench Verified, SWE-bench Pro and Terminal-Bench 2.0 scores of Gemini 3.1 Pro (high thinking).

    Publiée le 19 févr. 2026 · Consultée le 28 sept. 2026

  48. Gemini 3.8 Flash evaluationGoogle DeepMindOfficielle

    Coding benchmark table of Gemini 3.8 Flash versus Opus 5, Sonnet 5 and GPT-5.6, with the settings used.

    Publiée le 2 sept. 2026 · Consultée le 28 sept. 2026

  49. Four terminals at full speed for one hour used 9% of the SuperGrok weekly pool during a 2× promotion.

    Publiée le 12 août 2026 · Consultée le 28 sept. 2026

  50. Qwen3.8-27B hardware testsHardware CornerTierce

    Local decode speeds of Qwen3.8-27B on RTX 4090, 3090, 5090 and M5 Max at several context lengths.

    Publiée le 17 août 2026 · Consultée le 28 sept. 2026

  51. AI coding agent adoption 2026JetBrains ResearchTierce

    Share of developers using each coding agent (Claude Code 39%, Copilot 21%, Codex 16%, Cursor 12%, OpenCode 7%, Antigravity 6%; 15,000+ respondents).

    Publiée le 15 août 2026 · Consultée le 28 sept. 2026

  52. KiloBenchKiloTierce

    Terminal-Bench 2.0 completion and cost per full attempt in the Kilo agent (embedded chart points).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  53. LiveBenchLiveBenchTierce

    Coding and agentic-coding category scores and cost per question (table_2026_06_25.csv and category files).

    Publiée le 10 sept. 2026 · Consultée le 28 sept. 2026

  54. Best AI for codingllm-stats (ZeroEval)Tierce

    TrueSkill coding rating (μ − 3σ) over 60 benchmark games for every model (initialIndexData in the payload). Needs a cache-busting query string: the plain URL served a stale 2026-09-22 copy.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  55. Local decode speed of GLM-5.3-Flash on the M5 Ultra.

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  56. Muse CodeMetaOfficielle

    Muse Code plans (Everyday, High, Power) and prompts per 5 hours.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  57. MiniMax Token PlanMiniMaxOfficielle

    Token Plan prices and 5-hour / weekly windows.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  58. Mistral pricingMistral AIOfficielle

    Vibe Pro and Team prices (no published quota).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  59. Kimi API pricingMoonshot AIOfficielle

    Cache hit, cache miss and output prices per million tokens for Kimi K3 and K2.7 Code.

    Consultée le 28 sept. 2026

  60. Kimi Code membershipMoonshot AIOfficielle

    Five-hour rolling window, monthly cap shared across Kimi services, extra usage top-ups.

    Consultée le 28 sept. 2026

  61. Kimi Code modelsMoonshot AIOfficielle

    Models in Kimi Code (K3, K2.8 Preview, HighSpeed at 3× quota), effort levels and plan access.

    Consultée le 28 sept. 2026

  62. Kimi K3Moonshot AIOfficielle

    Coding benchmark table of Kimi K3 (max effort) versus Fable 5, GPT-5.6 Sol, Opus 4.8 and GLM-5.2, with harnesses used.

    Publiée le 16 juil. 2026 · Consultée le 28 sept. 2026

  63. Kimi membership pricingMoonshot AIOfficielle

    CNY monthly prices of the membership tiers (legacy names).

    Consultée le 28 sept. 2026

  64. SWE-rebenchNebiusTierce

    Resolved rate, pass@5 and cost per task on the 2026-05-15 → 2026-07-01 window (embedded items).

    Publiée le 24 juil. 2026 · Consultée le 28 sept. 2026

  65. Cross-provider quota calibrationoh-my-pi (GitHub)Tierce

    Tokens and API-equivalent dollars per 1% of the Anthropic, OpenAI and Antigravity meters, measured on one machine.

    Publiée le 26 sept. 2026 · Consultée le 28 sept. 2026

  66. About ChatGPT Pro tiersOpenAIOfficielle

    Pro $100 (5× Plus) and Pro $200 (20× Plus); new Pro $200 sign-ups paused since 2026-09-10.

    Consultée le 28 sept. 2026

  67. API pricingOpenAIOfficielle

    Standard, batch, flex and fast-mode prices per million tokens for GPT-6 Astra, Sol and Luna.

    Consultée le 28 sept. 2026

  68. Credits per million tokens for each model (25× the API dollar price); fast mode 2.5×; Ultra billing.

    Consultée le 28 sept. 2026

  69. Codex modelsOpenAIOfficielle

    Effort controls per surface (Light to Ultra), recommended starting presets (Sol Medium, Luna High, Astra Light), surfaces per model.

    Consultée le 28 sept. 2026

  70. Codex pricingOpenAIOfficielle

    Plan prices and the estimated local messages per 5 hours for each model on Plus, Pro 5x, Pro 20x and Business.

    Consultée le 28 sept. 2026

  71. GPT-6 AstraOpenAIOfficielle

    Terminal-Bench 4.0 score, cost, output tokens and latency at each effort for GPT-6 Astra, GPT-5.6 Sol and Fable 5.1; FrontierCode 1.1 Extended; output tokens per DeepSWE task.

    Publiée le 3 sept. 2026 · Consultée le 28 sept. 2026

  72. Release dates, context windows, knowledge cutoffs and supported effort values.

    Consultée le 28 sept. 2026

  73. DeepSWE v1.1 and FrontierCode 1.1 Main score and cost per task at each effort for GPT-6 Astra, Sol, Luna, GPT-5.6, Opus 5 and Fable 5.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  74. Business Standard and Premium seat prices, annual and monthly.

    Consultée le 28 sept. 2026

  75. Five-hour and weekly windows, shared allowance across Codex and Work, effort advice (Astra Low can beat Sol High).

    Consultée le 28 sept. 2026

  76. OpenCode GoOpenCodeOfficielle

    OpenCode Go price and requests per 5 hours for each open-weight model.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  77. FrontierSWE V2Proximal LabsTierce

    Mean, best and worst of 5 trials, cost per trial and duration on 34 long-horizon tasks.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  78. Quality of Qwen3.8-27B by quantization level on Terminal-Bench 2.1 (Q4_K_M matches BF16, Q2 loses about 10 points).

    Publiée le 26 août 2026 · Consultée le 28 sept. 2026

  79. Terminal-Bench 4.0 leaderboardTerminal-Bench (tbench.ai)Tierce

    Accuracy with confidence interval, total cost and tokens per agent × model × effort over 330 trials.

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  80. Vals AI benchmarksVals AITierce

    Accuracy, cost per test and latency for Terminal-Bench 4, Vibe Code Bench, Vals Index and other coding benchmarks (astro-island props).

    Publiée le 23 sept. 2026 · Consultée le 28 sept. 2026

  81. Vals IndexVals AITierce

    Vals Index score, cost per test and latency for Opus 5.5, Fable 5.1, GPT-6 Astra and others.

    Consultée le 28 sept. 2026

  82. Grok 4.6xAIOfficielle

    Coding scores of Grok 4.6 at high effort (DeepSWE v1.1, Terminal-Bench 3.0, CursorBench 3.2).

    Publiée le 12 août 2026 · Consultée le 28 sept. 2026

  83. Grok 4.7xAIOfficielle

    CursorBench 4.0 score, cost per task, output tokens and steps at each effort for Grok 4.7 and for Fable 5.1, Opus 5, Sonnet 5, GPT-5.6 Sol/Terra/Luna and Gemini 3.8 Flash (JS dataset behind the chart).

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  84. Grok 4.7 model cardxAIOfficielle

    Terminal-Bench 4.0, FrontierSWE V2 and SWE-Marathon scores of Grok 4.7 and 4.6; CursorBench 4.0 chart (vector geometry) for Grok 4.6.

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  85. Grok FAQxAIOfficielle

    One shared weekly usage pool across Chat, Imagine, Voice and Build since June 2026; shown only as a percentage; extra usage credits.

    Publiée le 27 août 2026 · Consultée le 28 sept. 2026

  86. Grok plansxAIOfficielle

    Monthly and annual prices of SuperGrok Lite, SuperGrok, Plus and Heavy, from the product JSON the page loads (grok.com/rest/products).

    Consultée le 28 sept. 2026

  87. ReasoningxAIOfficielle

    Effort levels per Grok model (low to xhigh, default high) and guidance per level.

    Consultée le 28 sept. 2026

  88. xAI API pricingxAIOfficielle

    Input, cached input and output prices per million tokens for Grok 4.7, 4.6 and grok-build-0.1.

    Consultée le 28 sept. 2026

  89. MiMo Token PlanXiaomiOfficielle

    MiMo Token Plan prices and credits.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  90. GLM Coding PlanZ.aiOfficielle

    Prices of Lite, Pro and Max (monthly, quarterly, yearly) and their five-hour and weekly credit allowances.

    Consultée le 28 sept. 2026

  91. Credit formula and per-model token multipliers, peak and off-peak rates, and the official weekly token estimates per tier.

    Consultée le 28 sept. 2026

  92. GLM-5.3Z.aiOfficielle

    Effort levels (low, high, max; default max) and the recommendation to use max for coding.

    Consultée le 28 sept. 2026

  93. GLM-5.3Z.aiOfficielle

    Z.ai Code Bench accuracy and output tokens per task at each effort for GLM-5.3, Fable 5 and Opus 4.8.

    Publiée le 14 août 2026 · Consultée le 28 sept. 2026

  94. GLM-5.3 model cardZ.aiOfficielle

    Coding benchmark table of GLM-5.3 at max effort in Claude Code (Terminal-Bench 2.1 and 3.0, DeepSWE v1.1, NL2Repo, FrontierSWE).

    Consultée le 28 sept. 2026

  95. GLM-5.3-FlashZ.aiOfficielle

    Coding scores of GLM-5.3-Flash (Terminal-Bench 2.1, DeepSWE v1.1) from printed chart labels.

    Publiée le 26 août 2026 · Consultée le 28 sept. 2026

  96. Z.ai API pricingZ.aiOfficielle

    Input, cached input and output prices per million tokens for GLM-5.3 and GLM-5.3-Flash.

    Consultée le 28 sept. 2026