Skip to main content
Configurateur d'agent IA

Configurez votre agent IA
Avec le bon LLM

Chaque tâche d'agent IA exige des forces différentes - puissance de codage brute, exécution CLI autonome, raisonnement profond ou contexte maximal. Adaptez votre charge de travail au meilleur modèle grâce à des données de benchmark réelles, des estimations de coûts en direct et des recommandations spécifiques à la tâche.

12
Modèles suivis
5
Benchmarks
8
Profils de tâches
Jun 2026
Mis à jour

Trouvez votre modèle IA

Choisissez votre profil de tâche et voyez quels modèles obtiennent les meilleurs scores selon une pondération des benchmarks. Ajustez les paramètres de session pour estimer les coûts réels.

Hermes Agent

Hermes needs reliable tool calling, large context (memory + conversation), and prompt caching for long sessions. DeepSeek V4 Pro is the default.

Tool CallingPrompt CachingStructured OutputThinking Mode

Top Recommendations for Hermes Agent

1
DeepSeek

V4 Pro

1.6T MoE with 49B active per token. MIT open-source. 1M context with hybrid attention (CSA+HCA). State-of-the-art competitive coding and math reasoning at 7-9x lower cost than frontier models.

99%
Context
1.0M
SWE-Verified
80.6%
Terminal-Bench
67.9%
GPQA
90.1%
Est. Session Cost
$0.057
Price/MTok Out
$0.87
Open SourceThinking
2
MiniMax

MiniMax M3

Open-weight surprise. 92.68% GPQA Diamond, 80.5% SWE-bench Verified. 1M context. Very strong reasoning at $0.30-$0.60 input. Best value open-weight model.

98%
Context
1.0M
SWE-Verified
80.5%
Terminal-Bench
66.0%
GPQA
92.7%
Est. Session Cost
$0.099
Price/MTok Out
$1.80
Open SourceThinking
3
DeepSeek

V4 Flash

284B MoE with 13B active per token. MIT open-source. Ultra-cheap at $0.14/$0.28 per MTok. 1M context. Perfect for high-volume, cost-sensitive production workloads.

96%
Context
1.0M
SWE-Verified
79.0%
Terminal-Bench
56.9%
GPQA
88.1%
Est. Session Cost
$0.018
Price/MTok Out
$0.28
Open SourceThinking

All Models Ranked

RankModelScoreSession CostInput $Output $
1
V4 Pro
DeepSeek
99%$0.057$0.43$0.87
2
MiniMax M3
MiniMax
98%$0.099$0.45$1.80
3
V4 Flash
DeepSeek
96%$0.018$0.14$0.28
4
Sonnet 4.6
Anthropic
78%$0.900$3.00$15.00
5
Kimi K2.6
Moonshot AI
73%$0.260$1.00$4.00
6
Gemini 3.1 Pro
Google
72%$0.680$2.00$12.00
7
Opus 4.8
Anthropic
62%$1.500$5.00$25.00
8
GPT 5.3 Codex
OpenAI
60%$0.656$1.75$14.00
9
Haiku 4.5
Anthropic
54%$0.300$1.00$5.00
10
GPT-5.5
OpenAI
46%$1.575$5.00$30.00
11
GPT-5.4
OpenAI
36%$0.738$2.50$15.00
12
Fable 5
Anthropic
32%$3.000$10.00$50.00

Comparaison des benchmarks des modèles IA

Comparaison côte à côte de tous les modèles de pointe sur SWE-bench Verified, SWE-bench Pro, Terminal-Bench 2.0, GPQA Diamond et MMLU-Pro. Triez par colonne. Cliquez sur une ligne pour les détails complets.

Open
1.0M95.0%80.3%$10.00/$50.00
1.0M88.6%69.2%93.6%89.1%$5.00/$25.00
1.0M80.6%55.4%67.9%90.1%87.5%$0.43/$0.87
1.0M80.6%54.2%94.3%92.6%$2.00/$12.00
1.0M80.5%66.0%92.7%84.2%$0.45/$1.80
256K80.2%66.7%$1.00/$4.00
1.0M79.6%42.8%82.0%84.6%$3.00/$15.00
1.0M79.0%56.9%88.1%86.2%$0.14/$0.28
200K73.3%39.5%$1.00/$5.00
400K58.6%82.7%$5.00/$30.00
400K77.3%$1.75/$14.00
400K51.9%$2.50/$15.00

Data sourced from vendor reports, SWE-bench leaderboard, and third-party benchmarks as of June 17, 2026. Click a row for full details.

Calculateur de coûts

Choisissez deux modèles et voyez exactement combien vous économiserez par session, par mois et par an. Ajustez les tours, le nombre de tokens et la fréquence des sessions.

Input/MTok
$0.435
Output/MTok
$0.87
Per Session
$0.057
Monthly (30 sessions)
$1.70
Input/MTok
$5.000
Output/MTok
$25.00
Per Session
$1.500
Monthly (30 sessions)
$45.00
V4 Pro saves $43.30/month vs Opus 4.8
That's 96% cheaper — $520/year

Comment nous évaluons les modèles

SWE-bench Verified

poids : 0-40%

Véritables issues GitHub. Les modèles corrigent des bugs réels dans des dépôts Python à l'aide d'un scaffold standardisé. Le meilleur indicateur de capacité de codage en production.

Terminal-Bench 2.0

poids : 0-40%

Tâches d'agent CLI autonome. Les modèles naviguent dans les systèmes de fichiers, exécutent des builds et orchestrent des commandes shell - mesure la vraie autonomie des agents.

GPQA Diamond

poids : 0-40%

Questions scientifiques de niveau expert (biologie, physique, chimie niveau doctorat). Mesure le raisonnement profond au-delà de la simple reconnaissance de motifs.

MMLU-Pro

poids : 0-30%

Compréhension linguistique multi-tâches massive - 57 matières STEM, sciences humaines et sociales. Benchmark de connaissances large.

Données issues de SWE-bench leaderboard, vendor technical reports (DeepSeek, Anthropic, OpenAI), Artificial Analysis, and third-party evaluators. Artificial Analysis et d'évaluateurs tiers. Dernière mise à jour le 17 juin 2026. Tarifs vérifiés à partir de la documentation API officielle.

n8n Lab

Laissez-nous vous aider à gagner le paysage de l’automatisation de demain

Commencez à éliminer les goulots d’étranglement manuels avec une automatisation n8n sur mesure. Laissez-nous concevoir le système pour vous.

Réserver un appel stratégique
Jovan
Stefan
Nemanja
Davor

Notre équipe

Prête à aider

Partenaire expert n8n
Configuration n8n incluse
Approuvé par plus de 50 entreprises

n8n Lab is an independent service provider. We are not affiliated with, endorsed by, or sponsored by n8n GmbH. “n8n” is a trademark of n8n GmbH and is used here only to describe the platform-specific implementation and automation services we provide.