Skip to main content
AI-Agent-Konfigurator

Konfigurieren Sie Ihren KI-Agenten
Mit dem richtigen LLM

Jede KI-Agentenaufgabe verlangt andere Stärken - rohe Coding-Power, autonome CLI-Ausführung, tiefes Denken oder maximalen Kontext. Stimmen Sie Ihre Workload mit echten Benchmark-Daten, Live-Kostenschätzungen und aufgabenbezogenen Empfehlungen auf das beste Modell ab.

12
Verfolgte Modelle
5
Benchmarks
8
Aufgabenprofile
Jun 2026
Aktualisiert

Finden Sie Ihr KI-Modell

Wählen Sie Ihr Aufgabenprofil und sehen Sie, welche Modelle basierend auf gewichteten Benchmarks am besten abschneiden. Passen Sie Sitzungseinstellungen an, um reale Kosten zu schätzen.

Hermes Agent

Hermes needs reliable tool calling, large context (memory + conversation), and prompt caching for long sessions. DeepSeek V4 Pro is the default.

Tool CallingPrompt CachingStructured OutputThinking Mode

Top Recommendations for Hermes Agent

1
DeepSeek

V4 Pro

1.6T MoE with 49B active per token. MIT open-source. 1M context with hybrid attention (CSA+HCA). State-of-the-art competitive coding and math reasoning at 7-9x lower cost than frontier models.

99%
Context
1.0M
SWE-Verified
80.6%
Terminal-Bench
67.9%
GPQA
90.1%
Est. Session Cost
$0.057
Price/MTok Out
$0.87
Open SourceThinking
2
MiniMax

MiniMax M3

Open-weight surprise. 92.68% GPQA Diamond, 80.5% SWE-bench Verified. 1M context. Very strong reasoning at $0.30-$0.60 input. Best value open-weight model.

98%
Context
1.0M
SWE-Verified
80.5%
Terminal-Bench
66.0%
GPQA
92.7%
Est. Session Cost
$0.099
Price/MTok Out
$1.80
Open SourceThinking
3
DeepSeek

V4 Flash

284B MoE with 13B active per token. MIT open-source. Ultra-cheap at $0.14/$0.28 per MTok. 1M context. Perfect for high-volume, cost-sensitive production workloads.

96%
Context
1.0M
SWE-Verified
79.0%
Terminal-Bench
56.9%
GPQA
88.1%
Est. Session Cost
$0.018
Price/MTok Out
$0.28
Open SourceThinking

All Models Ranked

RankModelScoreSession CostInput $Output $
1
V4 Pro
DeepSeek
99%$0.057$0.43$0.87
2
MiniMax M3
MiniMax
98%$0.099$0.45$1.80
3
V4 Flash
DeepSeek
96%$0.018$0.14$0.28
4
Sonnet 4.6
Anthropic
78%$0.900$3.00$15.00
5
Kimi K2.6
Moonshot AI
73%$0.260$1.00$4.00
6
Gemini 3.1 Pro
Google
72%$0.680$2.00$12.00
7
Opus 4.8
Anthropic
62%$1.500$5.00$25.00
8
GPT 5.3 Codex
OpenAI
60%$0.656$1.75$14.00
9
Haiku 4.5
Anthropic
54%$0.300$1.00$5.00
10
GPT-5.5
OpenAI
46%$1.575$5.00$30.00
11
GPT-5.4
OpenAI
36%$0.738$2.50$15.00
12
Fable 5
Anthropic
32%$3.000$10.00$50.00

Benchmark-Vergleich von KI-Modellen

Direkter Vergleich aller führenden Modelle über SWE-bench Verified, SWE-bench Pro, Terminal-Bench 2.0, GPQA Diamond und MMLU-Pro. Nach jeder Spalte sortieren. Jede Zeile anklicken für Details.

Open
1.0M95.0%80.3%$10.00/$50.00
1.0M88.6%69.2%93.6%89.1%$5.00/$25.00
1.0M80.6%55.4%67.9%90.1%87.5%$0.43/$0.87
1.0M80.6%54.2%94.3%92.6%$2.00/$12.00
1.0M80.5%66.0%92.7%84.2%$0.45/$1.80
256K80.2%66.7%$1.00/$4.00
1.0M79.6%42.8%82.0%84.6%$3.00/$15.00
1.0M79.0%56.9%88.1%86.2%$0.14/$0.28
200K73.3%39.5%$1.00/$5.00
400K58.6%82.7%$5.00/$30.00
400K77.3%$1.75/$14.00
400K51.9%$2.50/$15.00

Data sourced from vendor reports, SWE-bench leaderboard, and third-party benchmarks as of June 17, 2026. Click a row for full details.

Kostenrechner

Wählen Sie zwei Modelle und sehen Sie genau, wie viel Sie pro Sitzung, pro Monat und pro Jahr sparen würden. Passen Sie Schritte, Token-Anzahl und Sitzungsfrequenz an Ihre Workload an.

Input/MTok
$0.435
Output/MTok
$0.87
Per Session
$0.057
Monthly (30 sessions)
$1.70
Input/MTok
$5.000
Output/MTok
$25.00
Per Session
$1.500
Monthly (30 sessions)
$45.00
V4 Pro saves $43.30/month vs Opus 4.8
That's 96% cheaper — $520/year

Wie wir Modelle bewerten

SWE-bench Verified

Gewichtung: 0-40%

Echte GitHub-Issues. Modelle beheben tatsächliche Bugs in Python-Repos mit einem standardisierten Scaffold. Der beste Indikator für Coding-Fähigkeit in der Produktion.

Terminal-Bench 2.0

Gewichtung: 0-40%

Autonome CLI-Agenten-Aufgaben. Modelle navigieren Dateisysteme, führen Builds aus und orchestrieren Shell-Befehle - misst echte Agentenautonomie.

GPQA Diamond

Gewichtung: 0-40%

Wissenschaftliche Fragen auf Expertenniveau (Biologie, Physik, Chemie auf PhD-Niveau). Misst tiefes Schlussfolgern über reines Pattern-Matching hinaus.

MMLU-Pro

Gewichtung: 0-30%

Massive multitask language understanding - 57 Fächer aus STEM, Geistes- und Sozialwissenschaften. Breiter Wissens-Benchmark.

Datenquellen: SWE-bench leaderboard, vendor technical reports (DeepSeek, Anthropic, OpenAI), Artificial Analysis, and third-party evaluators. Artificial Analysis sowie Drittanbieter-Bewerter. Zuletzt aktualisiert am 17. Juni 2026. Preise anhand offizieller API-Dokumentation geprüft.

n8n Lab

Wir helfen dir, die Automatisierungslandschaft von morgen zu gewinnen

Eliminiere manuelle Engpässe mit individueller n8n-Automatisierung. Wir entwerfen das System für dich.

Strategiegespräch buchen
Jovan
Stefan
Nemanja
Davor

Unser Team

Bereit zu helfen

n8n-Expertenpartner
n8n-Setup inklusive
Vertraut von über 50 Unternehmen

n8n Lab is an independent service provider. We are not affiliated with, endorsed by, or sponsored by n8n GmbH. “n8n” is a trademark of n8n GmbH and is used here only to describe the platform-specific implementation and automation services we provide.