Skip to main content
Configurador de agentes IA

Configura tu agente IA
Con el LLM adecuado

Cada tarea de agente IA requiere fortalezas distintas - potencia bruta de código, ejecución CLI autónoma, razonamiento profundo o máximo contexto. Ajusta tu carga de trabajo al mejor modelo con datos reales de benchmarks, estimaciones de coste en vivo y recomendaciones específicas para la tarea.

12
Modelos monitorizados
5
Benchmarks
8
Perfiles de tarea
Jun 2026
Actualizado

Encuentra tu modelo IA

Elige tu perfil de tarea y ve qué modelos obtienen las mejores puntuaciones según el peso de los benchmarks. Ajusta los parámetros de sesión para estimar costes reales.

Hermes Agent

Hermes needs reliable tool calling, large context (memory + conversation), and prompt caching for long sessions. DeepSeek V4 Pro is the default.

Tool CallingPrompt CachingStructured OutputThinking Mode

Top Recommendations for Hermes Agent

1
DeepSeek

V4 Pro

1.6T MoE with 49B active per token. MIT open-source. 1M context with hybrid attention (CSA+HCA). State-of-the-art competitive coding and math reasoning at 7-9x lower cost than frontier models.

99%
Context
1.0M
SWE-Verified
80.6%
Terminal-Bench
67.9%
GPQA
90.1%
Est. Session Cost
$0.057
Price/MTok Out
$0.87
Open SourceThinking
2
MiniMax

MiniMax M3

Open-weight surprise. 92.68% GPQA Diamond, 80.5% SWE-bench Verified. 1M context. Very strong reasoning at $0.30-$0.60 input. Best value open-weight model.

98%
Context
1.0M
SWE-Verified
80.5%
Terminal-Bench
66.0%
GPQA
92.7%
Est. Session Cost
$0.099
Price/MTok Out
$1.80
Open SourceThinking
3
DeepSeek

V4 Flash

284B MoE with 13B active per token. MIT open-source. Ultra-cheap at $0.14/$0.28 per MTok. 1M context. Perfect for high-volume, cost-sensitive production workloads.

96%
Context
1.0M
SWE-Verified
79.0%
Terminal-Bench
56.9%
GPQA
88.1%
Est. Session Cost
$0.018
Price/MTok Out
$0.28
Open SourceThinking

All Models Ranked

RankModelScoreSession CostInput $Output $
1
V4 Pro
DeepSeek
99%$0.057$0.43$0.87
2
MiniMax M3
MiniMax
98%$0.099$0.45$1.80
3
V4 Flash
DeepSeek
96%$0.018$0.14$0.28
4
Sonnet 4.6
Anthropic
78%$0.900$3.00$15.00
5
Kimi K2.6
Moonshot AI
73%$0.260$1.00$4.00
6
Gemini 3.1 Pro
Google
72%$0.680$2.00$12.00
7
Opus 4.8
Anthropic
62%$1.500$5.00$25.00
8
GPT 5.3 Codex
OpenAI
60%$0.656$1.75$14.00
9
Haiku 4.5
Anthropic
54%$0.300$1.00$5.00
10
GPT-5.5
OpenAI
46%$1.575$5.00$30.00
11
GPT-5.4
OpenAI
36%$0.738$2.50$15.00
12
Fable 5
Anthropic
32%$3.000$10.00$50.00

Comparación de benchmarks de modelos IA

Comparación lado a lado de todos los modelos de vanguardia en SWE-bench Verified, SWE-bench Pro, Terminal-Bench 2.0, GPQA Diamond y MMLU-Pro. Ordena por cualquier columna. Haz clic en una fila para ver todos los detalles.

Open
1.0M95.0%80.3%$10.00/$50.00
1.0M88.6%69.2%93.6%89.1%$5.00/$25.00
1.0M80.6%55.4%67.9%90.1%87.5%$0.43/$0.87
1.0M80.6%54.2%94.3%92.6%$2.00/$12.00
1.0M80.5%66.0%92.7%84.2%$0.45/$1.80
256K80.2%66.7%$1.00/$4.00
1.0M79.6%42.8%82.0%84.6%$3.00/$15.00
1.0M79.0%56.9%88.1%86.2%$0.14/$0.28
200K73.3%39.5%$1.00/$5.00
400K58.6%82.7%$5.00/$30.00
400K77.3%$1.75/$14.00
400K51.9%$2.50/$15.00

Data sourced from vendor reports, SWE-bench leaderboard, and third-party benchmarks as of June 17, 2026. Click a row for full details.

Calculador de costes

Elige dos modelos y ve exactamente cuánto ahorrarías por sesión, por mes y por año. Ajusta turnos, tokens y frecuencia de sesiones para tu carga de trabajo.

Input/MTok
$0.435
Output/MTok
$0.87
Per Session
$0.057
Monthly (30 sessions)
$1.70
Input/MTok
$5.000
Output/MTok
$25.00
Per Session
$1.500
Monthly (30 sessions)
$45.00
V4 Pro saves $43.30/month vs Opus 4.8
That's 96% cheaper — $520/year

Cómo evaluamos los modelos

SWE-bench Verified

peso: 0-40%

Incidencias reales de GitHub. Los modelos corrigen errores reales en repos Python usando un scaffold estandarizado. El mejor predictor de capacidad de programación en producción.

Terminal-Bench 2.0

peso: 0-40%

Tareas de agente CLI autónomo. Los modelos navegan sistemas de archivos, ejecutan builds y orquestan comandos de shell - mide la verdadera autonomía del agente.

GPQA Diamond

peso: 0-40%

Preguntas científicas de nivel experto (biología, física y química a nivel de doctorado). Mide razonamiento profundo más allá del reconocimiento de patrones.

MMLU-Pro

peso: 0-30%

Comprensión lingüística multitarea masiva - 57 materias de STEM, humanidades y ciencias sociales. Un benchmark de conocimiento amplio.

Datos obtenidos de SWE-bench leaderboard, vendor technical reports (DeepSeek, Anthropic, OpenAI), Artificial Analysis, and third-party evaluators. Artificial Analysis y evaluadores externos. Última actualización: 17 de junio de 2026. Precios verificados con la documentación API oficial.

n8n Lab

Te ayudamos a ganar el panorama de automatización del mañana

Empieza a eliminar cuellos de botella manuales con automatización n8n personalizada. Déjanos diseñar el sistema por ti.

Reservar llamada estratégica
Jovan
Stefan
Nemanja
Davor

Nuestro equipo

Listo para ayudar

Socio experto en n8n
Configuración n8n incluida
Con la confianza de más de 50 empresas

n8n Lab is an independent service provider. We are not affiliated with, endorsed by, or sponsored by n8n GmbH. “n8n” is a trademark of n8n GmbH and is used here only to describe the platform-specific implementation and automation services we provide.