Configura tu agente IA
Con el LLM adecuado
Cada tarea de agente IA requiere fortalezas distintas - potencia bruta de código, ejecución CLI autónoma, razonamiento profundo o máximo contexto. Ajusta tu carga de trabajo al mejor modelo con datos reales de benchmarks, estimaciones de coste en vivo y recomendaciones específicas para la tarea.
Encuentra tu modelo IA
Elige tu perfil de tarea y ve qué modelos obtienen las mejores puntuaciones según el peso de los benchmarks. Ajusta los parámetros de sesión para estimar costes reales.
Hermes Agent
Hermes needs reliable tool calling, large context (memory + conversation), and prompt caching for long sessions. DeepSeek V4 Pro is the default.
Top Recommendations for Hermes Agent
V4 Pro
1.6T MoE with 49B active per token. MIT open-source. 1M context with hybrid attention (CSA+HCA). State-of-the-art competitive coding and math reasoning at 7-9x lower cost than frontier models.
MiniMax M3
Open-weight surprise. 92.68% GPQA Diamond, 80.5% SWE-bench Verified. 1M context. Very strong reasoning at $0.30-$0.60 input. Best value open-weight model.
V4 Flash
284B MoE with 13B active per token. MIT open-source. Ultra-cheap at $0.14/$0.28 per MTok. 1M context. Perfect for high-volume, cost-sensitive production workloads.
All Models Ranked
| Rank | Model | Score | Session Cost | Input $ | Output $ |
|---|---|---|---|---|---|
| 1 | V4 Pro DeepSeek | 99% | $0.057 | $0.43 | $0.87 |
| 2 | MiniMax M3 MiniMax | 98% | $0.099 | $0.45 | $1.80 |
| 3 | V4 Flash DeepSeek | 96% | $0.018 | $0.14 | $0.28 |
| 4 | Sonnet 4.6 Anthropic | 78% | $0.900 | $3.00 | $15.00 |
| 5 | Kimi K2.6 Moonshot AI | 73% | $0.260 | $1.00 | $4.00 |
| 6 | Gemini 3.1 Pro Google | 72% | $0.680 | $2.00 | $12.00 |
| 7 | Opus 4.8 Anthropic | 62% | $1.500 | $5.00 | $25.00 |
| 8 | GPT 5.3 Codex OpenAI | 60% | $0.656 | $1.75 | $14.00 |
| 9 | Haiku 4.5 Anthropic | 54% | $0.300 | $1.00 | $5.00 |
| 10 | GPT-5.5 OpenAI | 46% | $1.575 | $5.00 | $30.00 |
| 11 | GPT-5.4 OpenAI | 36% | $0.738 | $2.50 | $15.00 |
| 12 | Fable 5 Anthropic | 32% | $3.000 | $10.00 | $50.00 |
Comparación de benchmarks de modelos IA
Comparación lado a lado de todos los modelos de vanguardia en SWE-bench Verified, SWE-bench Pro, Terminal-Bench 2.0, GPQA Diamond y MMLU-Pro. Ordena por cualquier columna. Haz clic en una fila para ver todos los detalles.
| Open | ||||||||
|---|---|---|---|---|---|---|---|---|
| 1.0M | 95.0% | 80.3% | — | — | — | $10.00/$50.00 | ||
| 1.0M | 88.6% | 69.2% | — | 93.6% | 89.1% | $5.00/$25.00 | ||
| 1.0M | 80.6% | 55.4% | 67.9% | 90.1% | 87.5% | $0.43/$0.87 | ||
| 1.0M | 80.6% | 54.2% | — | 94.3% | 92.6% | $2.00/$12.00 | ||
| 1.0M | 80.5% | — | 66.0% | 92.7% | 84.2% | $0.45/$1.80 | ||
| 256K | 80.2% | — | 66.7% | — | — | $1.00/$4.00 | ||
| 1.0M | 79.6% | — | 42.8% | 82.0% | 84.6% | $3.00/$15.00 | ||
| 1.0M | 79.0% | — | 56.9% | 88.1% | 86.2% | $0.14/$0.28 | ||
| 200K | 73.3% | 39.5% | — | — | — | $1.00/$5.00 | ||
| 400K | — | 58.6% | 82.7% | — | — | $5.00/$30.00 | ||
| 400K | — | — | 77.3% | — | — | $1.75/$14.00 | ||
| 400K | — | 51.9% | — | — | — | $2.50/$15.00 |
Data sourced from vendor reports, SWE-bench leaderboard, and third-party benchmarks as of June 17, 2026. Click a row for full details.
Calculador de costes
Elige dos modelos y ve exactamente cuánto ahorrarías por sesión, por mes y por año. Ajusta turnos, tokens y frecuencia de sesiones para tu carga de trabajo.
Cómo evaluamos los modelos
SWE-bench Verified
peso: 0-40%Incidencias reales de GitHub. Los modelos corrigen errores reales en repos Python usando un scaffold estandarizado. El mejor predictor de capacidad de programación en producción.
Terminal-Bench 2.0
peso: 0-40%Tareas de agente CLI autónomo. Los modelos navegan sistemas de archivos, ejecutan builds y orquestan comandos de shell - mide la verdadera autonomía del agente.
GPQA Diamond
peso: 0-40%Preguntas científicas de nivel experto (biología, física y química a nivel de doctorado). Mide razonamiento profundo más allá del reconocimiento de patrones.
MMLU-Pro
peso: 0-30%Comprensión lingüística multitarea masiva - 57 materias de STEM, humanidades y ciencias sociales. Un benchmark de conocimiento amplio.
Datos obtenidos de SWE-bench leaderboard, vendor technical reports (DeepSeek, Anthropic, OpenAI), Artificial Analysis, and third-party evaluators. Artificial Analysis y evaluadores externos. Última actualización: 17 de junio de 2026. Precios verificados con la documentación API oficial.
Te ayudamos a ganar el panorama de automatización del mañana
Empieza a eliminar cuellos de botella manuales con automatización n8n personalizada. Déjanos diseñar el sistema por ti.
Nuestro equipo
Listo para ayudar