Ir al contenido
self-hostingbenchmarkcost

Cada número aquí corrió en una sola RTX 3060

Sin clúster, sin A100: el benchmark completo corrió en una RTX 3060 con 12 GB. Qué cabe en 12 GB, qué hacer con 8, y cómo correr sin GPU local a través de cualquier endpoint compatible con OpenAI.

Equipo MonkeyLLM4 min de lectura

La sección de hardware de la mayoría de los informes de benchmark se lee como la factura de un datacenter. La nuestra se lee como una PC gamer de gama media: una RTX 3060 con 12 GB de VRAM. Cada número que publicamos, 0/11 a 11/11, 0.58x tokens por respuesta correcta, 8.4 s p95, salió de esa única tarjeta.

El rig completo

Un modelo 12B cuantizado cabe entero en la 3060: sin sharding, sin offload, sin segunda tarjeta. Ese único modelo hizo todo el razonamiento del benchmark, leyendo pasaportes (el título, resumen y tags curados de cada nodo), eligiendo enlaces y escribiendo respuestas. Los presupuestos de tokens son lo que vuelve suficiente a un modelo de este tamaño: cada salto que el agente da sobre MCP tiene presupuesto, así que cada pasada de razonamiento ve un contexto pequeño y curado en lugar de uno desparramado.

El lado de recuperación pide aún menos. La búsqueda de entrada es BM25 sobre SQLite, logrando recall@5 = 1.00 a 1.3 ms p95 sin embeddings, sin base de datos vectorial y sin GPU en absoluto. Ponderar campos curados como título y alias cerró por completo la brecha con la búsqueda híbrida. El embedder es opcional y soportado, no eliminado; el punto es que nunca estás obligado a financiar uno.

Qué cabe dónde

Tu tarjeta no necesita ser nuestra tarjeta. Los caminos, de más local a menos:

  • 12 GB (clase RTX 3060): un 12B cuantizado corre entero. Este es el rig exacto del benchmark.
  • 8 GB: cuantización más agresiva, u offload a CPU vía llama.cpp, cambiando algo de velocidad por espacio.
  • Sin GPU: apunta el binding de chat a cualquier endpoint compatible con OpenAI, como OpenRouter, un servidor llama.cpp u Ollama corriendo en la caja que tenga la memoria.
Logo de Ollama

Los bindings son configuración, no código. La pantalla Models del Studio guarda el endpoint, los presupuestos de tokens y el puntaje acumulado del almacén de respuestas, así que cambiar un Ollama local por un endpoint remoto es una edición, no una migración. Al bosque no le importa de dónde vienen los tokens; solo le importa que cada salto se quede dentro de su presupuesto.

La gama media era el punto

También era la tesis. El benchmark sostiene que el rendimiento multi-salto viene de la estructura, no de la escala: el bosque lleva pasaportes curados y enlaces tipados, así que un modelo 12B navegándolo supera al mismísimo modelo leyendo chunks top-k, 11/11 contra 0/11. Gasta inteligencia en el entorno para gastar menos en el modelo. Esa afirmación sonaría hueca demostrada en ocho GPUs de datacenter. Demostrada en una tarjeta que puedes comprar usada, es verificable por casi cualquiera, que es lo que una afirmación así necesita ser. La versión larga del argumento es el Principio del Bosque.

La honestidad de siempre aplica aquí también. Once preguntas es un conjunto pequeño y lo decimos, el paper es un preprint y lo decimos, y el corpus, los conjuntos de preguntas y el harness están versionados para que cada tabla se regenere con un comando, en hardware que la mayoría de los lectores ya tiene.

Despliega en el tuyo

El autoalojamiento son cuatro comandos. El motor es Apache-2.0, las apps son AGPL y tus datos nunca salen de tu infra. El primer arranque te deja en la pantalla de configuración y pide exactamente lo que necesita, nada más.

La pantalla de configuración del primer arranque de MonkeyLLM
La pantalla de configuración del primer arranque de MonkeyLLM

El recorrido de punta a punta vive en la guía de Docker y los docs de despliegue. Trae una 3060, una tarjeta de 8 GB o ninguna GPU, despliega desde el repo y haz crecer un bosque en tu propio hardware esta misma noche. Detalles en monkeyllm.com.

¿Quieres la versión larga?

El paper trae la arquitectura completa, las tablas del benchmark y los hallazgos que no cumplieron sus criterios.