Ir al contenido
benchmarkretrievalarchitecture

A dónde se va la latencia

17.5 s p95 para el RAG iterativo, 8.4 s para el navegador, mismo modelo 12B. Una disección de ambos bucles, y por qué la varianza medida en saltos baratos en vez de rondas completas de recuperar y leer colapsa la cola.

Equipo MonkeyLLM4 min de lectura

Mismo modelo, mismo corpus, mismas 11 preguntas: la línea base de RAG iterativo responde a 17.5 s p95, el navegador de bosque a 8.4 s. El modelo no cambió y el hardware no mejoró. La diferencia es la forma del bucle, así que disequemos los dos.

Anatomía del bucle de RAG iterativo

Un sistema de RAG iterativo corre un ciclo: recuperar, razonar, reformular, repetir. Cada ronda cuesta una recuperación, luego una pasada completa del modelo sobre un contexto recién rellenado, luego una decisión de parar o de reescribir la consulta y volver a empezar.

Dos propiedades vuelven lento ese bucle en la cola. Primero, el cuerpo del bucle es caro: cada ronda vuelve a rellenar el contexto con chunks top-k que se superponen fuertemente con los de la ronda anterior, y el modelo relee lo que ya leyó. Segundo, el número de rondas lo dicta la demanda: precisamente las preguntas difíciles, las que definen tu p95, disparan la mayor cantidad de reformulaciones. La cola multiplica un cuerpo caro por su peor conteo.

La unidad de trabajo del navegador

El cuerpo del bucle del navegador es un salto: leer un pasaporte (el título, resumen y tags curados de un nodo), seguir un enlace, abrir el cuerpo completo de un nodo solo cuando hace falta. La pasada de razonamiento por salto corre sobre un contexto pequeño y con presupuesto en lugar de una pila de chunks, así que cada pasada es corta.

La entrada al bosque tampoco es un cuello de botella. La búsqueda de entrada es BM25 sobre SQLite: recall@5 = 1.00 a 1.3 ms p95 en este corpus, sin embeddings, sin base de datos vectorial y sin GPU en el camino de búsqueda. Ponderar los campos curados (título, alias) cerró por completo la brecha con la búsqueda híbrida, y por eso el embedder puede quedarse opcional y soportado en lugar de obligatorio.

Gráfico: búsqueda de entrada solo BM25 alcanzando recall@5 = 1.00 a 1.3 ms p95
Gráfico: búsqueda de entrada solo BM25 alcanzando recall@5 = 1.00 a 1.3 ms p95

Por qué colapsa la cola

Gráfico: latencia p95, 17.5 s para la línea base de RAG iterativo contra 8.4 s del navegador de bosque
Gráfico: latencia p95, 17.5 s para la línea base de RAG iterativo contra 8.4 s del navegador de bosque

Las preguntas difíciles también le cuestan saltos extra al navegador, pero los incrementos son baratos: una búsqueda o un seguimiento de enlace a escala de milisegundos, más una pasada corta y con presupuesto sobre un pasaporte. La varianza medida en unidades baratas mantiene el p95 cerca de la mediana. La varianza medida en rondas completas de recuperar y leer no, y esa es toda la historia de los 17.5 s.

Los presupuestos agregan una segunda garantía, más contundente: cada salto tiene presupuesto de tokens sobre MCP, así que la caminata no puede vagar indefinidamente. La línea base no tiene tal techo por construcción; le atornillas uno con una perilla de máximo de iteraciones, y entonces las preguntas difíciles golpean la perilla y fallan lento, que es la forma más cara de fallar.

El lado de tokens de esta misma comparación, 0.58x por respuesta correcta, está medido en RAG agéntico vs navegación con presupuesto, y la razón por la que la recuperación de un solo disparo no puede simplemente saltarse el bucle está en por qué el multi-salto rompe el RAG.

Las advertencias de siempre, a propósito

Once preguntas es un conjunto pequeño y lo decimos. El paper es un preprint y lo decimos. El corpus, los conjuntos de preguntas y el harness están versionados, cada tabla se regenera con un comando y el informe conserva un criterio que fallamos, porque los números que no puedes rederivar son marketing.

Cronometra tu propia cola

Despliega un bosque en cuatro comandos con la guía de despliegue, cablea tu agente sobre MCP y mide tu propio p95. Dale una estrella o haz fork al repo, y el resto vive en monkeyllm.com.

¿Quieres la versión larga?

El paper trae la arquitectura completa, las tablas del benchmark y los hallazgos que no cumplieron sus criterios.