Una pregunta de tres saltos, ejemplo resuelto
Una pregunta, tres documentos, trazada dos veces: mira a la recuperación top-k estancarse en una pregunta de tres saltos y luego mira al mismo corpus responderla cuando un agente lo camina nodo por nodo.

Todo argumento sobre recuperación multi-salto termina necesitando un ejemplo resuelto. Aquí va uno: una sola pregunta sobre una wiki corporativa plausible, trazada dos veces, una a través de recuperación top-k y otra como caminata por un bosque de conocimiento (un grafo enlazado de documentos por el que un agente se mueve). Si quieres primero la teoría, empieza por por qué el multi-salto rompe el RAG; este post es la traza que lo acompaña.
El corpus y la pregunta
Imagina la wiki interna de una empresa mediana, llamémosla Northwind Robotics: unos cientos de documentos entre páginas de servicios, runbooks, registros de decisiones de arquitectura y postmortems. Un ingeniero nuevo pregunta:
¿A qué equipo le llega la alerta cuando falla el export detrás del dashboard trimestral de ingresos?
La respuesta existe, pero está repartida en tres documentos:
- La página del dashboard dice que sus datos vienen del export
finance-mart. - La página de finance-mart dice que el export corre como un job nocturno en
atlas-pipelines. - El runbook de atlas-pipelines dice que las fallas de jobs alertan al on-call de Data Platform.
Ningún documento contiene a la vez "dashboard trimestral de ingresos" y "Data Platform". La respuesta solo aparece cuando encadenas los tres, lo que la vuelve una pregunta estrictamente de tres saltos.
Lo que devuelve la recuperación top-k
Embebe la pregunta, trae los cinco chunks más similares. Lo que vuelve es exactamente lo que la similitud promete: chunks sobre el dashboard (sus widgets, su calendario de refresco), la frase que nombra a finance-mart y quizá un postmortem que casualmente contiene "dashboard" y "falló" en el mismo párrafo.
El único documento que nombra la respuesta, el runbook de atlas-pipelines, puntúa cerca del fondo de todo el corpus para esta consulta. Nunca menciona dashboards ni ingresos. No comparte vocabulario con la pregunta y comparte muy poca semántica. Nunca iba a ser recuperado, sin importar qué tan bueno sea el modelo de embeddings, porque la relevancia respecto de la pregunta no es lo mismo que la relevancia respecto de la respuesta.
El modelo lector ahora sostiene media evidencia, y hace lo que los modelos de lenguaje hacen con media evidencia: adivina un equipo plausible, o se niega a responder. La recuperación disparó una vez. La pregunta necesitaba tres disparos, cada uno condicionado por lo que encontró el anterior. Top-k es un solo salto por construcción.
La misma pregunta, caminada
Ahora dale el mismo corpus a MonkeyLLM. Cada documento se convierte en un nodo con un pasaporte (una pequeña ficha curada: título, resumen, tags), y los nodos se enlazan donde los documentos se referencian entre sí. Navega, no recuperes (Navigate, don't retrieve).
- Entrar. Busca "dashboard trimestral de ingresos". El agente aterriza en el nodo del dashboard.
- Salto 1. El resumen del pasaporte menciona una fuente de datos. El agente abre el nodo, encuentra el enlace a
finance-marty lo sigue. - Salto 2. El pasaporte de finance-mart ya dice "export nocturno en atlas-pipelines". Sigue el enlace, sin necesidad de abrir el cuerpo completo.
- Salto 3. Abre solo la sección de alertas del runbook: el on-call de Data Platform.
La respuesta llega con los tres ids de nodo sobre los que se apoya, y cada salto tuvo presupuesto de tokens: leer un pasaporte es barato, y abrir un documento completo ocurre solo cuando la etiqueta dice que vale la pena.
Hay un movimiento más que vale mencionar. La cacería exitosa deposita feromona (un rastro de uso sobre el camino que tomó), y puede acuñarse un enlace de atajo desde el nodo del dashboard hacia el runbook. La próxima pregunta parecida es un solo salto.
Esto no es solo un cuento
La traza de arriba es inventada; la medición no. En 11 preguntas estrictamente multi-salto, cada una exigiendo al menos 3 saltos encadenados, el mismo modelo local 12B anotó 0/11 como lector de RAG top-k clásico y 11/11 como navegador de bosque.
Once preguntas es un conjunto pequeño, y lo decimos. El corpus, los conjuntos de preguntas y el harness están versionados, y cada tabla se regenera con un comando.
Traza una tuya
Toma una pregunta que tu equipo haga de verdad y cuenta los saltos. Si la cuenta pasa de uno, top-k nunca iba a responderla. Dale una estrella al repo, despliega un bosque con cuatro comandos desde el quickstart y corre la traza tú mismo en monkeyllm.com.