Navega, no recuperes: cómo es una cacería real
Tres movimientos, una cacería trazada en el corpus de una empresa pequeña y por qué el mismo modelo 12B pasa de 0/11 a 11/11 cuando recorre un bosque en vez de leer chunks top-k pegados al contexto.

La recuperación top-k le entrega a tu modelo una pila de chunks y una plegaria. La navegación le entrega a tu agente un mapa, un presupuesto y piernas. Esto es lo que significa "Navega, no recuperes" (Navigate, don't retrieve) cuando una pregunta real golpea un corpus real: los tres movimientos, una cacería trazada de punta a punta y los números que nos hicieron comprometernos con el eslogan.
Tres movimientos, sin magia
Un bosque MonkeyLLM es un grafo autoalojado de notas pequeñas y curadas. Cada nodo lleva un pasaporte: un título, un resumen sujeto a sesenta tokens, tags y alias. Esa es la etiqueta que un agente puede leer sin pagar por abrir el nodo. Sobre esa estructura, los agentes hacen exactamente tres tipos de movimientos, expuestos como herramientas tipadas sobre MCP:
Navegar. El agente entra por búsqueda, lee los pasaportes a su alrededor, sigue un enlace y abre solo lo que necesita. Camina el grafo como tú caminas una wiki cuando tienes prisa: lees la etiqueta, decides, haces clic.
Plantar. El conocimiento nuevo se registra como nodos nuevos, pasaporte y enlaces incluidos, para que el bosque crezca en lugar de quedarse rancio.
Feromona. Las cacerías exitosas depositan rastros y acuñan enlaces de atajo. En términos llanos: las rutas que produjeron respuestas correctas quedan marcadas, como los senderos de las hormigas, y la misma clase de pregunta cuesta menos saltos la próxima vez.
Cada salto tiene presupuesto de tokens. El agente nunca recibe más que un pasaporte a menos que abra un nodo explícitamente, y cada apertura se descuenta de un presupuesto que el entorno hace cumplir.
Una cacería trazada
Toma un corpus cotidiano plausible: el conocimiento operativo de una empresa de cuarenta personas. Runbooks, postmortems, contratos con proveedores, notas de onboarding, un calendario de cumplimiento. Unos cientos de nodos una vez plantados.
La pregunta: ¿por qué los deploys a staging se pausan el primer lunes de cada mes?
El agente busca "pausa deploy staging" y entra por el nodo del Runbook de Deploys a Staging. Su pasaporte dice que es dueño del calendario de deploys y enlaza a una Política de Congelamiento de Cambios. El agente abre la política: los congelamientos están atados a ventanas de auditoría y cierre, con un enlace al Calendario de Cumplimiento. Un salto más: el calendario dice que la recolección de evidencia SOC 2 corre el primer lunes de cada mes, y los deploys se congelan mientras corre. El agente responde citando los tres nodos que pisó.
Costo total: una docena de pasaportes ojeados, tres nodos abiertos, unos cientos de tokens cada uno.
Ahora apunta la recuperación top-k clásica a la misma pregunta. "Staging", "deploy" y "lunes" encienden el runbook y un par de postmortems, mientras que el calendario de cumplimiento casi no comparte vocabulario con la consulta, así que nunca llega a la ventana de contexto. El dato que conecta vive en los enlaces entre documentos, y los enlaces son exactamente lo que un almacén plano de chunks descarta. Desarmamos ese modo de falla en por qué el multi-salto rompe el RAG: top-k es un solo salto por construcción, no importa cuán grande sea el k.
Los números detrás del eslogan
Lo medimos con 11 preguntas estrictamente multi-salto, cada una exigiendo al menos 3 saltos encadenados. El mismo modelo local 12B anota 0/11 como lector de RAG top-k clásico y 11/11 como navegador de bosque.
El modelo no cambió entre las columnas. El entorno sí. Esa es la apuesta de todo el sistema, y el argumento largo es el Principio del Bosque.
Honestidad, porque los eslóganes invitan al escepticismo: 11 preguntas es poco y lo decimos. El corpus, los conjuntos de preguntas y el harness están versionados, cada tabla se regenera con un comando y el informe conserva un criterio que fallamos justo al lado de los que pasamos.
Empieza a caminar
Todo lo anterior corre en una sola RTX 3060 con 12 GB; un 12B cuantizado cabe entero, y las tarjetas de 8 GB funcionan con cuantización más agresiva o apuntando el binding de chat a cualquier endpoint compatible con OpenAI. El motor es Apache-2.0 y un bosque se despliega con cuatro comandos: empieza por el quickstart o el recorrido con Docker.
Dale una estrella al proyecto en https://github.com/JimmyWesley/MonkeyLLM, o mejor, reproduce tú mismo la tabla de 0/11 a 11/11. Todo lo que necesitas está en https://monkeyllm.com.