Por qué los senderos no convergieron
El aprendizaje de senderos falló su criterio de convergencia: los saltos cayeron cerca de la mitad del umbral. El post-mortem: por qué una entrada afilada y una curaduría disciplinada dejaron casi nada que comprimir.

Fijamos un criterio de convergencia para el aprendizaje de senderos, lo medimos y lo fallamos: los conteos de saltos cayeron aproximadamente la mitad del umbral que habíamos fijado. El informe lo dice en texto plano. Este es el post-mortem de ingeniería: qué se suponía que compraban los senderos, por qué este bosque les dejó casi nada que comprar y dónde deberían empezar a pagar.
Qué se suponía que hacían los senderos
En un bosque MonkeyLLM, un agente responde preguntas navegando. Entra por búsqueda, lee el pasaporte de un nodo (su ficha curada: título, resumen, tags), sigue un enlace y abre solo lo que necesita. La feromona es el tercer movimiento: las cacerías exitosas depositan rastros a lo largo del camino que tomaron, y los rastros repetidos acuñan enlaces de atajo. En términos llanos, los caminos que funcionan se pavimentan.
La hipótesis era simple. Corre la misma clase de cacerías repetidamente sobre el mismo territorio, y el promedio de saltos por respuesta correcta debería tender a la baja, asentándose por debajo de un umbral que fijamos antes de correr nada. Las colonias de hormigas lo hacen. Esperábamos que el bosque también.
Qué medimos en cambio
Los saltos sí cayeron. Cayeron aproximadamente la mitad del umbral, y el criterio no se cumplió. Lo escribimos y publicamos el informe con la falla adentro, porque un benchmark que solo se puede aprobar no es un benchmark. La pieza compañera, por qué el informe conserva una sección de fallas, cubre la decisión de política. Este post cubre la mecánica.
No había casi nada que comprimir
La búsqueda de entrada en este corpus es BM25 sobre SQLite: recall@5 = 1.00 a 1.3 ms p95. Sin embeddings, sin base de datos vectorial, sin GPU. Ponderar los campos curados del pasaporte (título, alias) cerró por completo la brecha con la búsqueda híbrida; el embedder sigue soportado y opcional, simplemente no hizo falta aquí.
Con una entrada así de afilada y pasaportes así de disciplinados, el navegador aterriza junto a su objetivo en frío. En este benchmark promedia alrededor de un salto y medio por respuesta antes de que exista sendero alguno. El aprendizaje de senderos funciona comprimiendo caminos, y una caminata de un salto y medio casi no tiene holgura: el piso es un salto, así que al mecanismo se le pidió exprimir ahorros de un corredor que ya era casi recto. Exprimió menos de lo que el criterio exigía.
Curaduría y senderos son sustitutos económicos
La conclusión no es que los senderos no funcionan. Es que la curaduría y el aprendizaje de senderos compran el mismo bien, caminatas futuras más cortas, con dos presupuestos distintos. La curaduría paga en tiempo de escritura: la ingesta gasta 1.71 s por documento construyendo pasaportes cuyos resúmenes pasan un contrato de sesenta tokens. Los senderos pagan en tiempo de lectura, con cargo a cacerías que ya tuvieron éxito. En un corpus donde el gasto de escritura ya entrega caminatas casi al piso, no queda nada que el aprendizaje de lectura pueda comprar.
Ese encuadre hace una predicción comprobable. Los senderos deberían pagar en corpus más profundos, donde la búsqueda de entrada te deja en la región correcta en lugar del nodo exacto, y las caminatas se estiran a muchos saltos. Ahí, un atajo pavimentado ahorra tokens reales en cada cacería futura. También se alinea con el Principio del Bosque: gasta inteligencia en el entorno para gastar menos en el modelo. La gastamos primero en curaduría, y en un benchmark de 11 preguntas de caminatas cortas, la curaduría le comió el almuerzo al aprendizaje de senderos. 11 preguntas es poco, y lo decimos.
Qué cambia, qué se queda
La feromona se queda en el motor. El criterio incumplido se queda en el informe exactamente como se midió. Los próximos corpus se vuelven más profundos a propósito, porque si el encuadre de sustitutos es correcto, los ahorros de senderos deberían aparecer más o menos donde la entrada curada deja de bastar por sí sola.
Reproduce la falla
El corpus, los conjuntos de preguntas y el harness están versionados, y cada tabla se regenera con un comando, incluida la que fallamos. Clona MonkeyLLM en GitHub, vuelve a correr el experimento de senderos en tu propio corpus y cuéntanos dónde empieza la convergencia para ti. El preprint y todo lo demás viven en monkeyllm.com.