Ir al contenido
ragbenchmarkcost

Los parches habituales, y dónde se detienen

Rerankers, reescritura, HyDE, bucles y agentes: todos ayudan, y por eso están en todas partes. Esto cuesta cada uno, aquí se detiene cada uno en multi-salto, y esta es la brecha que queda, medida.

Equipo MonkeyLLM5 min de lectura

Nadie entrega RAG top-k ingenuo y lo deja en paz; las fallas multi-salto aparecen la primera semana y los parches llegan la segunda. Rerankers, reescritura de consultas, HyDE, bucles iterativos, recuperación agéntica: cada uno arregla algo real, que es exactamente por lo que están en todas partes. La pregunta útil es qué cuesta cada uno, y dónde se detiene cada uno.

Rerankers

Qué arreglan: el orden. Un cross-encoder lee la consulta y cada candidato juntos y captura relevancia que el recuperador de primera etapa puntuó mal. En preguntas de un salto con una lista profunda de candidatos, suele ser la ganancia de calidad más barata disponible.

Qué cuestan: una pasada extra de modelo sobre cada candidato, con latencia que crece con la profundidad de la lista.

Dónde se detienen: un reranker solo puede reordenar lo que la recuperación trajo. La falla multi-salto es una falla de ausencia, no de orden. El documento que nombra la respuesta final típicamente no comparte vocabulario con la pregunta, puntúa cerca del fondo de todo el corpus y no está en el top 50 para empezar. Ninguna permutación del conjunto recuperado lo contiene.

Reescritura de consultas

Qué arregla: el desajuste de vocabulario y las consultas subespecificadas. Es barata, y muchas veces vale la pena.

Dónde se detiene: una consulta mejor sigue siendo una consulta. La reescritura talla una llave mejor para la misma única cerradura. Una pregunta de tres saltos son tres cerraduras, y solo aprendes cómo es la segunda llave después de abrir la primera puerta.

HyDE

Qué arregla: la brecha consulta-documento. Genera un documento de respuesta hipotético, embebe eso en lugar de la consulta, y la recuperación de paráfrasis de un salto mejora de verdad.

Dónde se detiene: para escribir texto que se parezca al documento del salto tres, el modelo tendría que conocer ya las respuestas de los saltos uno y dos. HyDE alucina un destino; el problema multi-salto es no conocer la ruta.

Bucles iterativos

Qué arreglan: la estructura real del problema. Descomponer la pregunta, recuperar, leer, volver a recuperar. Esta es la línea base honesta, porque da saltos de verdad.

Qué cuestan, medido y no afirmado: contra la navegación de bosque con presupuesto, en las mismas preguntas con el mismo modelo local, el navegador gastó 0.58x tokens por respuesta correcta vs la línea base de RAG iterativo, a 8.4 s p95 vs los 17.5 s de la línea base.

Gráfico de tokens por respuesta correcta: línea base de RAG iterativo en 1.00x versus el navegador en 0.58x
Gráfico de tokens por respuesta correcta: línea base de RAG iterativo en 1.00x versus el navegador en 0.58x
Gráfico de latencia p95: 17.5 s para la línea base iterativa versus 8.4 s del navegador
Gráfico de latencia p95: 17.5 s para la línea base iterativa versus 8.4 s del navegador

Por respuesta correcta es el denominador que importa, porque un bucle que falla rápido parece barato por intento mientras es caro por respuesta. Fallar barato no es economía. La medición completa está en RAG agéntico vs navegación con presupuesto.

Dónde se detienen: cada iteración busca en la misma pileta plana de chunks. No hay estructura por la cual guiarse, no hay etiqueta barata que leer antes de pagar por un chunk completo, y nada de lo aprendido en una corrida sobrevive a la siguiente.

Recuperación agéntica

Qué arregla: la planificación. Dale al modelo la búsqueda como herramienta y deja que decida cuándo volver a llamarla. Es el pariente más cercano de lo que construimos, y sí ayuda.

Dónde se detiene: es agencia sobre sopa de chunks. El agente puede razonar, pero el entorno no le da nada sobre lo cual razonar: sin enlaces que seguir de un documento a su dependencia nombrada, sin pasaportes (fichas curadas de título, resumen y tags) que leer antes de abrir nada, sin presupuesto que dé forma a la caminata y sin feromona (rastros de uso de cacerías exitosas pasadas) acumulándose en atajos. La misma agencia sobre terreno estructurado es de donde salieron los números de arriba.

El patrón en los parches

Cada parche agrega inteligencia en tiempo de lectura para compensar estructura que el almacén nunca tuvo. Apila los cinco y sigues aproximando, a precios de inferencia, lo que un corpus enlazado y etiquetado provee directamente. La alternativa es pagar una vez en tiempo de escritura y estructurar el corpus en sí. Para saber por qué top-k se estanca en primer lugar, mira por qué el multi-salto rompe el RAG.

Lee los números, incluido el fallido

El preprint también reporta un criterio de convergencia que no cumplimos, y lo conserva en el informe (aquí el porqué). Lee el preprint vía monkeyllm.com, y si el encuadre se sostiene, dale una estrella al repo.

¿Quieres la versión larga?

El paper trae la arquitectura completa, las tablas del benchmark y los hallazgos que no cumplieron sus criterios.