La reproducibilidad es una feature
Corpus, conjuntos de preguntas y harness versionados, y cada tabla se regenera con un comando. Cuando el titular es 0/11 contra 11/11 para el mismo modelo, la única respuesta honesta a la sospecha es volver a correrlo.

Cada número del informe de MonkeyLLM se regenera desde el repositorio con un comando. El corpus está versionado, los conjuntos de preguntas están versionados, el harness está versionado. Eso no es diligencia por sí misma: es el pitch.
Qué viaja en el repo
Tres cosas viajan juntas en el repositorio de GitHub: el corpus, los conjuntos de preguntas (incluidas las 11 estrictamente multi-salto, cada una exigiendo al menos 3 saltos encadenados) y el harness que corre ambos pipelines y los califica. No hay conjunto de prueba privado, no hay tabla ajustada a mano y no hay figura en el paper que el harness no pueda reconstruir. Borra nuestros resultados y vuelven a crecer.
El número que exige una repetición
El titular es exactamente la clase de resultado que debería poner suspicaz a un ingeniero: el mismo modelo local 12B anota 0/11 como lector de RAG top-k clásico y 11/11 como navegador de bosque.
Escribimos sobre el mecanismo en por qué el multi-salto rompe el RAG, pero ningún ensayo sustituye al harness. Un salto de cero a perfecto se gana el escepticismo, y la única respuesta honesta al escepticismo es un comando que puedes correr tú mismo.
El rig es aburrido a propósito
Todo se midió en una sola RTX 3060 con 12 GB; un 12B cuantizado cabe entero. Las tarjetas de 8 GB funcionan con cuantización más agresiva o con offload a CPU vía llama.cpp, y si no tienes GPU puedes apuntar el binding de chat a cualquier endpoint compatible con OpenAI (OpenRouter, llama.cpp, Ollama). Un benchmark que solo se reproduce en un clúster está más cerca de un comunicado de prensa. Este se reproduce en una tarjeta de juegos.
Un comando por tabla
Cada tabla del informe la regenera el mismo punto de entrada que la produjo: los puntajes multi-salto, la economía de tokens y latencia, las cifras de búsqueda de entrada y los costos de ingesta (1.71 s por documento en 100 documentos heterogéneos del mundo real, 100% de los resúmenes pasando un contrato de sesenta tokens, cero enlaces rotos después). Si un commit futuro cambia un número, el diff aparece donde los diffs pertenecen: en el control de versiones, no silenciosamente en un post del blog.
"Córrelo con tus propios datos" es el pitch
MonkeyLLM es autoalojado, así que la reproducción no tiene que detenerse en nuestro corpus. Ingesta tus propios documentos, planta un bosque y hazle tus propias preguntas. La pantalla Data del Studio te da SQL de solo lectura sobre los nodos de dataset, para que inspecciones exactamente sobre qué está parado tu agente cuando responde. Si la navegación solo le ganara a la recuperación en nuestro corpus escogido a mano, valdría la pena saberlo, y quedas totalmente equipado para averiguarlo. Por eso "córrelo con tus propios datos" es el pitch del producto, no un descargo enterrado en una sección de limitaciones.
La letra honesta
El paper es un preprint, y lo decimos. 11 preguntas es poco, y lo decimos. Un criterio de convergencia no se cumplió y permanece en el informe; el análisis profundo de por qué los senderos no convergieron es su propio post. Un benchmark pequeño no puede probar mucho por sí solo, pero un benchmark pequeño y reproducible puede ser repetido, extendido y desafiado por cualquiera, y ese es el punto.
A un comando de distancia
Dale una estrella a MonkeyLLM en GitHub, regenera una tabla y luego mete tus propios datos partiendo del quickstart. El preprint está en monkeyllm.com.