
Dentro del benchmark de 11 preguntas
Once preguntas, cada una exigiendo al menos tres saltos encadenados. El mismo modelo 12B anota 0/11 como lector de RAG top-k y 11/11 como navegador de bosque. Así se construyó el benchmark y así se vuelve a correr.
4 min de lectura


