Os Remendos de Sempre, e Onde Eles Param
Rerankers, reescrita, HyDE, loops e agentes ajudam, e por isso estão em toda parte. Aqui está o que cada um custa, onde cada um para no multi-hop, e a lacuna que sobra, medida.

Ninguém entrega RAG top-k ingênuo e o deixa em paz; as falhas multi-hop aparecem na primeira semana, e os remendos chegam na segunda. Rerankers, reescrita de consulta, HyDE, loops iterativos, recuperação agêntica: cada um conserta algo real, e é exatamente por isso que estão em toda parte. A pergunta útil é o que cada um custa, e onde cada um para.
Rerankers
O que consertam: a ordenação. Um cross-encoder lê a consulta e cada candidato juntos e captura relevância que o recuperador de primeiro estágio pontuou mal. Em perguntas de um salto com uma lista funda de candidatos, essa costuma ser a vitória de qualidade mais barata disponível.
O que custam: uma passada extra de modelo sobre cada candidato, com a latência crescendo com a profundidade da lista.
Onde param: um reranker só reordena o que a recuperação buscou. A falha multi-hop é uma falha de ausência, não de ordenação. O documento que nomeia a resposta final tipicamente não compartilha vocabulário com a pergunta, pontua perto do fundo do corpus inteiro e não está nem no top 50 para começar. Nenhuma permutação do conjunto recuperado o contém.
Reescrita de consulta
O que conserta: descompasso de vocabulário e consultas subespecificadas. É barata, e muitas vezes vale a pena.
Onde para: uma consulta melhor ainda é uma consulta só. A reescrita corta uma chave melhor para a mesma fechadura única. Uma pergunta de três saltos são três fechaduras, e você só descobre o formato da segunda chave depois de abrir a primeira porta.
HyDE
O que conserta: a lacuna consulta-documento. Gere um documento hipotético de resposta, faça o embedding dele em vez da consulta, e a recuperação de paráfrase de um salto genuinamente melhora.
Onde para: para escrever um texto que se pareça com o documento do salto três, o modelo precisaria já saber as respostas dos saltos um e dois. O HyDE alucina um destino; o problema multi-hop é não saber a rota.
Loops iterativos
O que consertam: a estrutura real do problema. Decompor a pergunta, recuperar, ler, recuperar de novo. Este é o baseline honesto, porque dá saltos de verdade.
O que custam, medido em vez de afirmado: contra a navegação de floresta orçada, nas mesmas perguntas com o mesmo modelo local, o navegador gastou 0.58x tokens por resposta correta vs o baseline de RAG iterativo, a 8.4 s p95 vs 17.5 s do baseline.
Por resposta correta é o denominador que importa, porque um loop que falha rápido parece barato por tentativa sendo caro por resposta. Falhar barato não é economia (failing cheaply is not economy). A medição completa está em RAG agêntico vs navegação orçada.
Onde param: cada iteração busca no mesmo pool plano de chunks. Não há estrutura para se guiar, nenhum rótulo barato para ler antes de pagar por um chunk inteiro, e nada aprendido em uma execução sobrevive até a próxima.
Recuperação agêntica
O que conserta: o planejamento. Dê ao modelo a busca como ferramenta e deixe-o decidir quando chamá-la de novo. Este é o parente mais próximo do que construímos, e ajuda de verdade.
Onde para: é agência sobre sopa de chunks. O agente pode raciocinar, mas o ambiente não lhe dá nada sobre o que raciocinar: nenhum link para seguir de um documento à sua dependência nomeada, nenhum passaporte (cartão curado de título, resumo e tags) para ler antes de abrir qualquer coisa, nenhum orçamento moldando a caminhada e nenhum feromônio (rastros de uso de caçadas passadas bem-sucedidas) se acumulando em atalhos. A mesma agência sobre terreno estruturado é de onde saíram os números acima.
O padrão nos remendos
Todo remendo adiciona inteligência no tempo de leitura para compensar a estrutura que o repositório nunca teve. Empilhe os cinco e você ainda estará aproximando, a preços de inferência, o que um corpus linkado e rotulado fornece diretamente. A alternativa é pagar uma vez no tempo de escrita e estruturar o próprio corpus. Para entender por que o top-k trava logo de saída, veja por que multi-hop quebra o RAG.
Leia os números, incluindo o que falhou
O preprint também reporta um critério de convergência que não atingimos, e o mantém no relatório (eis o porquê). Leia o preprint via monkeyllm.com, e se o enquadramento se sustentar, dê uma estrela no repo.