
Os Remendos de Sempre, e Onde Eles Param
Rerankers, reescrita, HyDE, loops e agentes ajudam, e por isso estão em toda parte. Aqui está o que cada um custa, onde cada um para no multi-hop, e a lacuna que sobra, medida.
4 min de leitura
Blog
Notas de engenharia sobre navegação, ingestão, memória de agentes e benchmark honesto, escritas por quem rodou os experimentos.

Rerankers, reescrita, HyDE, loops e agentes ajudam, e por isso estão em toda parte. Aqui está o que cada um custa, onde cada um para no multi-hop, e a lacuna que sobra, medida.
4 min de leitura

Título, resumo de sessenta tokens, tags, aliases: por que o passaporte é onde o MonkeyLLM gasta sua inteligência, e como o BM25 com pesos por campo transforma curadoria em recall@5 = 1.00 a 1.3 ms.
4 min de leitura

Corpus, conjuntos de perguntas e harness estão commitados, e cada tabela é regenerada com um comando. Quando a manchete é 0/11 versus 11/11 para o mesmo modelo, a única resposta honesta à desconfiança é rodar de novo.
4 min de leitura

O rig do benchmark é uma RTX 3060, mas nada exige que você tenha uma GPU. Aponte o binding de chat para qualquer endpoint compatível com OpenAI e deixe a floresta fazer o trabalho estrutural.
4 min de leitura

Custo por consulta faz a falha parecer desconto. Medido por resposta correta, o navegador de floresta gasta 0.58x os tokens de um baseline de RAG iterativo, mesmo modelo 12B. Aqui está a aritmética.
4 min de leitura

A categoria pressupõe um serviço de embeddings, um índice ANN e uma GPU. Medimos a busca de entrada em recall@5 = 1.00 a 1.3 ms p95 com BM25 sobre SQLite, e mantivemos o embedder opcional.
4 min de leitura

Toda sessão de agente começa reconstruindo contexto que a anterior já pagou. O que uma memória de floresta persistente e cultivável muda nos fluxos de agentes, e o arquivo de skills que faz os agentes usá-la de verdade.
4 min de leitura

O aprendizado de trilhas errou o critério de convergência: os saltos caíram cerca de metade do limiar. O post-mortem: por que busca de entrada afiada e curadoria disciplinada deixaram quase nada para comprimir.
4 min de leitura

Quatro comandos para subir, uma tela para reivindicar, uma pasta para ingerir e uma primeira resposta que chega pisando nos nós exatos que leu. Seus primeiros dez minutos com uma floresta de conhecimento.
4 min de leitura
O paper traz a arquitetura completa, as tabelas do benchmark e os achados que não bateram seus critérios.