
Dez Ferramentas Tipadas via MCP
Por que agentes recebem dez ferramentas pequenas, tipadas e com orçamento de tokens via MCP em vez de uma caixa de busca gigante, e o que isso compra em tokens, latência e falhas legíveis.
4 min de leitura
Blog
Notas de engenharia sobre navegação, ingestão, memória de agentes e benchmark honesto, escritas por quem rodou os experimentos.

Por que agentes recebem dez ferramentas pequenas, tipadas e com orçamento de tokens via MCP em vez de uma caixa de busca gigante, e o que isso compra em tokens, latência e falhas legíveis.
4 min de leitura

17.5 s p95 no RAG iterativo, 8.4 s no navegador, mesmo modelo 12B. Uma dissecação dos dois loops, e por que variância medida em saltos baratos, e não em rodadas inteiras de recuperar-e-ler, derruba a cauda.
4 min de leitura

Título, resumo de sessenta tokens, tags, aliases: por que o passaporte é onde o MonkeyLLM gasta sua inteligência, e como o BM25 com pesos por campo transforma curadoria em recall@5 = 1.00 a 1.3 ms.
4 min de leitura

A categoria pressupõe um serviço de embeddings, um índice ANN e uma GPU. Medimos a busca de entrada em recall@5 = 1.00 a 1.3 ms p95 com BM25 sobre SQLite, e mantivemos o embedder opcional.
4 min de leitura
O paper traz a arquitetura completa, as tabelas do benchmark e os achados que não bateram seus critérios.