Ingesta de 100 documentos reales: el costo se paga al escribir
La ingesta es donde el bosque gasta su esfuerzo: 1.71 s por documento, contrato de sesenta tokens aprobado al 100%, cero enlaces rotos. Pagar una vez al escribir, en un lote visible, no en cada consulta para siempre.

Los pipelines de recuperación pagan su impuesto en tiempo de lectura, en cada consulta, para siempre. MonkeyLLM mueve ese costo al tiempo de escritura, una vez por documento, en un lote que puedes ver terminar. Esto es lo que el pipeline de ingesta le hace realmente a cada documento, y lo que costó en 100 reales.
Qué le pasa a un documento
Cada documento que entra al bosque se convierte en un nodo con un pasaporte curado: un título, un resumen y tags (el pasaporte es la pequeña etiqueta que un agente lee antes de decidir si abre el nodo completo). El pipeline redacta ese pasaporte, cablea el nodo al grafo con enlaces y lo registra. En términos del bosque el movimiento se llama Plantar: conocimiento nuevo registrado como nodos nuevos.
Toda esta ceremonia existe para el camino de lectura. Los agentes navegan leyendo etiquetas y siguiendo enlaces, abriendo solo lo que necesitan, así que la etiqueta es el producto. Un resumen descuidado en tiempo de escritura se convierte en un salto desperdiciado en cada caminata futura.
El contrato de sesenta tokens
El resumen de cada pasaporte se sujeta a un contrato: sesenta tokens. No "más o menos un párrafo", un límite verificable que el pipeline hace cumplir y reporta. En nuestra corrida de ingesta de 100 documentos heterogéneos del mundo real, el 100% de los resúmenes pasó el contrato de sesenta tokens. Cuando el lote reporta terminado, cada etiqueta del bosque es una que un agente puede permitirse leer con presupuesto.
Cero enlaces rotos
La segunda postcondición es estructural: cero enlaces rotos después del lote. Cada arista creada durante la ingesta resuelve a un nodo que existe. Suena a vara baja hasta que has visto a un agente caminar hacia una referencia muerta a mitad de cacería; un bosque donde cada camino lleva a alguna parte es lo que vuelve la navegación con presupuesto predecible en lugar de esperanzada.
1.71 segundos por documento, medido
El tratamiento completo (redacción del pasaporte, enlazado, verificación) cuesta 1.71 s por documento, medido en esos mismos 100 documentos en nuestro rig de una sola RTX 3060.
Ahora compara las formas de los dos costos. La ingesta es un lote: acotado, visible, hecho una vez. La pantalla Ingest del Studio (la portada de este post) lo muestra como un trabajo que puedes mirar, archivos, carpetas y clips pasando uno por uno. El costo de lectura es un medidor que nunca deja de correr. Pagar 1.71 s por documento una vez es lo que permite que la búsqueda de entrada se quede en BM25 sobre SQLite, con recall@5 = 1.00 y 1.3 ms p95, sin embeddings, sin base de datos vectorial y sin GPU en el camino de consulta. El ensayo del Principio del Bosque hace este argumento en forma general; este post es el mismo argumento en números.
Los números se regeneran
100 documentos es un corpus real, no uno grande, y lo decimos. El corpus, los conjuntos de preguntas y el harness están versionados, y cada tabla del informe se regenera con un comando, la de ingesta incluida. Tus documentos son casi con seguridad más raros que los nuestros; la prueba honesta es correr el pipeline sobre ellos y ver si el contrato todavía aguanta. Las primitivas detrás de nodos, pasaportes y enlaces están descritas en los docs de primitivas.
Aliméntalo con algo real
Despliega con cuatro comandos desde el quickstart, apunta un trabajo de ingesta a tu carpeta más fea y mira correr el lote. Luego reproduce nuestra tabla desde github.com/JimmyWesley/MonkeyLLM, o empieza con el tour en monkeyllm.com.