Ir al contenido
guideself-hosting

De cero a una respuesta fundamentada en diez minutos

Cuatro comandos para desplegar, una pantalla para reclamarlo, una carpeta para ingestar y una primera respuesta que llega apoyada en los nodos exactos que leyó. Tus primeros diez minutos con un bosque de conocimiento.

Equipo MonkeyLLM4 min de lectura

La mayoría de las herramientas de conocimiento te hacen ganarte la demo con una tarde de configuración antes de que aparezca la primera respuesta útil. La primera sesión de MonkeyLLM es deliberadamente corta: desplegar, reclamar, ingestar, preguntar. Esta es la versión de diez minutos, con lo que deberías ver en pantalla en cada paso.

Qué estás por ejecutar

MonkeyLLM es un bosque de conocimiento autoalojado: un grafo enlazado de notas pequeñas y curadas que tus agentes de IA caminan nodo por nodo, en lugar de un índice vectorial al que consultan por chunks top-k. La distinción es todo el producto, porque la recuperación top-k es un solo salto por construcción y las preguntas reales encadenan saltos; lo desarmamos en por qué el multi-salto rompe el RAG. Hoy es puramente práctico. Navega, no recuperes (Navigate, don't retrieve).

Todo corre en tus máquinas. El motor es Apache-2.0, las apps son AGPL y tus datos nunca salen de tu infra.

Cuatro comandos hasta una Station corriendo

El despliegue es docker compose, cuatro comandos en total. Mantenemos los comandos exactos en un solo lugar para que nunca se desalineen del código: el quickstart tiene la versión corta, la guía de despliegue tiene las opciones y el recorrido de self-hosting con Docker explica cada paso si este es tu primer archivo compose.

En hardware tienes margen. Nuestro rig de benchmark es una sola RTX 3060 con 12 GB, y un modelo 12B cuantizado cabe entero. Las tarjetas de 8 GB funcionan con cuantización más agresiva o con offload a CPU vía llama.cpp. Sin GPU también funciona: apunta el binding de chat a cualquier endpoint compatible con OpenAI (OpenRouter, un servidor llama.cpp, Ollama) y el resto de esta sesión es idéntico.

Cuando los contenedores están arriba, la Station sirve la consola en tu navegador.

Primer arranque: reclama tu bosque

Tu primera visita cae en la pantalla de configuración. Aquí creas la cuenta de propietario, y todo lo demás en la consola (claves, bindings de modelos, control de acceso) desciende de esa cuenta. No hay apretón de manos con la nube ni licencia que llame a casa. Es tu bosque desde el primer clic.

La pantalla de configuración del primer arranque donde se crea la cuenta de propietario
La pantalla de configuración del primer arranque donde se crea la cuenta de propietario

Ingesta una carpeta, mira el trabajo correr

Apunta un trabajo de ingesta a una carpeta de documentos reales. Cada uno se convierte en un nodo con un pasaporte curado (su título, resumen y tags: la pequeña etiqueta que un agente lee antes de decidir abrir el nodo). El resumen se sujeta a un contrato duro de sesenta tokens, porque estos pasaportes son lo que toda caminata futura va a leer.

La ingesta es donde MonkeyLLM gasta su esfuerzo, y el gasto es visible: la pantalla Ingest muestra archivos, carpetas y clips como un trabajo que puedes ver avanzar.

Un trabajo de ingesta en la consola Studio, procesando una carpeta archivo por archivo
Un trabajo de ingesta en la consola Studio, procesando una carpeta archivo por archivo

Para calibrar: en 100 documentos heterogéneos del mundo real medimos 1.71 s por documento, con el 100% de los resúmenes pasando el contrato de sesenta tokens y cero enlaces rotos después.

Pregunta, y mira sobre qué se apoya la respuesta

Abre la pantalla Ask (la portada de este post) y pregunta algo que cruce documentos. La respuesta llega apoyada en los nodos que usó: el agente entró por búsqueda, leyó etiquetas, siguió enlaces, abrió solo lo que necesitaba, y la pantalla muestra ese camino.

Esta estructura es la razón de que el mismo modelo local 12B que anota 0/11 en nuestro benchmark estrictamente multi-salto como lector de RAG top-k clásico anote 11/11 como navegador de bosque. Es un benchmark pequeño, 11 preguntas, y lo decimos sin rodeos; el corpus, los conjuntos de preguntas y el harness están versionados, y cada tabla se regenera con un comando.

Tus diez minutos empiezan ahora

Cuatro comandos y una carpeta son todo lo que pedimos. Despliega desde el quickstart, y si tu primera respuesta fundamentada aterriza como aterrizó la nuestra, dale una estrella al repo en GitHub o sigue leyendo en monkeyllm.com.

¿Quieres la versión larga?

El paper trae la arquitectura completa, las tablas del benchmark y los hallazgos que no cumplieron sus criterios.