Caso de estudio
Hive Mind: un jefe de gabinete de IA con un equipo detrás
Un sistema multiagente que construí para manejar mi propio trabajo. Le escribo como a un colega, y organiza, delega y recuerda, con reglas firmes sobre lo que puede hacer por su cuenta.
- Mi papel
- Diseño, desarrollo y operación
- Hecho con
- Hermes Agent, modelos de Claude y OpenAI, Discord, Signal, Git
- Estado
- En uso diario, sigue evolucionando
El problema
Manejo soporte de TI, marketing y una lista creciente de proyectos propios, casi siempre por mi cuenta. Los asistentes de IA ayudaban, pero cada chat nuevo empezaba de cero: tenía que volver a explicar el proyecto, las decisiones ya tomadas y lo que ya había intentado, cada vez. Y un solo asistente de uso general no encaja bien con un trabajo que salta entre investigar, programar y cuidar equipos.
Tanto volver a explicar, cambiar de contexto y llevar de la mano me costaba entre dos y tres horas al día. No quería un chatbot más listo; quería un pequeño equipo que recuerde, sepa quién hace qué y solo me busque cuando de verdad necesita una decisión.
Lo que construí
Hablo con un solo agente, Argus, desde Signal en el celular o un canal de Discord en la computadora. Argus entiende qué necesita cada petición y se la pasa al especialista correcto, cada uno funcionando como su propio agente con sus propias herramientas y límites:
Argus · Jefe de gabinete
Recibe cada petición, decide quién debe encargarse y es el único que puede actualizar la memoria compartida.
Dex · Desarrollador
Escribe y prueba código. Puede editar, correr pruebas y hacer commits locales, pero publicar, borrar y tocar credenciales le está prohibido.
Scout · Investigador
Investiga preguntas, compara opciones y reporta con fuentes.
Talos · Sistemas
Cuida las máquinas y corre revisiones programadas, como vigilar la salida de una versión de software cada seis horas.
Athena · Revisora
Entra solo cuando hace falta: arquitectura, seguridad y lanzamientos importantes.
Iris · Artista
Se encarga de imágenes y recursos visuales.
La pieza que hace que todo funcione es la memoria compartida: una base de conocimiento en Markdown guardada en Git. Todos los agentes la leen, así que el contexto y las decisiones se conservan entre sesiones. Solo Argus escribe en ella; los especialistas proponen cambios y Argus los archiva, para que se mantenga ordenada en lugar de volverse un montón de notas que se contradicen.
Un panel de "oficina" en vivo muestra a cada agente en su escritorio cuando está trabajando y de vuelta en la reunión cuando está libre, para ver de un vistazo qué está pasando.
Reglas y límites
Un equipo de agentes solo sirve si puedes confiar en él cuando no lo estás vigilando. Las reglas son simples y están fijas:
- Me pregunta por regla, no por intuición. Todo lo que toque dinero, credenciales, seguridad, sistemas en producción o borrar algo, una tarea que falle dos veces o fuentes que no coinciden, regresa a mí. La confianza del propio modelo nunca decide.
- El mínimo de permisos por agente. El desarrollador puede editar, probar y hacer commits locales; publicar, borrar, credenciales y configuración están bloqueados por completo. La revisora solo puede leer y correr pruebas.
- Un tope de gasto. El gasto normal en APIs tiene un tope mensual pequeño, y cualquier cosa por encima, o cualquier cambio de facturación, necesita mi aprobación.
- Sin un solo punto de falla. Cada agente tiene un modelo principal y un respaldo automático con otro proveedor, así que un límite de uso o una caída no detiene el trabajo.
Lo que salió mal, y lo que cambié
La primera versión se pasó de lista. Los agentes pasaron unos cinco días construyendo sistemas para verificar su propio trabajo (recibos, registros, revisiones de las revisiones) en lugar de entregar algo. Se veía muy cuidadoso y producía muy poco.
Así que lo reinicié. "Terminado" ahora significa tres cosas simples: el agente terminó sin errores, las pruebas pasan y el cambio realmente existe. Cada tarea va a una ejecución nueva como un solo trabajo completo en lugar de partirse en docenas de pasos, y la revisora solo entra cuando lo que está en juego lo justifica. Es más barato, más rápido y mucho más fácil de entender.
Esa es la lección principal que llevo al trabajo con clientes: el valor está en ciclos pequeños y bien cuidados que hacen un trabajo de forma confiable, no en el montaje de agentes más elaborado.
Resultados
Hasta ahora su proyecto más grande ha sido él mismo. Casi todo lo que hay en el panel de la oficina, desde las animaciones de los agentes caminando hasta el estado en vivo y las etiquetas de trabajo, lo construyó el equipo a partir de peticiones que envié en lenguaje normal, cada cambio entregado con sus pruebas pasando. También corre tareas fijas, como revisar cada seis horas si ya salió una versión de software que estoy esperando. Lo siguiente: encargarse del día a día de mis apps y sitios web.
Un ejemplo real, de una tarde:
- Desde mi celular: “Pídele a Dex que Argus aparezca como Trabajando en la oficina cada vez que atienda una petición, en cualquier plataforma. Guarda solo un estado y una hora, nunca el texto de los mensajes. Agrega pruebas, instálalo y haz commit.”
- Cinco minutos después: Argus ya había leído el código existente, escrito unas instrucciones completas y puesto a Dex a trabajar en segundo plano.
- Una hora después: Argus revisó el trabajo de Dex, encontró pruebas fallando y una regla rota, y se lo regresó una vez con correcciones. Yo no tuve que detectar ninguno de los dos problemas.
- Veinte minutos más tarde: “Construido, probado, instalado y con commit”, con todas las pruebas pasando; luego se detuvo a preguntarme antes de reiniciar algo en vivo. Tras un par de “reinicia ahora” de mi parte, confirmó la función funcionando de principio a fin.
Mi esfuerzo total: unos cuantos mensajes cortos, casi todos para decir que sí.
¿Algo así podría ayudar a tu equipo?
La mayoría de los negocios no necesita seis agentes. Necesita uno o dos haciendo bien un trabajo específico y repetitivo, con límites sensatos. Si hay algo que se está comiendo tu semana, con gusto te digo honestamente si vale la pena un agente.
Empecemos a platicar