En los últimos 3 años, he pasado más de 2,000 horas programando con IA, y he entrevistado personalmente a algunas de las personas más productivas en el ámbito de la Ingeniería Agentica.
A continuación, mi configuración completa de Ingeniería Agentica tal como está actualmente, en el tercer trimestre de 2026.
Interfaz
Esto se refiere a la interfaz de usuario (UI) o línea de comandos (CLI) con la que interactúas con los agentes. Mi interfaz principal es bb.
Es de código abierto, completamente gratis, y te permite usar cualquier suscripción, cualquier agente, cualquier modelo dentro de una sola interfaz gráfica. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes, todo dentro de la misma interfaz.
El problema con aplicaciones como Codex o Cursor es que solo permiten sus propios modelos y su propia suscripción. El objetivo es obtener la mayor cantidad de tokens por la menor cantidad de dinero.
Todas las funciones que te gustan de las aplicaciones Codex o Cursor están dentro de bb, y mejora cada semana (además, es completamente de código abierto y 100% gratis de usar).
Otra cosa que uso mucho es cmux.
Cuando inicias un nuevo espacio de trabajo de cmux, puedes dividir la pantalla como lo harías en tmux (de ahí el nombre similar), iniciar diferentes terminales en cada panel, y hay un navegador integrado.
Donde cmux falla es cuando tienes muchos agentes y espacios de trabajo. La barra lateral izquierda realmente no es la herramienta adecuada. Está bien para un par de cosas, pero para un trabajo serio de ingeniería agentica a gran escala, no es lo mejor.
Uso Ghostty como mi terminal porque es muy rápida y nativa.
Dentro de Ghostty, puedes ejecutar Herdr, que es básicamente tmux pero para agentes, un entorno de ejecución en segundo plano para agentes. Muy mínimo, muy ligero, vive en la terminal, y cuando un agente termina, su estado se muestra a la izquierda: hecho, inactivo, bloqueado, ejecutándose.
Rastrear los estados de los agentes de IA es ESENCIAL. Mi predicción es que en 3 a 6 meses este "seguimiento del estado del agente" se vuelve cada vez más importante, porque no hablarás con un solo agente. Hablarás con un agente administrador que gestiona muchos agentes trabajadores.
La última interfaz que tengo que mencionar es Corral, algo que desarrollé yo mismo.
En lugar de cambiar aleatoriamente entre agentes cuando terminan (en Herdr, no hay un orden real), cada agente tiene una prioridad. Al igual que las tareas tienen diferentes niveles de prioridad/importancia. Cuando un agente P1 termina, va a la cima. Nunca debes responder a un agente P4 cuando un agente P1 ha terminado de ejecutarse. (sí... necesito hacer que corral sea de código abierto. Aún no he llegado a eso).
Modelos y Suscripciones
Quieres la mayor cantidad de tokens por la menor cantidad de dinero posible. Este debería ser uno de los objetivos principales de todo Ingeniero Agentico (después de hacer las cosas).
Actualmente hay 4 suscripciones principales, y sí... esto podría ser completamente diferente dentro de 2 meses.
La mejor "relación calidad-precio" en este momento es OpenCode Go. Cuesta solo $10, y te da Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro, y muchos otros modelos... Pero no tiene los mejores modelos como Fable 5 y GPT-5.6 Sol (además, los límites de uso son bastante pequeños).
Entonces, si tienes un poco más de dinero, esto es lo que deberías hacer:
- $30 -- consigue OpenCode Go + ChatGPT Plus ($20)
- $50 -- Agrega la suscripción de Claude Code ($20) además.
- $70 -- Agrega los $20 al mes de Cursor, y tienes el nivel más bajo de todas las suscripciones.
- $110 -- OpenCode + uno de los planes grandes. El plan de $100 de ChatGPT te dará un mejor trato que Claude. Es lo que es. OpenAI tiene más capacidad de cómputo, están dispuestos a subsidiarlo más.
- $210 -- Consigue ambos planes de $100.
- Y si realmente hablas en serio (como yo), consigue todos los planes de $200 (Codex, Claude, Cursor) porque esos tienen 20x de uso, y estos planes te dan el mejor trato.
por cierto... el plan de Cursor está muy subestimado. Cursor, también conocido como Grok, se va a convertir en una gran suscripción debido a la adquisición de SpaceX. SpaceXAI tiene mucha capacidad de cómputo, por lo que pueden jugar el juego de los subsidios. Y -- creo -- el plan Cursor/Grok te da límites separados para Cursor + Grok Bot, lo cual es simplemente increíble.
Grok Bot se está convirtiendo rápidamente en la nueva forma en que las personas interactúan con los agentes, por lo que tener una suscripción a Cursor nunca ha sido más importante (no es patrocinado, es simplemente cierto). Además, el nuevo modelo -- Grok 4.7 -- está a la vuelta de la esquina.
Pase lo que pase, no pagues los precios de API. Es el peor trato que existe. Solo consigue las suscripciones.
Agentes en la Nube
Es bastante obvio que los agentes en la nube son el futuro. Cursor, Amp, Devin, Codex... todas estas empresas están apostando todo por los Agentes en la Nube.
La prueba de que los agentes en la nube son el futuro es el siguiente gráfico.
[imagen aquí]
Esta es la proporción interna de Cursor de PRs fusionados de agentes en la nube: alrededor del 10-15% al comienzo de este año, acercándose al 60% ahora. Y eso son PRs fusionados, las cosas que realmente se usan. Pronto esto será el 70%, luego el 80% y luego el 90%.
El problema de ejecutar todos los agentes localmente, en tu máquina, es que no es escalable. No puedes ejecutar cientos de agentes a la vez. Todo lo que se necesita es que un par de agentes decidan ejecutar todo tu conjunto de pruebas al mismo tiempo y tu computadora comenzará a hacer ruidos extraños (incluso mi MacBook Pro de $7,000 batalla).
Los Agentes en la Nube te brindan entornos aislados, sesiones persistentes, acceso duradero a internet y electricidad. Si cierras tu computadora portátil, pierdes tus sesiones. Si pierdes internet por unos minutos, los arneses no pueden recuperarse por sí solos.
El problema con las soluciones de agentes en la nube existentes es el nivel INSANO de bloqueo del ecosistema. Configurar los entornos y todos tus secretos lleva muchas horas, y luego estás atrapado: tus sesiones están allí, estás en sus precios y les das todos tus datos. Incluso si no entrenan modelos con ellos, hay muchas otras formas de usar tus datos.
La solución es tener tu propio servidor. Y gracias a la IA, esto toma como 10 minutos de configuración (en serio). Solo consigue un VPS, ejecuta Herdr en él, y conéctate por SSH.
Herdr te brinda sesiones de agente persistentes, y SSH te permite conectarte desde tu teléfono, tu computadora portátil, cualquier cosa. Literalmente puedes lograr el 80/20 de los agentes en la nube por un par de dólares, sin el bloqueo.
Construye tu propio entorno en la nube
Yo uso Hostinger para mis VPS, y un plan KVM2 es suficiente. Esto es lo principal que quiero transmitir... no necesitas ser un experto en VPS, DevOps, Linux, nada de eso.
¡¡¡Solo habla con tu agente en español!!!
En el próximo video, configuro todo en vivo. Un espacio de trabajo de cmux, un agente de codificación en el panel izquierdo (Cursor CLI ejecutando Grok 4.6), un panel de terminal vacío a la derecha.
Mi habilidad de cmux permite que el agente encuentre ese otro panel y ejecute comandos en él. Yo mismo me conecté por SSH al VPS nuevo, luego le dije al agente "aprende todo sobre ese servidor y configura el entorno de desarrollo. Herdr, Node.js, Python 3, Git".
Analizó el VPS en segundos, instaló todo, inició Herdr, luego instaló Pi Agent, encontró una clave de OpenRouter en mi MacBook, y realizó toda la configuración por sí mismo. Unos pocos mensajes cortos después, tenía Pi ejecutando GPT-5.6 Sol y una segunda sesión ejecutando Fable, ambos en la nube, en mi propio VPS, con acceso root completo.
Si algo le pasa a mi computadora o wifi... Si mi MacBook explota, esos agentes siguen ejecutándose. El tutorial completo está en el video. Enlace a mi YouTube aquí.
Una cosa más de velocidad... dicto con SuperWhisper. La mayoría de ustedes que leen esto probablemente escriben a 40 o 50 palabras por minuto. Eso es muy lento.
¡PERO! puedes hablar a más de 250 PPM. Una herramienta de voz con IA (como Superwhisper, Glaido, Whispr FLow) instantáneamente te hace 3-4 veces más rápido enviando mensajes. Usa una. No seas tonto.
Arneses
El primer arnés que necesito mencionar es Pi Agent, el MEJOR.
El arnés más mínimo que existe: solo 4 herramientas, siempre se ejecuta en modo YOLO, admite cualquier modelo, cualquier proveedor. Muy elegante, súper configurable, y por eso tanta gente construye sobre Pi. Es de código abierto, completamente gratis, solo ve a pi.dev y consíguelo. No negociable. Es el primer arnés que pongo en el VPS.
Cursor CLI. Muy subestimado, porque puedes usar todos los modelos: Grok, modelos GPT, modelos Anthropic, Kimi. Puedes etiquetar habilidades y puedes enviar mensajes previamente. Gran arnés en general.
La siguiente categoría de Arneses es lo que me gusta llamar arneses de "automejora".
Los dos más populares son Hermes Agent y Prime Agent. Esto es para cuando no sabes lo que estás haciendo. Si una tarea tiene mucha incertidumbre, mucho que descubrir, usa un arnés de automejora, porque crea habilidades y mejora contigo con el tiempo.
Y finalmente, los clásicos, Claude Code y Codex. Los tengo como alias. Mucha gente escribe claude --dangerously-skip-permissions todos los días. Extremadamente lento, extremadamente ineficiente. Yo escribo cc y lanza Claude Code con permisos omitidos; cx lanza Codex en modo YOLO.
DEBES crear alias globales para los comandos largos que ejecutas a menudo. Esa es una de las leyes de la ingeniería agentica: ¿Cómo puedes hacer más en la misma cantidad de tiempo?
Habilidades
Mi repositorio de habilidades se volvió viral el mes pasado. (ver github.com/davidondrej/skills) También es completamente gratis, de código abierto, todo eso.
Las HABILIDADES más relevantes para la Ingeniería Agentica son:
(1) /total-review
- Ejecuta otras dos habilidades, /gpt-review y /fable-review, que revisan cualquier cambio de código que acabas de hacer con GPT-5.6 Sol y Fable 5, luego deduplica ambas listas en una sola lista de los problemas que realmente importan. Es como pedirle a todos tus amigos más inteligentes que revisen tu solicitud de empleo, y solo te dan los problemas más grandes. Ejecútalo en cambios medianos a grandes, especialmente si un modelo diferente lo construyó. Si Grok 4.6 hizo el trabajo, quieres que un modelo totalmente diferente lo revise.
IMPORTANTE: cualquier cosa que repitas con suficiente frecuencia debe convertirse en un ajuste preestablecido.
Si es un solo paso, usa reemplazos de texto. Los tengo como fragmentos de Raycast. "Responde en español de forma breve y sencilla." "Haz tu respuesta anterior más simple y corta." "Prepara todos los archivos, escribe un commit claro, haz push a GitHub."
Si es un flujo de trabajo de varios pasos, conviértelo en una habilidad.
(2) /ask-then-build
- Uso esta habilidad todos los días, antes de cualquier construcción. En lugar de decir "haz esto compatible con Windows" y dejar que el modelo tome decisiones arquitectónicas importantes en silencio que podrías lamentar más tarde, te guía a través de las decisiones principales una por una, con opciones. Los modelos de IA son excelentes para codificar, excelentes para la implementación. No tienen gusto. No tienen buen juicio. Tú, como humano, debes mantenerte a cargo de eso.
(3) /deepapi
- Esta habilidad es la que uso para cualquier investigación profunda, cualquier raspado web, cualquier cosa en la web. Codex y Claude Code vienen con búsqueda web básica, pero sin raspado, sin investigación profunda, y se bloquean fácilmente. Ejecuta 8 búsquedas web rápidas y dame las 3 mejores opciones, raspa Twitter, raspa GitHub, encuentra 3 formas de contactar a una persona. Todos en mi equipo lo usan. Imprescindible.
(4) Guardarraíles y bloqueo de push
- Más aburrido, pero absolutamente esencial, y solo los configuras una vez. Los guardarraíles globales del agente son un gancho previo a la llamada de herramienta que asegura que tus agentes nunca borren tu disco, nunca sobrescriban el historial de Git, nunca toquen tu administrador de contraseñas. Y bloqueo de push, para cuando ejecutas 15+ agentes en paralelo: un bloqueo de kernel a nivel de sistema operativo en todo el barco. Fusionar, verificar, hacer push, CI, desplegar, verificación de estado.
No instales todas mis habilidades. Solo toma las que necesites.
Árboles de Trabajo
Un árbol de trabajo es básicamente una copia de tu checkout principal en una carpeta separada y crea una nueva rama de Git allí, para que los agentes puedan trabajar en paralelo, completamente aislados.
En un proyecto pequeño, eso es absolutamente excesivo. Quédate en una sola rama y trabaja más rápido.
En proyectos medianos a grandes donde ejecutas 20-30+ agentes en todo momento, no hay forma de evitarlo. Sin árboles de trabajo, los agentes entrarán en conflicto, revertirán los cambios de los demás y se pelearán entre sí. Otra cosa buena de BB: tiene árboles de trabajo integrados. Recuerda que en mis repos grandes siempre quiero un nuevo árbol de trabajo basado en origin/main.
Otros Consejos de Ingeniería Agentica
Sabe cuándo usar cada modelo.
- ¿Diseñando un plan o comenzando un nuevo proyecto? Fable. Tiene la mayor cantidad de chispas de genio. ¿Arreglando un error profundo y grave? GPT-5.6 Sol, máximo esfuerzo de razonamiento. ¿Charla predeterminada? Grok 4.6 en alto. Casi la misma inteligencia, pero 2x más barato y 2x más rápido. ¿Front-end? Kimi K3.
- Y cuando se lanza un modelo nuevo importante, reserva un día en el que solo uses ese modelo. No escuches a Twitter. Pruébalo tú mismo.
Sabe cuándo revisar.
- No ejecuto una revisión total en cada cambio. Un pequeño ajuste de front-end va a producción de inmediato.
- Y NUNCA hagas revisiones recursivas. Si le dices a un modelo "encuentra los 5 problemas más grandes", encontrará 5 problemas incluso si el código base está perfectamente bien. Estos modelos inventan errores imaginarios.
Envío anticipado.
- Por lo general, sé lo que hará el agente a continuación, así que pongo en cola los mensajes con anticipación: "implementa el plan", "ejecuta la revisión de Fable en esto", "ahora arregla esas cosas".
- A veces son 2 mensajes, a veces 6.
- Nunca uses un arnés que no te permita enviar mensajes anticipadamente.
Los subagentes están sobreutilizados.
- Mucha gente simplemente quema sus límites en ellos. Los uso cuando tengo el control. Quiero seleccionar qué modelo se ejecuta en el subagente, porque sé qué suscripciones y límites tengo.
- El futuro es un agente administrador que lanza trabajadores, pero aún necesitas diseñar ese sistema: las reglas, los permisos, las condiciones bajo las cuales se lanza un subagente. No quiero que algún tipo de Anthropic u OpenAI decida eso por mí.
ADRs.
- Así es como pones las decisiones en un código base. /docs/adr es una de las primeras carpetas que creo en cualquier proyecto.
- Cada decisión arquitectónica central obtiene un archivo corto: qué se decidió, por qué, y cuál era el estado del proyecto en ese momento. Algunas cosas se pueden leer del código, pero no todo.
- Las cosas que no se pueden leer deben documentarse, para que los futuros agentes y humanos entiendan instantáneamente por qué está construido de esta manera.
Pruebas.
- Los modelos actuales INFLAN tu repositorio con pruebas: pruebas unitarias, pruebas de integración, pruebas de base de datos, incluso en los repos más pequeños donde no tiene sentido.
- Si le dices al modelo que agregue pruebas, agrega una cantidad insana. Si le dices "no agregues pruebas", aún agrega algunas, y llegas a la cantidad correcta.
Acceso a la base de datos de producción.
- Cualquier producto con uso real necesita hacer esto... crea un rol de Postgres de solo lectura y dale eso a tus agentes.
- No les des acceso de escritura. Todo lo que se necesita es un cambio irreversible y te arrepentirás.
- Pero ningún acceso también es un error. Con acceso de solo lectura, puedes verificar la realidad de cada función. ¿Esto realmente sucede en producción? ¿La gente siquiera usa esto? Ojalá lo hubiera hecho antes.
Rastrea tu productividad agentica.
- Acabamos de lanzar un nuevo repositorio de código abierto bajo Vectal Labs llamado agentic-productivity. Rastrea tus commits, tus sesiones de agente y tus mensajes de usuario.
- Cada uno es una mala métrica por sí solo, pero combina los 3 y mira la tendencia a largo plazo, y puedes ver si realmente te estás convirtiendo en un mejor ingeniero agentico.
Esa es la configuración tal como está actualmente. En un mes, probablemente será diferente. Esto cambia todo el tiempo.
por David Ondrej (hablado para YouTube, luego reescrito para formato de artículo)





