YouMind
Iniciar sesi贸n

Por qu茅 los agentes de IA necesitan gobernanza antes de actuar

@getmarrow_ai
INGL脡S03 jun 2026
307K
33
5
0
17

TL;DR

A medida que los agentes de IA pasan de responder preguntas a ejecutar tareas, es esencial contar con una capa de gobernanza dedicada para gestionar la autoridad, el riesgo y el cumplimiento en tiempo real.

Los agentes de IA est谩n pasando de responder preguntas a tomar acciones.

Ese 煤nico cambio transforma todo el modelo de riesgo.

Los chatbots producen texto. Los agentes operan sistemas.

Pueden leer correos electr贸nicos, llamar a API, actualizar registros de clientes, desplegar c贸digo, crear tickets, aprobar pasos de flujos de trabajo, coordinarse con otros agentes y almacenar nuevo conocimiento en la memoria a largo plazo.

Eso significa que la pregunta central ya no es:

驴Es correcta esta respuesta?

Es:

驴Deber铆a permitirse que este agente act煤e ahora mismo?

Esa es la pregunta que una capa de gobernanza existe para responder.

1. La memoria es 煤til. No es gobernanza.

La memoria ayuda a los agentes a preservar el contexto entre sesiones.

Les ayuda a recordar preferencias de usuarios, trabajos anteriores, salidas de herramientas y decisiones previas. Eso importa. Pero la memoria no decide:

  • qu茅 hechos est谩n autorizados a entrar en la memoria
  • qu茅 recuerdos est谩n obsoletos o contaminados
  • qu茅 acciones requieren aprobaci贸n
  • qu茅 paso del flujo de trabajo debe venir a continuaci贸n
  • qu茅 prueba se requiere antes de la ejecuci贸n
  • qu茅 agente tiene permitido usar qu茅 informaci贸n

En sistemas de agentes en producci贸n, el problema m谩s dif铆cil a menudo no es la recuperaci贸n. Es la autoridad.

La memoria ayuda a un agente a recordar.

La gobernanza le ayuda a elegir lo que se le permite hacer.

En esta distinci贸n se sit煤a Marrow.

Marrow no es solo una capa de memoria. Es una capa de juicio para flotas de agentes de IA.

2. La observabilidad explica el pasado. Los agentes necesitan control antes del futuro.

La observabilidad es necesaria. Los equipos necesitan trazas, registros, evaluaciones, anotaciones, alertas y paneles.

Pero la visibilidad posterior no detiene una mala acci贸n antes de que ocurra.

Si un agente despliega c贸digo inseguro, env铆a un correo electr贸nico sensible, aprueba el pago incorrecto u omite un paso obligatorio del flujo de trabajo, el panel puede explicar el incidente despu茅s. No necesariamente lo previene.

Para flujos de trabajo de alto impacto, la se帽al debe llegar al agente antes de la acci贸n:

  • nivel de riesgo
  • prueba requerida
  • restricciones de pol铆tica
  • aprobaci贸n del propietario
  • plan de reversi贸n
  • siguiente paso exacto
  • permitir, advertir, revisar o bloquear

Esta es la brecha entre observabilidad y gobernanza.

Los paneles informan a los humanos.

La gobernanza informa a los agentes antes de que act煤en.

3. La evaluaci贸n es una instant谩nea. La producci贸n es un flujo.

La evaluaci贸n previa al despliegue detecta muchos fallos. Pero los agentes en producci贸n viven en entornos cambiantes.

Los prompts cambian. Las herramientas cambian. Las API cambian. Los datos cambian. Las pol铆ticas cambian. Otros agentes en la flota cambian.

Un benchmark puede decir que un agente funciona bien bajo un conjunto de condiciones. La producci贸n pregunta algo diferente:

驴Seguir谩 este agente tomando la decisi贸n correcta a medida que el entorno cambie?

La investigaci贸n sobre agentes que usan herramientas apunta en la misma direcci贸n.

ToolEmu estudia agentes basados en modelos de lenguaje que usan herramientas de alto riesgo y muestra que los fallos de los agentes pueden crear graves consecuencias en el mundo real. AgentHarm y CUAHarm se centran en el comportamiento da帽ino una vez que los agentes pueden usar herramientas u operar computadoras. Otras investigaciones muestran que los agentes pueden entender el riesgo en abstracto pero a煤n as铆 fallan en evitar acciones riesgosas en trayectorias concretas.

La lecci贸n es pr谩ctica:

La seguridad no puede vivir solo en el modelo o solo en un benchmark.

Los agentes en producci贸n necesitan control en tiempo de ejecuci贸n.

4. La gobernanza se est谩 convirtiendo en infraestructura de IA.

Los principales marcos de gobernanza de IA est谩n convergiendo en la misma idea: la IA responsable tiene que volverse operativa.

No solo principios.

No solo PDFs de pol铆ticas.

No solo paneles.

La gobernanza operativa requiere:

  1. gesti贸n de riesgos documentada
  2. registro autom谩tico
  3. supervisi贸n humana para decisiones de alto impacto
  4. gesti贸n de calidad a lo largo del ciclo de vida
  5. trazabilidad del comportamiento del sistema
  6. monitoreo posterior a la comercializaci贸n
  7. rendici贸n de cuentas por resultados adversos

Esto es visible en NIST AI RMF, el Perfil de IA Generativa de NIST, ISO/IEC 42001, los Principios de IA de la OCDE, la Ley de IA de la UE, la taxonom铆a de riesgos de IA agentiva de OWASP y la gu铆a de 2026 de Five Eyes sobre servicios de IA agentiva.

La direcci贸n es clara.

Los sistemas de IA empresarial necesitan evidencia, control, trazabilidad y rendici贸n de cuentas a lo largo de su vida operativa.

Para los agentes de IA, eso significa que la gobernanza debe trasladarse al tiempo de ejecuci贸n.

5. Qu茅 deber铆a hacer una capa de gobernanza de agentes

Una capa de gobernanza es un plano de control entre el tiempo de ejecuci贸n del agente y los sistemas que el agente puede afectar.

Recibe la acci贸n prevista del agente, la eval煤a contra pol铆ticas, permisos, riesgo, prueba y resultados anteriores, y luego devuelve una decisi贸n ejecutable:

permitir

advertir

revisi贸n requerida

bloquear

Una capa de gobernanza seria necesita nueve funciones.

  1. Identidad y autoridad con alcance

Cada agente necesita una identidad clara, permisos limitados y credenciales con alcance.

Una flota no puede gobernarse si cada agente comparte la misma clave de API.

  1. Pol铆tica en tiempo de ejecuci贸n

Las pol铆ticas deben convertirse en condiciones ejecutables en tiempo de ejecuci贸n.

驴Qu茅 paso viene primero?

驴Qu茅 prueba se requiere?

驴Qu茅 acci贸n siempre necesita revisi贸n?

驴Qu茅 acci贸n nunca deber铆a ejecutarse autom谩ticamente?

  1. Puertas de riesgo

El sistema deber铆a clasificar las acciones por impacto, reversibilidad, sensibilidad y contexto de negocio.

El trabajo de bajo riesgo puede ejecutarse autom谩ticamente. El trabajo de alto riesgo puede requerir prueba, aprobaci贸n o bloqueo.

  1. Paquetes de prueba

Antes de la acci贸n, el agente deber铆a adjuntar evidencia.

Ejemplos:

  • cobertura de pruebas
  • plan de reversi贸n
  • cl谩usula de pol铆tica
  • verificaci贸n de identidad
  • aprobaci贸n cl铆nica
  • revisi贸n de factura
  • visto bueno del supervisor
  1. Enrutamiento de aprobaciones

La revisi贸n humana no deber铆a ser una cola manual para todo.

Deber铆a ser un punto de control condicional para acciones donde el costo del error es alto.

  1. Auditor铆a y procedencia

Cada decisi贸n deber铆a ser trazable.

驴Qui茅n la inici贸?

驴Por qu茅 se permiti贸 o bloque贸?

驴Qu茅 pol铆tica se aplic贸?

驴Qu茅 prueba se adjunt贸?

驴Qui茅n la aprob贸?

驴Qu茅 sucedi贸 despu茅s?

  1. Cierre de resultados

La gobernanza no termina con permitir o bloquear.

El sistema debe cerrar el ciclo:

  • 驴tuvo 茅xito la acci贸n?
  • 驴fall贸?
  • 驴se necesit贸 reversi贸n?
  • 驴qui茅n la aprob贸?
  • 驴qu茅 lecci贸n deber铆a almacenarse?
  1. Gobernanza de escritura en memoria

No todo registro es conocimiento.

No cada pieza de conocimiento deber铆a influir en cada agente.

Los resultados reales deber铆an convertirse en memoria solo a trav茅s de escritura controlada.

  1. Aprendizaje a nivel de flota

La capa de gobernanza deber铆a rastrear el comportamiento en toda la flota:

  • desviaci贸n de los flujos de trabajo base
  • bucles de reintento
  • fallos repetidos
  • patrones que deber铆an advertir a futuros agentes

Aqu铆 es donde la gobernanza se vuelve m谩s que restricci贸n. Se convierte en aprendizaje.

6. Marrow como caso de estudio de gobernanza

Marrow est谩 dise帽ado alrededor de un bucle operativo simple:

orientar -> pensar -> actuar -> verificar -> confirmar

Cada paso tiene una funci贸n de gobernanza.

Orientar saca a la superficie el historial relevante, advertencias y restricciones.

Pensar eval煤a la acci贸n prevista antes de que ocurra.

Actuar ejecuta con contexto y barreras de protecci贸n adjuntas.

Verificar inspecciona si falta prueba o cierre.

Confirmar registra el resultado para que la pr贸xima decisi贸n mejore.

Esta es la diferencia central entre memoria y juicio.

La memoria pregunta:

驴Qu茅 sabe el agente?

Marrow pregunta:

驴Deber铆a actuar el agente, y bajo qu茅 condiciones?

Sus superficies de producto se asignan directamente a la gobernanza en tiempo de ejecuci贸n:

  • decisionBrief() proporciona al agente contexto previo a la acci贸n.
  • workflowGate() devuelve permitir, advertir, revisi贸n requerida o bloquear.
  • runGuarded() envuelve trabajo riesgoso con orientaci贸n previa a la acci贸n y cierre de resultados.
  • agentRuntime() inyecta lecciones y requisitos de prueba en el contexto del agente.
  • agentStatus() muestra si Marrow est谩 activo y recopilando se帽ales 煤tiles.
  • valueReport() convierte la gobernanza en prueba visible para el propietario.

En otras palabras:

Marrow convierte resultados pasados en juicio previo a la acci贸n.

7. Un ejemplo concreto: el despliegue defectuoso

Imagina un agente CI/CD a punto de desplegar un cambio en un webhook de pagos.

La compilaci贸n pasa.

La rama est谩 lista.

El agente est谩 a punto de enviar a producci贸n.

Pero la solicitud de extracci贸n (pull request) carece de tres cosas:

  1. cobertura de pruebas
  2. plan de reversi贸n
  3. prueba de humo (smoke test)

Sin gobernanza, el despliegue podr铆a realizarse.

Los fallos de pago aparecen horas despu茅s. Los clientes se ven afectados. El ingeniero de guardia revierte manualmente. El incidente se convierte en otra autopsia (postmortem).

Con gobernanza, la puerta de flujo de trabajo se ejecuta antes del despliegue.

Devuelve:

nivel de riesgo: alto

paquete de prueba faltante

despliegue bloqueado

El agente no solo est谩 registrando m谩s. Se le est谩 forzando a detenerse en el punto correcto.

Ese es el valor de la gobernanza previa a la acci贸n.

8. Las m茅tricas correctas para la gobernanza de agentes

Una capa de gobernanza no solo deber铆a contar registros.

Deber铆a medir si la flota se est谩 volviendo m谩s segura, m谩s consistente y m谩s f谩cil de auditar.

Las m茅tricas 煤tiles incluyen:

  • Cobertura de acciones: cu谩ntas acciones de alto impacto pasan por una puerta
  • Tasa de finalizaci贸n de pruebas: cu谩ntas acciones incluyen la prueba requerida antes de la ejecuci贸n
  • Tasa de cierre de resultados: cu谩ntas decisiones se cierran con un resultado real
  • Prevenci贸n de fallos repetidos: con qu茅 frecuencia se evitan patrones de fallo conocidos
  • Gravedad de la desviaci贸n: qu茅 tan lejos se mueven los agentes de los flujos de trabajo aprobados
  • Tasa de falsos positivos: con qu茅 frecuencia la puerta bloquea demasiado
  • Tasa de falsos negativos: con qu茅 frecuencia acciones peligrosas se filtran
  • Tiempo de reconstrucci贸n de auditor铆a: cu谩nto tiempo lleva explicar una decisi贸n
  • Precisi贸n de la revisi贸n humana: si la aprobaci贸n humana se usa para las acciones correctas

La gobernanza es 煤til cuando reduce las reversiones, previene incidentes repetidos, reduce las revisiones innecesarias y hace que el comportamiento del agente sea m谩s f谩cil de probar.

De lo contrario, se convierte en teatro de cumplimiento.

9. La capa de gobernanza tambi茅n tiene riesgos

Una capa de gobernanza tambi茅n puede fallar.

Puede estar mal configurada. Las pol铆ticas pueden volverse obsoletas. La prueba puede ser incompleta. Las puertas pueden bloquear en exceso. Los atacantes pueden apuntar al plano de control. Si almacena demasiados datos sensibles, se convierte en un punto de concentraci贸n de riesgos.

Por lo tanto, la capa de gobernanza misma necesita disciplina:

  1. M铆nimo privilegio por defecto Los agentes solo deber铆an recibir los permisos que necesitan, por el tiempo que los necesitan.
  2. Fallo cerrado para acciones de alto impacto Si la acci贸n puede causar da帽o grave, la falta de prueba deber铆a detener la ejecuci贸n.
  3. Fallo suave para automatizaci贸n de bajo riesgo No todas las acciones merecen el mismo nivel de fricci贸n.
  4. Evidencia legible por humanos, pol铆tica legible por m谩quinas Los operadores necesitan entender la decisi贸n. Los sistemas necesitan hacerla cumplir.
  5. Aprendizaje a partir de resultados reales Sin cierre de resultados, el sistema acumula registros, no juicio.

10. Conclusi贸n

Los agentes de IA empujan al software hacia un nuevo modelo operativo.

Pueden elegir herramientas, coordinarse con otros agentes, modificar sistemas y crear consecuencias.

En ese modelo, la gobernanza no es una capa a帽adida despu茅s del despliegue. Pertenece al interior del tiempo de ejecuci贸n.

La memoria, la observabilidad, la evaluaci贸n y la revisi贸n humana son importantes. Pero cada una resuelve solo una parte del problema.

Una capa de gobernanza las conecta en un bucle de acci贸n responsable:

pol铆tica antes de la acci贸n

prueba antes de la ejecuci贸n

autoridad durante la acci贸n

resultado despu茅s de la acci贸n

aprendizaje en toda la flota

Esa es la tesis detr谩s de Marrow.

Las flotas de agentes de IA no solo necesitan recordar m谩s.

Necesitan mejor juicio antes de actuar.

Referencias

  1. NIST. Marco de Gesti贸n de Riesgos de IA
  2. NIST. Perfil de IA Generativa, NIST AI 600-1
  3. OCDE. Principios de IA de la OCDE
  4. Servicio de Atenci贸n de la Ley de IA de la Comisi贸n Europea. Art铆culo 9: Sistema de gesti贸n de riesgos
  5. Servicio de Atenci贸n de la Ley de IA de la Comisi贸n Europea. Art铆culo 12: Mantenimiento de registros
  6. Servicio de Atenci贸n de la Ley de IA de la Comisi贸n Europea. Art铆culo 14: Supervisi贸n humana
  7. Servicio de Atenci贸n de la Ley de IA de la Comisi贸n Europea. Art铆culo 17: Sistema de gesti贸n de calidad
Guardar con un clic

Lee art铆culos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un art铆culo viral en notas reutilizables en un 煤nico espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un art铆culo de 饾晱 impecable

Cuando publicas tus propios textos largos, dar formato en 饾晱 a im谩genes, tablas y bloques de c贸digo es un fastidio. YouMind convierte un borrador completo en Markdown en un art铆culo de 饾晱 impecable y listo para publicar.

Prueba Markdown a 饾晱

M谩s patrones por descifrar

Art铆culos virales recientes

Explorar m谩s art铆culos virales