Volver al Blog
Trust System Seguridad · 15 min lectura

Trust System: Cómo Dar Autonomía a un Agente sin Perder el Control

El problema fundamental de los agentes autónomos no es técnico — es de confianza. ¿Cómo delegas tareas críticas a una IA sin supervisión constante? Trust scores dinámicos, thresholds por acción y escalación automática al humano.

Gonzalo Monzón

Gonzalo Monzón

7 julio, 2026 · Serie: Cognitive OS — El Sistema Completo (2/3)

TL;DR

Sabemos que el LLM puede hacer la tarea. La pregunta es: ¿la hará correctamente? El Trust Stack responde con 4 capas: (1) User Profile — perfil persistente de cada usuario en PDB, (2) Trust Score — puntuación 0-10 que evoluciona con cada interacción, (3) Action Thresholds — cada acción requiere un score mínimo que varía por contexto, (4) Escalation Protocol — si no hay suficiente confianza, el agente prepara una recomendación y espera al humano. Con decaimiento temporal: la confianza se gana con práctica y se pierde sin uso.

El problema

Confianza, no capacidad

Sabemos que el LLM puede hacer la tarea. La pregunta es: ¿la hará correctamente? ¿Y si se equivoca? ¿Y si alucina una respuesta que daña la relación con un usuario?

El problema fundamental de los agentes autónomos no es técnico — es de confianza. Construimos el Trust Stack para responder exactamente a eso: 4 capas que permiten delegar gradualmente, midiendo y ajustando la autonomía en cada interacción.

La solución

Las 4 capas del Trust Stack

1

User Profile

Cada usuario tiene un perfil persistente en PDB con estilo de comunicación, preferencias de autonomía, áreas de conocimiento e historial de correcciones. Zalo no trata a todos igual: sabe que Gonzalo prefiere respuestas directas, que un cliente puede necesitar más contexto, que un colega espera un tono técnico.

2

Trust Score (0-10)

Cada agente tiene un trust score dinámico (arranca en 5.0 — neutro) que evoluciona con cada interacción. No es global — es específico por tipo de acción. Zalo puede tener trust 9.0 para clasificar mensajes pero solo 6.5 para publicar en LinkedIn.

Evento Impacto
Tarea completada correctamente+0.1
Error o corrección necesaria-0.5
Feedback positivo explícito+0.3
Acción que requirió escalación-1.0
Inactividad en un tipo de acción (7+ días)-0.1/día

Decaimiento temporal: si un agente no realiza un tipo de acción durante 7 días, el score decrece hasta un mínimo de 5.0. La confianza se gana con práctica y se pierde sin uso — como un idioma que no practicas.

3

Action Thresholds

Cada acción tiene un threshold mínimo que varía por contexto. No es lo mismo leer que ejecutar:

Publicar en redes sociales:    threshold 8.0
Responder a un cliente:        threshold 7.0
Clasificar un mensaje:         threshold 5.0
Ejecutar tarea interna:        threshold 6.5
          

Los thresholds se modulan automáticamente según quién, qué, cuándo y dónde. Leer un email de un cliente conocido puede requerir solo 4.0; leerlo de un cliente nuevo requiere 6.0. Si el trust score está por debajo del threshold, el agente no ejecuta — escala al humano.

4

Escalation Protocol

Cuando un agente no tiene suficiente confianza para actuar, sigue este protocolo:

  1. 1. Prepara una recomendación con rationale completo
  2. 2. La presenta al humano con opciones claras
  3. 3. Espera confirmación o rechazo
  4. 4. Registra la decisión como aprendizaje para futuras ocasiones

Con el tiempo, el humano confirma menos veces y el agente gana autonomía. Es como entrenar a un empleado nuevo: al principio supervisas todo, luego delegas gradualmente.

¿Y si el trust score se desploma?

Si un agente comete un error grave, el score cae por debajo de todos los thresholds. El agente entra en modo read-only: puede leer, clasificar y analizar — pero no ejecutar acciones con efectos externos y no puede escribir en PDB. Sin este bloqueo, un agente caído podría contaminar la memoria compartida del sistema. La recuperación es manual: un humano revisa lo que pasó, corrige el perfil, y restablece el score.

Trust inicial: de cero a autonomía

Nuevo agente, nuevo perfil: trust score bajo para todo (arranca en 5.0). Las primeras semanas, el agente pregunta casi todo. Cada acierto sube el score. Cada corrección lo ajusta.

Para acelerar este proceso, el supervisor puede pre-cargar reglas de confianza por perfil: "este usuario es técnico, threshold 6.0 para tareas de código", "este contacto es premium, prioridad alta". Esto permite que el agente arranque con un contexto de confianza inicial en lugar de partir de cero.

Es como entrenar a un empleado nuevo: al principio supervisas todo, luego delegas gradualmente. La diferencia es que un agente IA aprende más rápido — pero también puede fracasar más rápido si no hay controles.

El resultado

Autonomía con red de seguridad

Zalo opera con autonomía real. Gonzalo no supervisa cada mensaje. Pero si Zalo encuentra una situación donde no está seguro, pregunta. Y eso es exactamente lo que queremos: un agente que sabe lo que sabe, sabe lo que no sabe, y tiene mecanismos para manejar ambos casos.

Serie: Cognitive OS — El Sistema Completo (2/3)

Todos los artículos de la serie:

1. Cognitive OS 2. Trust System (este) 3. Memoria Episódica

Y necesita memoria

Así recuerda el Cognitive OS. Memoria a corto, medio y largo plazo con embeddings y búsqueda semántica. El cierre de la serie.

Serie Cognitive OS — 3 artículos. Cadences Lab © 2026.

Newsletter

No te pierdas ninguna historia

Suscríbete para recibir nuevos lanzamientos, capítulos exclusivos y contenido detrás de cámaras.

  • Insights y artículos semanales
  • Contenido exclusivo y acceso anticipado
  • Sin spam, cancela cuando quieras

Respetamos tu privacidad. Puedes darte de baja cuando quieras.