Lanza un agente de producción revisando el arnés: contexto, herramientas, memoria, evaluación, trazas y escalación
Un agente de producción es tan fiable como el arnés que controla el contexto, las herramientas, la memoria, las evaluaciones, las trazas y la escalación.

Por qué importa el arnés del agente
Un agente de producción no es un prompt. Es un sistema. El modelo propone acciones. El arnés decide qué puede ver el modelo, qué puede invocar, qué puede recordar y cuándo debe intervenir un humano. Si el arnés es débil, el agente parecerá listo en una demostración y fallará en flujos de trabajo en vivo.
Los agentes de producción necesitan un arnés que aporte límites y contexto alrededor del modelo. El arnés del agente es la capa operativa. Convierte un modelo de lenguaje en un trabajador que puede auditarse, limitarse y revertirse.
El modelo no conoce inherentemente tus sistemas de negocio. No sabe qué registro es el actual, qué aprobación se requiere, qué herramienta es de solo lectura o qué acción es irreversible. El ensamblaje de contexto es parte del arnés porque el modelo no conoce inherentemente los sistemas de negocio. El arnés debe seleccionar, formatear y limitar la información que recibe el modelo.
La misma lógica se aplica a las herramientas, la memoria y la escalación. Un modelo puede generar texto verosímil. Un agente de producción debe ejecutar trabajo acotado. El arnés es donde se construye la fiabilidad.
Ejecuta la lista de verificación antes del lanzamiento
Usa esta lista de verificación como puerta de lanzamiento. No lances un agente porque responda bien. Lánzalo cuando el arnés pueda explicar qué hizo el agente, por qué lo hizo y qué le estaba permitido hacer.
- Ensamblaje de contexto. Define qué puede leer el agente. Incluye solo los registros, políticas y estado de la tarea necesarios para el paso actual. Excluye datos no relacionados, secretos y borradores obsoletos. La ventana de contexto es un límite de seguridad. Si el modelo puede verlo, puede usarlo. Versiona la plantilla de contexto. Registra qué fuentes se incluyeron en cada ejecución.
- Contratos de herramientas. Cada herramienta debe definir esquemas, tiempos de espera y estados de error para limitar acciones inseguras o repetidas. Una herramienta que puede cambiar el estado necesita un contrato. El contrato debe especificar los campos requeridos, los valores permitidos, la duración máxima y el error que debe recibir el agente cuando la llamada falla. Si una herramienta no tiene un estado de error estable, el agente adivinará. No dejes que adivine.
- Permisos de herramientas. Los permisos son decisiones de producto y seguridad que deben acotar las acciones del agente y contener la inyección de prompts. Separa las herramientas de lectura de las de escritura. Separa las escrituras de bajo riesgo de las de alto riesgo. Un agente de solo lectura puede leer registros y solicitar aprobación. No debe realizar acciones irreversibles sin revisión. Acota los permisos por rol, inquilino y tarea. Revoca el acceso cuando la tarea termina.
- Política de memoria. Decide qué recuerda el agente, dónde lo almacena y cuándo expira. La memoria debe acotarse al usuario, la cuenta o el caso. No debe filtrarse entre cuentas. Almacena solo lo que requieren las decisiones futuras. Oculta los campos sensibles antes de la persistencia. Proporciona una forma de inspeccionar y borrar la memoria almacenada. Si el agente no puede explicar por qué recordó algo, no debería recordarlo.
- Evaluación. La evaluación debe probar los modos de fallo de producción, no solo la calidad de respuesta de los benchmarks. Crea un conjunto de pruebas a partir de incidentes reales, casos límite y acciones rechazadas. Incluye casos donde la respuesta correcta es detenerse. Incluye casos donde la herramienta devuelve un error, falta un registro o el usuario solicita una acción fuera de alcance. Registra si el agente eligió la herramienta correcta, usó el contexto correcto, respetó los permisos y escaló cuando era necesario. Ejecuta evaluaciones antes de cada lanzamiento y después de cada cambio de herramienta o política.
- Observabilidad. La observabilidad debe preservar trazas inspeccionables de los pasos del agente. Una traza debe mostrar el prompt, el contexto recuperado, las llamadas a herramientas, los resultados de herramientas, la salida del modelo, las decisiones y la acción final. También debe mostrar las comprobaciones de permisos y la razón de cada paso. Los registros no son suficientes. Una línea de registro que dice agente completado no es una auditoría. La traza debe permitir a un operador reconstruir la ejecución sin pedirle al modelo que se explique a sí mismo.
- Escalación humana. La escalación o confirmación humana debe actuar como puerta para las acciones de escritura. Define las acciones que requieren aprobación: cualquier acción de escritura que cambie el estado o no pueda deshacerse. La ruta de escalación debe incluir la acción propuesta, la evidencia, el riesgo y el resultado esperado. Un humano debe poder aprobar, rechazar o modificar la acción. Si el humano no está disponible, el agente debe detenerse, no improvisar.
Mantén la lista de verificación visible. Un agente de producción es un flujo de trabajo. El arnés es el plano de control. Si un paso no puede verificarse, no está listo para producción.
Opera el bucle después del lanzamiento
Lanzar no es el final. El arnés debe operarse. Revisa las trazas semanalmente. Busca fallos repetidos de herramientas, denegaciones de permisos, contexto largo y escalaciones que los humanos rechacen. Cada patrón es una señal de que el arnés necesita un cambio.
Actualiza las plantillas de contexto cuando cambien las reglas de negocio. Actualiza los contratos de herramientas cuando cambien las APIs. Actualiza los permisos cuando cambien los roles. Actualiza las evaluaciones cuando aparezca un nuevo modo de fallo. Trata cada incidente como un caso de prueba. Si el agente cometió un error, añade el caso al conjunto de evaluación. Si el agente adivinó, endurece el contrato de la herramienta. Si el agente vio datos que no debería haber visto, endurece el ensamblaje de contexto. Si el agente actuó sin aprobación, endurece la escalación.
El objetivo no es un modelo más inteligente. El objetivo es un trabajador fiable. Un agente de producción gana confianza haciendo menos cuando está incierto, mostrando su trabajo y deteniéndose cuando se requiere un humano. El arnés es donde reside esa disciplina.