Infraestructura AI agéntica: una guía de platform engineering
Tabla de contenidos
La diferencia entre una demo de agente y un sistema de producción no es el modelo. Es la infraestructura alrededor.
He visto agentes que funcionan perfecto en un notebook y se desmoronan en producción. No porque el modelo sea malo, sino porque les falta todo lo demás: cómputo, orquestación, sandboxing, observabilidad y gobernanza.
Esta es mi forma de pensar la infraestructura para agentes de IA.
Cinco capas necesarias
| Capa | Función | Ejemplos |
|---|---|---|
| Cómputo | CPU/GPU, scheduling, cuotas | Kubernetes, Karpenter, GPU Operator |
| Orquestación | Lifecycle, reintentos, escalado humano | Temporal, LangGraph, Dapr |
| Runtime | Ejecución de herramientas, sandboxing, MCP | gVisor, Firecracker, MCP SDKs |
| Observabilidad | Trazas, métricas, logs | OpenTelemetry, Grafana |
| Gobernanza | Políticas, auditoría, secretos | OPA, Vault, Kyverno |
No son componentes opcionales. Son la base.
Por qué es diferente de servir modelos
La infraestructura de serving de modelos optimiza para latencia y throughput de una sola llamada. La infraestructura agéntica optimiza para:
- Ejecuciones de duración variable.
- Estado que persiste entre turnos.
- Rutas de decisión probabilísticas.
- Acciones que pueden modificar sistemas externos.
Un agente no es un endpoint. Es un programa autónomo que necesita supervision.
Errores comunes
- Darle a un agente demasiadas herramientas desde el inicio.
- No persistir estado.
- No auditar decisiones.
- Tratar el agente como un microservicio sin estado.
Conclusión
Construir infraestructura para agentes es construir infraestructura para sistemas con estado, herramientas peligrosas y decisiones difíciles de rastrear.
Empieza por delimitar lo que el agente puede hacer. Luego añade orquestación durable, observabilidad completa y políticas de gobernanza. El modelo es lo último que escalar.