Eval
Contra dataset del cliente, no benchmarks.
Agentes IA que ejecutan tareas multi-paso con razonamiento. La acción crítica se firma siempre por humano hasta superar el umbral de confianza.
Hay una clase de tareas — clasificar, decidir, ejecutar pasos en orden, llamar a sistemas externos, sintetizar — que los modelos de lenguaje actuales hacen bien con la arquitectura adecuada de agente. Devoluciones de ecommerce, lectura y registro de facturas, cotizaciones, atención de primer nivel, conciliación.
Construimos los agentes con LangGraph, modelos de Anthropic y OpenAI, y siempre con una capa de validación. La acción crítica — la que cuesta dinero o expone al cliente — se firma por humano hasta que el modelo demuestra estabilidad estadística por encima del umbral.
En los resultados medios de los despliegues de agentes gestionados por Summum IA, la resolución autónoma alcanza el 78 % en devoluciones de ecommerce moda, con tasa de error inferior al 1,5 % y coste por caso de 0,28 € frente a los 8,40 € del agente humano. Metodología y detalle disponibles bajo solicitud.
Contra dataset del cliente, no benchmarks.
Agente con tools, validación, escalado.
4-6 semanas en producción con monitorización.
Despliegue si la eval lo justifica.
El detalle operativo: lo que entregamos como parte del trabajo y lo que mantenemos vivo después.
Agentes con razonamiento
Devoluciones, atención, conciliación, facturas, cotizaciones.
Eval framework propio
Sobre dataset del cliente. Métrica del negocio.
Human in the loop
Acción crítica con vía a persona humana.
Monitorización continua
Precisión, latencia, coste, escalado.
Integración con ERP y CRM
Vía Summum Sistemas.
Documentación AI Act
Anexo IV cuando aplica.
Los agentes pueden caer en sistema de alto riesgo AI Act.
Agentes en producción no son sólo IA: ERP, regulatorio y SOC.
No facturamos implantación. Contractual.
Habitualmente reubica. Equipo pasa a cola compleja.
Multi-modelo. Claude para razonamiento, GPT-4 para visión.
Así se ve en producción: el agente lee las facturas entrantes, concilia contra el ERP y solo escala a una persona los casos que no encajan en las reglas. El equipo deja de perder horas en tareas repetitivas y se dedica a las excepciones que sí requieren criterio.