Cómo medir la productividad de la IA sin teatro de métricas
· CompaniesAutomation
Licencias compradas no es una métrica. Sistema completo para medir el impacto real de la IA: línea base, cuatro métricas y un ejemplo con números.
Medir la productividad de la IA en una empresa se reduce a una comparación honesta: cuánto costaba y tardaba un proceso antes del agente, y cuánto cuesta y tarda después, con la calidad al menos igual. Todo lo demás —licencias compradas, empleados "formados", prompts ejecutados— es teatro de métricas. Si no hay línea base por proceso, no hay medición: hay sensaciones.
Lo escribimos porque es la conversación más incómoda y más útil que tenemos con las empresas que llegan tras un año de "hacer cosas con IA": han gastado decenas de miles de euros y nadie sabe decir qué ha cambiado en la cuenta de resultados. Nosotros operamos nuestros propios negocios con agentes y todo lo que desplegamos lleva contador. Este artículo es el sistema de medición que usamos, con las cuatro métricas que importan y los antipatrones que conviene evitar.
¿Por qué "licencias compradas" no es una métrica?
Porque mide gasto, no resultado: 50 licencias de un asistente de IA a 30€/mes son 18.000€ al año de coste garantizado y cero euros de beneficio garantizado. La adopción tampoco basta como métrica final —"el 80% del equipo lo usa cada semana" es una condición necesaria, no un resultado—, porque usar la IA mucho y producir lo mismo es perfectamente posible, y de hecho es lo que ocurre cuando se despliega tecnología sin rediseñar el proceso.
La lista de métricas-teatro que vemos en informes internos: licencias activadas, empleados formados, número de prompts o conversaciones, "casos de uso identificados", horas de uso de la herramienta. Todas comparten el mismo defecto: suben sin que la empresa mejore. La regla para detectarlas es simple: si la métrica puede crecer un 100% sin que ni los costes bajen ni los ingresos suban ni el cliente lo note, no es una métrica de productividad; es una métrica de actividad.
¿Cómo se construye la línea base de un proceso?
La línea base es la foto del proceso antes de tocarlo, y se compone de cuatro números: volumen (cuántas unidades procesa al mes), tiempo (horas humanas por unidad o por periodo), coste unitario (coste total del proceso dividido por unidades) y calidad (tasa de error, retrabajos, plazos incumplidos). Sin esa foto, cualquier mejora posterior es indiscutible e indemostrable a la vez.
Tomarla cuesta menos de lo que parece: una semana de observación por proceso suele bastar. Para "gestión de facturas de proveedor", por ejemplo: 800 facturas/mes, 11 minutos de media por factura entre captura, cruce y contabilización, unas 147 horas/mes, coste efectivo de 8-12€ por factura con el salario cargado, 4% de facturas con error que generan retrabajo. Ese párrafo vale más que cualquier comité de innovación, porque convierte "vamos a poner IA en facturas" en "vamos a bajar el coste por factura de 10€ a menos de 2€".
Dos avisos prácticos. Primero: mide el proceso completo, incluida la parte fea (excepciones, reclamaciones, esperas), no solo el camino feliz, porque el agente se juzgará contra el total. Segundo: congela la definición antes de desplegar; si cambias qué cuentas como "factura procesada" a mitad de camino, la comparación muere.
Las cuatro métricas que sí miden productividad
| Métrica | Qué mide | Ejemplo de objetivo |
|---|---|---|
| Horas humanas liberadas | Horas/mes que el proceso deja de consumir de personas | De 147 h/mes a 25 h/mes en facturas |
| Coste unitario del proceso | Coste total (personas + software + inferencia) por unidad | De 10€ a menos de 2€ por factura |
| Tiempo de ciclo | De evento a resolución: lead→respuesta, pedido→entrega | Respuesta al lead de 6 horas a 2 minutos |
| Calidad | Tasa de error, retrabajo, satisfacción (CSAT/reseñas) | Errores del 4% al 1%, CSAT estable o mejor |
Tres matices para que la tabla no engañe. Las horas liberadas solo valen lo que valga su nuevo destino: si las 120 horas liberadas no se reinvierten en trabajo de más valor (o en no cubrir una vacante), el ahorro es teórico; por eso la medición incluye "a qué se dedican ahora esas horas". El coste unitario debe incluir el coste del agente —proyecto amortizado, mantenimiento del 10-20% anual e inferencia—, no solo el ahorro bruto. Y la calidad es el freno de seguridad: una automatización que baja el coste un 60% y dispara los errores no es productividad, es deuda operativa con intereses.
A nivel de empresa, estas métricas agregan hacia arriba en dos indicadores que sí puede seguir dirección: ingresos por empleado (la métrica reina de una empresa que escala sin engordar plantilla) y porcentaje de procesos core operados por agentes. Son los mismos KPIs que estructuran el modelo operativo de una empresa AI-First.
¿Cada cuánto medir y contra qué comparar?
La cadencia que funciona: línea base antes de desplegar, primera lectura seria a las 4-6 semanas, revisión de consolidación a los 3 meses y seguimiento mensual ligero después. Antes de las 4 semanas, los datos mienten: el agente está en rodaje, el equipo está aprendiendo a supervisarlo y las excepciones raras aún no han aparecido.
La comparación es siempre contra la línea base congelada, con el mismo perímetro. Los errores clásicos que invalidan la medición:
- Comparar contra el recuerdo. "Antes tardábamos muchísimo" no es un dato. Si no se midió antes, la primera medición honesta es reconocerlo y tomar la base ahora.
- Atribuir al agente lo que hizo la estacionalidad. Si diciembre siempre tuvo la mitad de leads, la mejora de diciembre no es del agente. Compara contra el mismo periodo del año anterior cuando el proceso sea estacional.
- Ignorar el coste de supervisión. Las horas que el equipo dedica a revisar el trabajo del agente son coste del proceso nuevo y entran en el coste unitario. Al principio son notables; deben bajar con las semanas, y su curva es en sí misma una métrica de madurez.
- Medir solo el proceso automatizado. Si el agente resuelve el 70% de los tickets pero el 30% restante ahora llega más enrevesado al equipo humano, mide el sistema completo, no la parte bonita.
Un ejemplo con números completos
Empresa de servicios de 40 empleados, proceso de atención a consultas de clientes. Línea base: 900 consultas/mes, 2,1 personas dedicadas (unos 70.000€/año cargados), tiempo medio de primera respuesta 4 horas, CSAT 4,1/5. Se despliega un agente con conocimiento de la empresa por 9.000€ de proyecto, mantenimiento del 15% anual e inferencia de ~120€/mes.
Lectura a los 3 meses: el agente resuelve el 65% de las consultas de punta a punta; una persona reasignada a onboarding de clientes (la vacante que no se cubre); primera respuesta en menos de 2 minutos las 24 horas; CSAT 4,3. Coste anual del sistema nuevo: ~35.000€ de la persona restante + 9.000€ amortizados en el primer año + 1.350€ de mantenimiento + ~1.400€ de inferencia ≈ 47.000€ frente a 70.000€: un 33% menos de coste con mejor servicio, y el dato fino —coste por consulta de 6,5€ a 4,3€ el primer año, y a ~3,5€ el segundo, ya sin proyecto que amortizar. Así se presenta un resultado de IA a un comité: sin la palabra "revolución" y con divisiones.
Cómo montar el sistema de medición en tu empresa
- Elige 2-3 procesos con volumen y dolor, no diez. Los criterios de prioridad los tienes en nuestro roadmap de 90 días para implementar IA.
- Toma la línea base de cada uno: volumen, horas, coste unitario, calidad. Una semana de trabajo, como mucho.
- Pacta los objetivos por escrito antes de desplegar: qué número tiene que moverse, cuánto y para cuándo.
- Instrumenta desde el día uno: el agente debe registrar cada operación (qué hizo, cuánto tardó, si escaló). La medición manual muere en tres semanas.
- Revisa a las 4-6 semanas y decide: ampliar, ajustar o apagar. Un agente que no mueve su métrica en dos ciclos de revisión se rediseña o se retira; mantener automatizaciones zombis también es un coste.
Este sistema es deliberadamente aburrido: contadores, divisiones y revisiones con calendario. Es también lo que separa a las empresas que capitalizan la IA de las que acumulan herramientas. Si quieres que te ayudemos a montar la línea base y el cuadro de métricas de tus primeros procesos, es la primera fase de nuestra consultoría de inteligencia artificial.
Preguntas frecuentes
¿Cómo mido la productividad de los asistentes individuales (Copilot, ChatGPT)?
Con muestreo por rol, no con telemetría de uso: elige 2-3 tareas frecuentes de cada rol (redactar una propuesta, preparar un informe), cronometra cómo se hacen con y sin asistente en condiciones reales y multiplica por la frecuencia. Es menos preciso que medir un proceso con agente, y por eso mismo conviene ser conservador con lo que se promete al comité.
¿Qué hago si no medí nada antes de desplegar la IA?
Tomar la línea base ahora y, donde exista, rescatar datos históricos de los sistemas (tickets, CRM, ERP tienen fechas y volúmenes aunque nadie los mirase). Se pierde pureza estadística, pero una base imperfecta reconstruida es infinitamente mejor que seguir sin base. La alternativa —no medir porque ya es tarde— garantiza repetir el problema con el siguiente despliegue.
¿Las horas liberadas equivalen a ahorro real?
Solo si se les da destino: reinvertirlas en trabajo de más valor, absorber crecimiento sin contratar o no cubrir una vacante. Si el proceso consume 120 horas menos y todo el mundo sigue igual de ocupado con lo mismo, el ahorro es contable pero no real. Por eso recomendamos decidir el destino de las horas antes del despliegue, no después.
¿Qué es un buen resultado a los 3 meses?
Para un primer agente sobre un proceso bien elegido: 50-80% del volumen operado sin intervención, coste unitario bajando de forma clara (a menudo 40-70% en procesos administrativos) y calidad igual o mejor que la base. Si a los 3 meses no hay ninguna métrica claramente mejor, el problema suele estar en la elección del proceso o en la definición del alcance, no en "la IA".
¿Quién debe ser el dueño de estas métricas?
El dueño del proceso, no el departamento de IT ni el proveedor: la persona que responde del coste y la calidad de facturación, ventas o soporte es quien debe responder de sus métricas con agente incluido. Un cuadro mensual de una página por proceso —las cuatro métricas contra base y objetivo— es suficiente para dirección.