Métricas de valor multidimensionales
El lunes posterior al lanzamiento, el nuevo tablero de Distribuidora Norte ocupaba la pantalla grande de la sala de reuniones. Mostraba ventas, entregas, reclamos y clientes con riesgo de baja. Los datos se actualizaban solos y los gráficos coincidían con el diseño aprobado. Se podían contar usuarios, consultas y alertas procesadas. A simple vista, el proyecto ya podía declararse exitoso.
Entonces el gerente hizo una pregunta menos cómoda: “¿Estamos decidiendo mejor?”. Nadie respondió enseguida. El tablero decía cuánto se había usado, no qué había cambiado gracias a ese uso. No decía si el supervisor llegaba antes a un reclamo ni si los vendedores evitaban bajas que de otro modo se habrían producido. Tampoco decía si los choferes sentían que el seguimiento los ayudaba a ordenar la ruta o si solo los vigilaba con más precisión.
Ese silencio es la distancia entre actividad y valor. Una organización puede poner modelos en producción, comprar licencias, registrar miles de conversaciones con un asistente y mejorar la precisión de un algoritmo sin que ninguna decisión relevante mejore. También puede obtener un beneficio económico y, al mismo tiempo, degradar la autonomía, concentrar conocimiento o excluir a quienes no pueden usar el nuevo canal. Si se mide solo lo fácil, queda afuera la parte del cambio que vuelve sostenible, o intolerable, a la tecnología.
El IMIA pregunta si la organización tiene condiciones para avanzar. Este capítulo hace una pregunta posterior y más difícil: ¿valió la pena la intervención, y para quién? La respuesta no puede improvisarse al cierre. Tiene que empezar antes de construir, cuando todavía se puede acordar qué cambio justificaría el esfuerzo.
El atractivo de las cifras disponibles
Todo sistema produce números sobre sí mismo: tiempo de respuesta, sesiones activas, documentos procesados, predicciones emitidas, recomendaciones aceptadas. Sirven para saber si la solución funciona y si alguien la usa. El problema empieza cuando se los presenta como prueba de valor.
Una tasa alta de uso puede significar que la herramienta ayuda, o que la dirección volvió obligatorio un paso que antes no existía. Muchas consultas a un chatbot pueden mostrar interés, o mostrar que las respuestas no resuelven el problema y cada persona tiene que preguntar varias veces. Una precisión del 92% puede ser excelente en un contexto y desastrosa en otro, según dónde se concentre el 8% restante y qué consecuencias tenga cada error.
Lo que este libro llama métricas de vanidad son los números que describen actividad y se usan para insinuar un resultado que no midieron. No son necesariamente falsos. Son incompletos y, por eso, fáciles de acomodar a la historia que alguien quiere contar.
La presión por mostrar éxito llega temprano. Un proyecto tiene patrocinadores, presupuesto y una promesa que defender. Si nadie acordó una línea de base, al final se elige el indicador que mejor salió. Tal vez bajó el tiempo de una tarea, aunque creció el reproceso. Tal vez aumentaron los casos atendidos, aunque empeoró la resolución. Tal vez los empleados entregan antes, pero siguen trabajando por fuera del sistema para lograrlo.
Medir valor exige resistir esa selección retrospectiva. No elimina la interpretación ni produce una verdad automática, pero obliga a comprometer las preguntas antes de conocer las respuestas.
La distancia entre desplegar y transformar
Durante 2025 y 2026 apareció evidencia a escala sobre la distancia entre lo que se invierte en IA y el valor que se obtiene. El informe preliminar del MIT que difundió la expresión GenAI Divide señaló que la gran mayoría de las organizaciones estudiadas no lograba retorno de sus iniciativas generativas, pese a la magnitud de la inversión. Por ser preliminar, no corresponde convertir una cifra llamativa en ley general. Su explicación es más fértil que el porcentaje: el obstáculo no estaba principalmente en los modelos, sino en una brecha de aprendizaje organizacional. Las soluciones no conservaban suficiente contexto ni se integraban a la operación de un modo que les permitiera aprender de ella.
La observación coincide con la tesis del puente. Comprar acceso a una capacidad técnica no equivale a incorporarla al trabajo. Entre una cosa y la otra hay definiciones, memoria institucional, confianza, responsables y mecanismos para corregir. Si esa trama falta, un modelo más potente puede mejorar una demostración sin cambiar el resultado de la organización.
También hay evidencia de beneficios concretos. Brynjolfsson, Li y Raymond estudiaron el uso de IA generativa en un centro de soporte y publicaron sus resultados en The Quarterly Journal of Economics en 2025. Observaron un aumento promedio del 15% en los casos resueltos por hora, con una mejora mayor entre los trabajadores menos experimentados. El reparto del beneficio importa tanto como su tamaño: la herramienta parecía acercar a quienes empezaban una parte del conocimiento que antes estaba concentrado en los expertos.
Ese hallazgo no autoriza a prometer un 15% en cualquier actividad. Ocurrió en un contexto, una tarea y una organización determinados. Lo que sí muestra es por qué el valor tiene que seguir a las personas: una misma tecnología beneficia de manera distinta según la experiencia previa, y el promedio oculta esa distribución.
El relevamiento global de McKinsey de fines de 2025 aportó otro contraste. Alrededor del 6% de quienes respondieron quedó clasificado como de alto desempeño (high performers): organizaciones que atribuían a la IA al menos un 5% de su resultado operativo (EBIT). Un 39% informaba algún impacto en ese resultado, una vara bastante más baja. Como toda encuesta de industria, pide cautela. Aun así, ayuda a formular la pregunta correcta: ¿qué distingue la adopción visible de la capacidad sostenida de capturar valor?
La evidencia internacional ofrece mecanismos y órdenes de magnitud, pero no reemplaza la medición local. Una pyme mendocina no trabaja en las mismas condiciones que el centro de soporte de una gran empresa. El puente usa esos estudios para evitar dos errores opuestos: negar que haya beneficios medibles, o suponer que se trasladan sin mirar el contexto.
Antes de medir una mejora
La línea de base es una descripción del estado anterior a la intervención. Parece una exigencia obvia, pero muchos proyectos la omiten porque el problema se presenta como urgente o porque no hay datos históricos. Una vez implementado el cambio, ya no se puede reconstruir con precisión cómo se trabajaba antes. Queda el recuerdo, y el recuerdo tiende a acomodarse al resultado.
Una línea de base no necesita ser sofisticada. Puede combinar tiempos registrados durante algunas semanas, errores observados, entrevistas, muestras de decisiones y una encuesta breve. Lo decisivo es que mida lo que la intervención dice que va a cambiar.
Si el objetivo es responder antes a los reclamos, hay que registrar cuándo se considera abierto un reclamo, cuándo se lo da por resuelto y cuántos casos vuelven a abrirse. Si se busca mejorar las decisiones comerciales, contar reuniones no alcanza: hay que observar cuánto demora una decisión, qué evidencia usa y con qué frecuencia hay que corregirla. Si se promete liberar trabajo repetitivo, no basta con medir las horas de la tarea original. También cuenta el tiempo nuevo que se dedica a revisar resultados, corregir excepciones y mantener el sistema.
“No medíamos eso” es una respuesta válida. Describe una limitación real y puede convertirse en la primera mejora del proyecto: diseñar un período de observación antes de comprometer un porcentaje. Inventar una base después del hecho da una cifra más cómoda y una decisión peor.
Además hay que decidir qué variación sería significativa. Cinco minutos menos pueden ser importantes en una tarea que ocurre miles de veces y triviales en una que sucede una vez por mes. El umbral depende de la frecuencia, el costo, el riesgo y la experiencia de las personas.
Gobernar el significado
Antes de construir un tablero, la organización necesita acordar qué significan sus números. Varias áreas pueden usar la palabra “venta” para cosas distintas: una registra el pedido, otra la facturación y otra el cobro. Ninguna definición es absurda en sí misma. El problema aparece cuando se las combina sin declarar la diferencia.
La anarquía de métricas se reconoce cuando dos tableros responden a la misma pregunta con resultados incompatibles y cada área defiende el suyo. Un proyecto de IA no resuelve ese conflicto; puede, en cambio, esconderlo detrás de una capa más compleja.
Cada indicador relevante necesita una definición accesible, una fuente identificada y un dueño de negocio. El dueño no es quien programa el cálculo. Es quien puede explicar por qué la definición representa el fenómeno, aceptar sus límites y autorizar un cambio cuando el proceso se modifica.
La capa semántica, un lugar donde se conservan las definiciones y reglas compartidas, evita que cada tablero vuelva a calcular los conceptos centrales. Pero la arquitectura sola no gobierna: hace falta un ritual de revisión. Un indicador puede haber sido útil y dejar de estar conectado con una decisión. Si sigue en pantalla por inercia, se convierte en un KPI zombi, que consume atención sin orientar ninguna acción.
Una pregunta sencilla suele ordenar el diseño: ¿qué decisión del lunes cambia si este número sube o baja? Si nadie puede responderla, quizá el gráfico sea interesante, pero todavía no es una métrica de gestión. Si hay respuesta, tiene que quedar claro quién decide, en qué plazo y qué otra información necesita.
La cantidad también importa. Un tablero ejecutivo con decenas de indicadores reparte la atención hasta volverla irrelevante. Es preferible un conjunto pequeño y confiable, con vistas de detalle para cuando una señal pide investigar. Medir más no equivale a comprender mejor.
Cinco dimensiones del valor
El valor económico es indispensable, sobre todo en organizaciones con recursos escasos. Una intervención tiene que poder explicar qué tiempo libera, qué errores evita, qué costo reduce o qué ingreso vuelve posible. Pero el resultado económico no agota la transformación. A veces llega tarde; otras veces mejora a costa de una fragilidad que termina destruyéndolo.
Por eso el método observa cinco dimensiones del valor: económica, decisional, humana, organizacional y social. No forman un índice universal ni se suman como si una mejora compensara cualquier daño. Son perspectivas que obligan a mirar consecuencias diferentes.
Valor económico
Incluye tiempo, costo, ingreso y uso de recursos. Para medirlo bien hay que evitar las equivalencias automáticas. Diez horas “ahorradas” no se convierten necesariamente en diez horas facturables. Tal vez se redistribuyen hacia tareas atrasadas, reducen horas extra o permiten atender mejor. Ese resultado sigue teniendo valor, pero hay que nombrarlo con precisión.
También hay que seguir el costo total. Una automatización puede reducir la carga manual y, a la vez, aumentar licencias, supervisión, consumo de infraestructura y dependencia del proveedor. El beneficio neto aparece después de sumar mantenimiento y transición, no en la comparación entre la tarea vieja y la demostración del sistema nuevo.
Valor decisional
Pregunta si las decisiones son más oportunas, consistentes, informadas y trazables. En Distribuidora Norte no bastaba con saber cuántas alertas se habían abierto. Importaba cuánto tiempo pasaba desde la primera señal de un problema hasta la conversación con el cliente, qué información usaba el vendedor y si el motivo para aceptar o rechazar la recomendación quedaba disponible para aprender.
Una decisión más rápida no siempre es mejor. Si la velocidad elimina la revisión en un caso de alto riesgo, la calidad puede empeorar. Por eso el valor decisional mira juntas la oportunidad y la corrección, y distingue las situaciones reversibles de las decisiones que afectan derechos o producen costos difíciles de reparar.
Valor humano
Sigue lo que cambia en la experiencia y la capacidad de quienes trabajan con el sistema: autonomía, carga, aprendizaje, confianza y bienestar. Algunas señales son cuantitativas, como las horas extra, la rotación o la frecuencia de correcciones; otras requieren entrevistas u observación.
Esta dimensión impide declarar éxito cuando la productividad sube porque el trabajo se intensificó. También permite reconocer beneficios que el balance económico tarda en mostrar: menos interrupciones, más claridad sobre las prioridades, la posibilidad de aprender una tarea nueva o el fin de una carga emocional repetitiva.
La percepción no es un dato menor. Si el equipo siente que una herramienta pensada para ayudarlo lo vigila, esa interpretación va a modificar su uso y, con el tiempo, el resultado económico. Lo humano no es una externalidad blanda: forma parte del mecanismo que produce valor.
Valor organizacional
Una intervención puede dejar capacidades que exceden el caso inicial: datos mejor definidos, responsables nuevos, prácticas de revisión, integración entre áreas y experiencia para evaluar tecnología futura. También puede hacer lo contrario y concentrar el conocimiento en un proveedor o en una sola persona.
El IMIA permite observar cambios en esa configuración. Una mejora en cultura y capacidades, en calidad de datos o en gobernanza puede ser un resultado en sí, aunque el primer piloto entregue un beneficio económico modesto. Aun así, hay que evitar usar “ganamos madurez” como consuelo automático. La capacidad nueva necesita evidencia: una política que se aplica, un proceso que ya no depende de una planilla personal, un segundo referente que puede tomar el relevo.
Valor social
En el sector público esta dimensión suele ser obligatoria. Mide acceso, equidad, posibilidad de apelación, calidad del servicio y cómo se reparten los beneficios y los errores. Un trámite digital puede reducir costos y, a la vez, excluir a quienes tienen mala conectividad. Un modelo puede mejorar el promedio y concentrar los falsos positivos en un grupo específico. El resultado agregado no describe esa distribución.
También vale para organizaciones privadas cuando una decisión afecta oportunidades, precios o condiciones de acceso. En proyectos vinculados con la sostenibilidad, la dimensión social tiene que dialogar con el costo ambiental de la infraestructura. Las promesas de “inteligencia” o de “eficiencia verde” exigen medir energía, inclusión y efectos materiales, no solo cambiar el lenguaje del informe.
Elegir sin reducir
No todos los proyectos pueden medir las cinco dimensiones con la misma profundidad. Intentarlo puede producir un sistema de medición tan costoso que nadie lo sostenga. Al comienzo se eligen dos o tres ejes prioritarios según el dictamen sociotécnico, y los demás se revisan para detectar daños graves.
En una automatización administrativa de bajo riesgo, el valor económico y el humano pueden ser el centro: cuánto tiempo se libera y cómo cambia la carga. En un sistema que prioriza inspecciones públicas, el valor decisional y el social son inseparables. En una organización que recién ordena sus datos, el valor organizacional puede llegar antes que el retorno económico.
Priorizar no es olvidar. Es declarar qué se va a medir de manera sistemática y qué se va a vigilar como guardarraíl. Una mejora en dos ejes no habilita a ignorar un daño severo en otro: ninguna cantidad de horas ahorradas vuelve aceptable una discriminación no corregida.
Un protocolo que acompaña el proyecto
La medición empieza durante el diagnóstico. Ahí se acuerda la línea de base, se eligen las dimensiones y se registran los supuestos. Antes de construir se definen objetivos y umbrales: qué cambio sería valioso, cuánto tiempo tiene que sostenerse y qué consecuencia obligaría a detener el piloto.
Durante la implementación se siguen indicadores tempranos, no para declarar victoria sino para corregir. Si aumenta el uso y también los rodeos manuales, hay algo que investigar. Si baja el tiempo pero crecen las reaperturas, la velocidad está ocultando reproceso.
El cierre compara con la línea de base y separa tres clases de resultado: lo que puede atribuirse a la intervención con razonable confianza, lo que mejoró pero tiene causas múltiples y lo que no pudo medirse. Esa distinción protege contra la tentación de adjudicarle al proyecto cualquier cambio favorable ocurrido en el mismo período.
Después entra la higiene sociotécnica. Algunos beneficios se desvanecen cuando termina el acompañamiento; otros aparecen cuando el equipo aprende a usar la herramienta con más criterio. Una revisión a los tres o seis meses dice más sobre la adopción que la semana del lanzamiento.
Volver a la sala de reuniones
En Distribuidora Norte, el tablero final no necesitaba arrancar con cinco decenas de indicadores. Podía hacerlo con dos preguntas bien medidas. La primera: ¿el supervisor actúa antes frente a un reclamo relevante? La segunda: ¿los choferes sienten que el nuevo flujo los ayuda a resolver la ruta, o que solo suma vigilancia?
La primera exigía acordar cuándo empezaba un reclamo, cuándo había una acción y cuántos casos se reabrían. La segunda no podía deducirse del uso. Pedía escuchar al equipo antes y después, observar los rodeos y registrar si aumentaban las correcciones hechas por fuera del sistema.
El ahorro en pesos podía llegar más tarde; sin una línea de base confiable, prometerlo habría sido pura narración. La mejora en calidad de datos y gobernanza, en cambio, sí podía observarse en las dimensiones correspondientes del IMIA, con la honestidad de aclarar que el instrumento describe configuración y todavía espera calibración empírica.
Medir así no produce una cifra perfecta. Produce algo más útil: una explicación discutible y verificable de qué cambió, para quién y a qué costo. Con ella se puede reconocer un éxito parcial, detener una intervención que hace daño o aprender de un resultado distinto del esperado.
El valor no vive en el modelo, porque el modelo no espera la respuesta a un reclamo, no toma una decisión difícil, no aprende un oficio ni pierde el acceso a un derecho. Todo eso les pasa a personas y organizaciones. Las métricas cobran sentido cuando siguen esas consecuencias y se niegan a confundir el brillo de la actividad con la transformación del trabajo.
Ver también: Conceptos propios (métrica de valor) · IMIA — el instrumento de madurez · El puente aplicado a las pymes · Higiene sociotécnica