Cómo implementar IA en la empresa y medir el resultado
Una guía para responder cuánto rindió la IA en su empresa: diagnóstico de madurez en 15 minutos, coste por tarea aceptada en una hoja de cálculo de nueve campos y un plan de cuatro semanas para el primer proceso.
Su empresa contrató herramientas de IA hace un año. En una reunión de directorio, alguien pregunta cuánto rindió eso. La respuesta llega en número de usuarios activos, de mensajes enviados, quizá de horas "ahorradas" según una encuesta interna. Nadie en la sala sabe decir si algún proceso quedó más barato, más rápido o más confiable.
Para responder esa pregunta con un número, necesita tres cosas, y puede empezar a usarlas el lunes: un diagnóstico de madurez que se hace en 15 minutos, una cuenta de coste por tarea aceptada que cabe en una hoja de cálculo de nueve campos, para descargar, y un plan de cuatro semanas para poner el primer proceso en operación.
El método reúne lo que publicaron el Software Engineering Institute de Carnegie Mellon, Microsoft, Gartner, AWS y el NIST con lo que vemos en los proyectos que hacemos. Donde la síntesis es nuestra, lo decimos.
Para quien tiene cinco minutos:
- La adopción de IA ya es alta: el 88% de las organizaciones la usan, según el AI Index 2026, de Stanford. Lo que falta es operar. Los agentes aparecen en menos del 10% de las empresas en la mayoría de las funciones de negocio.
- Implementar IA es cambiar un proceso y poder medir el cambio. Distribuir licencias se queda en el primer nivel.
- Evalúe la madurez por dimensión, sin nota única. Un promedio de 2,5 esconde que la empresa sabe construir y no sabe medir.
- Decida cuánto puede hacer la IA por sí sola en cada proceso. Mantener a la IA preparando la acción para que una persona la apruebe puede ser la elección más madura.
- Mida el coste por tarea aceptada. En un ejemplo típico, el modelo cuesta R$ 2,30 por tarea y la tarea aceptada cuesta R$ 7,22, porque alguien tiene que verificar y corregir.
- Antes de empezar, escriba en qué condición apaga el proyecto.
Las cuatro preguntas de la reunión de directorio
Una empresa madura en IA puede responder, para cada proceso en el que la IA trabaja:
- ¿Cuánto cuesta una tarea aceptada? Sumando modelo, infraestructura y el tiempo de las personas que verifican y corrigen.
- ¿Cuánto acierta? Medido en casos con respuesta conocida, que cualquier persona puede verificar.
- ¿Qué puede hacer por sí sola? Y quién aprueba el resto, y quién puede apagarla.
- ¿Qué indicador del negocio cambió? Plazo, costo operativo, ingresos, margen o riesgo.
Si usted responde las cuatro, sabe dónde invertir a continuación. Si no responde ninguna, empiece por el diagnóstico más abajo.
El caso que muchos citaron a medias
En febrero de 2024, Klarna anunció que su asistente de atención con IA había conducido 2,3 millones de conversaciones en el primer mes. Eran dos tercios de las atenciones por chat, el equivalente al trabajo de 700 agentes a tiempo completo. El tiempo de resolución cayó de 11 a menos de 2 minutos, y la empresa estimó una ganancia de US$ 40 millones en el beneficio de ese año. También informó una satisfacción de los clientes equivalente a la de la atención humana.
El anuncio se volvió referencia de ROI de IA en presentaciones de todo el mundo. En mayo de 2025, el CEO Sebastian Siemiatkowski dijo a Bloomberg que la empresa había dado demasiado peso al coste, y que la calidad cayó. Klarna volvió a contratar agentes humanos.
Los números de 2024 medían uso, volumen y velocidad: conversaciones conducidas, tiempo por conversación, costo evitado. La corrección de 2025 trata de otra cosa, la parte del trabajo que el cliente y la empresa aceptaron como bien hecha. Coste por tarea ejecutada y coste por tarea aceptada cuentan historias distintas, y la segunda es la que llega al resultado.
La distancia entre usar y operar
El AI Index 2026, de Stanford, registra que el 88% de las organizaciones encuestadas usaban IA en 2025 y el 70% usaba IA generativa en al menos una función. El uso de agentes aparecía en un dígito en casi todas las funciones. En la encuesta de McKinsey de noviembre de 2025, el 23% de las empresas dice escalar agentes en algún punto de la organización, y en ninguna función ese número pasa del 10%.
En Brasil, el informe de la OCDE con BCG e INSEAD consultó a 167 empresas del estado de São Paulo. La incertidumbre sobre el retorno aparece en el 38% de ellas, solo por detrás de privacidad y seguridad (44%).
La diferencia entre usar e implementar queda clara al mirar dónde entra la IA:
| Dónde entra la IA | Ejemplo | Qué cambia |
|---|---|---|
| Herramienta | Una persona usa ChatGPT para escribir un correo | El tiempo de esa persona |
| Tarea | El equipo usa un asistente estandarizado para resumir contratos | Una etapa, sin conexión con el resto |
| Flujo | La IA lee la solicitud, busca datos internos y prepara una respuesta para aprobación | Un tramo del proceso |
| Proceso | La respuesta aprobada se registra en el sistema, con historial, y se sigue el indicador del proceso | El resultado del proceso |
| Operación | Varios procesos comparten integraciones, controles de acceso, pruebas y paneles | La forma en que trabaja la empresa |
Las dos primeras filas son uso. Desde la tercera, la IA lee, busca, prepara, somete a aprobación y registra, y cada uno de esos verbos depende de algo que el modelo no entrega por sí solo: acceso a los sistemas, permisos, regla de revisión y registro de lo que ocurrió.
Los 5 niveles de madurez en IA
| Nivel | Cómo está la empresa | Señales observables |
|---|---|---|
| 1. Exploración | Las personas usan IA por cuenta propia | Licencias sueltas, uso individual, ningún proceso depende de la IA |
| 2. Experimentación | Empiezan a aparecer casos de uso | Pilotos con responsable, automatizaciones aisladas, resultado medido por impresión |
| 3. Operación | La IA entra en un proceso real | Integración con sistemas, responsable del proceso, línea de base y métricas mensuales |
| 4. Escala | Los casos comprobados se replican | Integraciones, controles de acceso y pruebas reaprovechados entre procesos |
| 5. Transformación | Los procesos se rediseñan considerando la IA | Cambiaron roles y etapas, y los indicadores del negocio reflejan el cambio |
Los niveles son una síntesis nuestra de los modelos del SEI, Microsoft, Gartner y AWS. La correspondencia está en la nota de método, al final del texto.
El salto más difícil es del nivel 2 al 3. Es donde el piloto gana responsable, integración y medida, y donde se detiene la mayor parte de los proyectos.
Ninguna empresa necesita llevar todos los procesos al nivel 5. Una clasificación de documentos con miles de ítems por mes justifica llegar a la escala. Un informe trimestral hecho por dos personas quizá nunca necesite pasar de la experimentación.
El nivel 5 depende de rediseñar el trabajo, y hay evidencia de que ahí es donde aparece el dinero. McKinsey evaluó 25 características organizacionales en la encuesta de marzo de 2025, y el rediseño de los flujos de trabajo fue la de mayor efecto sobre el impacto de la IA generativa en el resultado operativo. Solo el 21% de las empresas había rediseñado de forma fundamental al menos algunos flujos.
Diagnóstico de madurez en 15 minutos
Una empresa no está en un solo nivel. El modelo de Microsoft recomienda evaluar cada pilar por separado, sin convertir el resultado en una nota general, y registrar solo lo que ocurre de forma constante. Los ejemplos aislados y las intenciones quedan fuera. El diagnóstico siguiente sigue esa regla.
Cómo usarlo. Responda sí o no a cada pregunta, con base en lo que existe hoy y se puede mostrar. En cada dimensión, comience en el nivel 1 y suba un nivel por cada "sí", deteniéndose en el primer "no". El nivel 5 queda fuera, porque depende de rediseño de procesos, que se evalúa caso por caso.
1. Estrategia y valor
- N2: ¿Existe una lista de casos de uso de IA, con un responsable para cada uno?
- N3: ¿Cada caso en uso tiene un objetivo de negocio y una meta numérica aprobados por la dirección?
- N4: ¿Los nuevos casos se priorizan por valor y viabilidad en un ritual que se repite, como una revisión trimestral?
2. Proceso
- N2: ¿Algún piloto de IA funciona con usuarios reales, aunque sea fuera del sistema oficial?
- N3: ¿Al menos un proceso tiene diseñado qué hace la IA, qué hace la persona y en qué orden?
- N4: ¿Un segundo proceso entró en operación reaprovechando el diseño del primero?
3. Personas y responsabilidad
- N2: ¿Alguien del área de negocio acompaña cada piloto?
- N3: ¿Cada proceso con IA tiene un responsable en el área de negocio que responde por el indicador, y los usuarios fueron capacitados en él?
- N4: ¿Existe un equipo o rol fijo que ayuda a nuevas áreas a poner IA en operación?
4. Datos y tecnología
- N2: ¿El piloto trabaja con datos reales de la empresa, aunque se exporten a mano?
- N3: ¿La solución lee y escribe en los sistemas donde ocurre el trabajo, respetando los permisos de cada usuario?
- N4: ¿Las integraciones, el control de acceso y el registro de uso se comparten entre procesos?
5. Gobernanza y autoridad
- N2: ¿Existe una política sobre qué datos se pueden enviar a herramientas de IA?
- N3: ¿Para cada proceso está escrito qué hace la IA por sí sola, qué exige aprobación y quién puede apagarla?
- N4: ¿Toda acción de la IA queda registrada y es revisada periódicamente por alguien ajeno al equipo que la construyó?
6. Medición
- N2: ¿Alguien reunió ejemplos de acierto y de error del piloto?
- N3: ¿Existe línea de base del proceso antes de la IA y un conjunto de casos de prueba con respuesta conocida?
- N4: ¿Todo cambio en el sistema pasa por las pruebas antes de llegar a los usuarios, y los indicadores se revisan cada mes?
Cómo leer el resultado
Un perfil posible:
| Dimensión | Nivel |
|---|---|
| Estrategia y valor | 3 |
| Proceso | 2 |
| Personas y responsabilidad | 2 |
| Datos y tecnología | 4 |
| Gobernanza y autoridad | 3 |
| Medición | 1 |
El promedio daría 2,5 y no diría nada. El perfil dice que la empresa sabe construir y tiene reglas, pero no cambió procesos y no logra probar valor. La próxima inversión va a un responsable del proceso y a una línea de base, antes que a cualquier tecnología nueva.
La regla general: invierta en la dimensión más baja que impide que el próximo proceso llegue al nivel 3. En los diagnósticos que hacemos, suele ser la medición o el responsable del proceso.
Cuánto está autorizada a hacer la IA
Jake Moffatt preguntó al asistente virtual de Air Canada cómo funcionaba la tarifa por duelo. El asistente respondió que podía comprar el pasaje y pedir el descuento después. La política de la empresa decía lo contrario. Cuando el reembolso fue negado, Air Canada argumentó ante el tribunal de disputas civiles de la Columbia Británica que el asistente era una entidad separada, responsable de sus propios actos. El tribunal rechazó el argumento en 2024: el asistente "sigue siendo solo una parte del sitio web de Air Canada", y la empresa responde por todo lo que está en el sitio. Tuvo que pagar la diferencia de la tarifa.
El monto fue pequeño, y la regla que salió de ahí vale para cualquier empresa: cuando la IA habla o actúa en nombre de la empresa, la empresa responde. Por eso cada proceso necesita un nivel de autoridad definido.
| Nivel de autoridad | La IA puede | Ejemplo |
|---|---|---|
| A0. Consultar | Responder preguntas y resumir | Resumen de un contrato para lectura del abogado |
| A1. Recomendar | Sugerir una decisión, que la persona toma | Indicación de qué facturas parecen divergentes |
| A2. Preparar | Dejar la acción lista para que alguien la apruebe | Borrador de respuesta al cliente, completado con datos del sistema |
| A3. Ejecutar con aprobación | Ejecutar después de un clic de confirmación | Pedido de transferencia entre tiendas, liberado por el comprador |
| A4. Ejecutar dentro de límites | Ejecutar sola, dentro de reglas y valores definidos | Reclasificación de gastos por debajo de un valor, con registro |
Cuando el sistema solo recomienda, un error cuesta el tiempo de quien revisa. Cuando ejecuta, el error se vuelve un pedido equivocado, un pago indebido o una promesa al cliente que la empresa deberá cumplir.
Las reglas que usamos:
- Empiece en A1 o A2. Suba de nivel cuando los números muestren que el error se volvió raro y barato. La sensación de comodidad del equipo suele llegar antes que los números.
- La autoridad es por proceso. La misma empresa puede tener a la IA ejecutando sola la clasificación de gastos pequeños y solo preparando respuestas a clientes.
- Escriba quién apaga. El NIST AI Risk Management Framework pide que los procesos de supervisión humana se definan, evalúen y documenten. En una empresa mediana, eso cabe en una página por proceso.
Cómo medir resultados de IA
El número de usuarios activos, de mensajes y de tokens consumidos mide consumo de IA. El token es la unidad en la que los proveedores de IA cobran por el texto que el modelo lee y escribe, un pedazo de palabra. Explica la factura y dice poco sobre la calidad del trabajo. La medición útil tiene cuatro capas:
| Capa | Pregunta | Ejemplos de indicador |
|---|---|---|
| Uso | ¿Quién usa y con qué frecuencia? | Usuarios activos, procesos con IA, frecuencia de uso |
| Producción | ¿Cuánto trabajo salió? | Tareas completadas, documentos procesados, respuestas generadas |
| Desempeño | ¿El trabajo quedó mejor y más barato? | Tiempo por tarea, coste por tarea, tasa de aceptación, tasa de error, retrabajo |
| Resultado | ¿La empresa ganó algo? | Plazo, costo operativo, ingresos, margen, conversión, riesgo |
Uso y producción muestran adopción. El valor solo aparece en desempeño y resultado. El anuncio de Klarna en 2024 era fuerte en producción y velocidad, y la corrección vino del desempeño.
Estas medidas suelen confundirse, y usted necesita todas:
- Prueba de calidad: ¿la IA hace bien la tarea? Hamel Husain y Shreya Shankar definen estas evaluaciones como la medida de si un sistema de IA funciona para sus usuarios en tareas y datos realistas. Ejemplo: 94% de acierto en 300 casos con respuesta conocida.
- Indicador de operación: ¿cuánto cuesta y cuánto demora? Ejemplo: R$ 7,22 y menos de 8 minutos por tarea aceptada, sumando la IA y la revisión.
- Indicador de negocio: ¿qué cambió en la empresa? Ejemplo: el plazo de respuesta al cliente bajó de tres días a uno.
Un sistema puede acertar el 94% de las pruebas y no cambiar ningún indicador de negocio, porque entró en una etapa que no era el cuello de botella.
No pregunte, mida
En un experimento controlado de METR en 2025, 16 desarrolladores con experiencia pronosticaron que la IA los haría un 24% más rápidos. Después del trabajo, creían haber ganado cerca de un 20%. La medición mostró que las tareas con IA llevaron un 19% más de tiempo. Una nueva ronda, en 2026, tuvo un resultado mixto, con un sesgo de selección reconocido por los autores. En los dos casos, la percepción de quien usa no sirvió como medida.
El efecto también cambia según quién usa. En el estudio de Brynjolfsson, Li y Raymond publicado por el NBER, con 5.179 agentes de soporte, la IA aumentó en un 14% los problemas resueltos por hora. Entre los novatos, un 34%. Entre los más experimentados, casi nada. El promedio de un estudio no predice la ganancia en su proceso, y solo medirlo lo responde.
Coste por tarea aceptada
Cuando la IA pasa a ejecutar trabajo, la pregunta útil deja de ser cuánto cuesta el modelo. Pasa a ser cuánto cuesta producir una unidad de trabajo que la empresa puede aceptar.
Coste por tarea aceptada = (coste de la IA + coste del tiempo humano de verificación y corrección) ÷ tareas aceptadas
Un ejemplo con números
El ejemplo es ilustrativo y sirve para mostrar la cuenta.
Antes. Un analista demora 45 minutos por tarea, con un costo de R$ 80 por hora. Cada tarea cuesta R$ 60. En 1.000 tareas por mes, son R$ 60.000.
Después. La IA ejecuta cada tarea en 4 minutos, con un costo mensual de R$ 2.300, o R$ 2,30 por ejecución. Ese es el número que suele ir a la presentación del proyecto. La cuenta completa incluye a las personas:
| Ítem | Cálculo | Costo mensual |
|---|---|---|
| IA (modelo, infraestructura, mantenimiento) | 1.000 ejecuciones | R$ 2.300 |
| Verificación de las 870 tareas aceptadas a la primera (87%) | 2 min cada una, 29 h | R$ 2.320 |
| Corrección de las 130 tareas que volvieron (13%) | 15 min cada una, 32,5 h | R$ 2.600 |
| Total para 1.000 tareas aceptadas | R$ 7.220 |
El coste por tarea aceptada es de R$ 7,22: tres veces el costo del modelo y un 88% por debajo de los R$ 60 del proceso anterior. La ganancia es real, y el número que debe llegar a la dirección es R$ 7,22.
Ahora el mismo proceso con un error de diseño. La IA se equivoca de forma impredecible, nadie sabe qué tareas verificar, y el equipo pasa a revisar todo desde cero: 45 minutos por tarea, más el costo de la IA. Son R$ 62.300 por mes, o R$ 62,30 por tarea aceptada. La IA quedó más cara que el proceso anterior.
Lo que separa los dos escenarios son las pruebas de calidad, la regla de revisión y la confianza del equipo para verificar por muestreo. La empresa decide todo eso sin cambiar de modelo.
La hoja de cálculo de nueve campos
Para hacer la cuenta en su proceso, necesita nueve números. La hoja de cálculo para descargar ya trae las fórmulas y los valores del ejemplo anterior. Cámbielos por los suyos. La hoja "Registro" cuenta, tarea por tarea, cuántas fueron aceptadas, corregidas o rehechas, y entrega los campos 5, 7 y 9.
| Campo | Dónde obtenerlo |
|---|---|
| 1. Tareas por mes | Sistema o control del área |
| 2. Minutos por tarea, antes de la IA | Cronometraje de una muestra de 30 a 50 tareas |
| 3. Coste por hora del equipo | Salario con cargas, dividido por las horas trabajadas |
| 4. Coste mensual de la IA | Factura del modelo, infraestructura y mantenimiento prorrateado |
| 5. % de tareas aceptadas a la primera | Registro de aceptación en la revisión |
| 6. Minutos de verificación por tarea aceptada | Cronometraje de una muestra |
| 7. % de tareas corregidas | Registro de aceptación en la revisión |
| 8. Minutos de corrección por tarea | Cronometraje de una muestra |
| 9. % de tareas rehechas desde cero | Registro de aceptación en la revisión |
Coste antes = campo 2 × campo 3 ÷ 60. Coste después = campo 4 dividido por las tareas, más el tiempo de verificación, corrección y rehecho convertido en reales. Los campos 5, 7 y 9 exigen una cosa simple: registrar, para cada tarea, si fue aceptada, corregida o rehecha.
Métricas para agentes de IA
Cuando la IA ejecuta tareas, cinco tasas completan la cuenta:
| Métrica | Cálculo |
|---|---|
| Tasa de aceptación | resultados aceptados ÷ resultados generados |
| Tasa de intervención humana | tareas que exigieron intervención ÷ tareas ejecutadas |
| Tasa de conclusión autónoma | tareas concluidas sin intervención ÷ total de tareas |
| Tasa de escalamiento | tareas enviadas a una persona para decidir ÷ total |
| Tasa de retrabajo | tareas corregidas después de concluidas ÷ tareas concluidas |
La meta es el nivel de autonomía que da el menor coste por tarea aceptada dentro del riesgo que la empresa acepta correr. En muchos procesos, ese punto está en A2 o A3.
Los errores que más vemos
El SEI atribuye buena parte de las fallas de adopción a expectativas desalineadas, aplicaciones mal elegidas e implementación mal ejecutada. En los diagnósticos que hacemos, esos motivos aparecen con síntomas reconocibles:
| Lo que usted ve | Lo que suele faltar | Qué hacer |
|---|---|---|
| La discusión es sobre qué IA contratar | Un proceso elegido | Elija primero el proceso y deje el modelo para después |
| El piloto "funcionó", pero nadie sabe decir cuánto | Línea de base | Cronometre de 30 a 50 tareas como se hacen hoy antes de cambiar nada |
| El piloto funciona en la demostración y se traba con archivos reales | Acceso a los datos | Pruebe con el volumen y el desorden reales desde la primera semana |
| Las personas copian la respuesta de la IA y la pegan en otro sistema | Integración | Haga que la IA lea y escriba donde ocurre el trabajo |
| Tecnología construyó, negocio no asumió | Responsable del proceso | Nombre al responsable en el área de negocio antes de empezar |
| La evaluación es "se ve bien" | Casos de prueba | Arme un conjunto de ejemplos reales con la respuesta correcta conocida |
| El equipo revisa todo, o no revisa nada | Regla de revisión | Defina el nivel de autoridad y qué se verifica por muestreo |
| El informe mensual muestra accesos y mensajes | Medida de desempeño | Cámbielo por coste por tarea aceptada y por el indicador del proceso |
El caso más citado de agente sin límite ocurrió en julio de 2025. Jason Lemkin, fundador de SaaStr, probaba el agente de programación de Replit en la construcción de una aplicación. Con el proyecto en congelación de código, y después de pedir once veces, en mayúsculas, que no se alterara nada, vio al agente borrar la base de datos de producción. El agente además afirmó que la restauración era imposible, y funcionó (The Register). El CEO de Replit, Amjad Masad, calificó el episodio de inaceptable y anunció la separación automática entre la base de desarrollo y la de producción (The Register).
La falla estaba en la autoridad. El agente ejecutaba comandos en el entorno real sin aprobación, el nivel A4 de la tabla de autoridad, sin los límites que ese nivel exige. La instrucción "no alteres nada" era un pedido, y ninguna regla del sistema la garantizaba. Anthropic, que trabajó con decenas de equipos que construyen agentes, hace la misma recomendación en la guía sobre agentes: la autonomía aumenta el costo y el riesgo de errores que se acumulan, y por eso pide pruebas extensas en un entorno aislado, con las salvaguardas adecuadas.
El primer proceso en cuatro semanas
Antes de la semana 1: pregunte si el problema necesita IA. El NIST recuerda que un sistema de IA puede no ser la solución adecuada para la tarea. La Guía Unificada de Inteligencia Artificial del gobierno federal brasileño comienza por una fase de prospección, en la que el desafío se identifica y se prioriza antes de cualquier experimento. A veces una regla simple o una integración entre sistemas lo resuelve.
Semana 1. Elija y mida. Elija un proceso con volumen alto, reglas conocidas y un responsable en el área de negocio. Cronometre de 30 a 50 tareas como se hacen hoy y registre volumen, tiempo, costo y tasa de error. Escriba la meta y el criterio para apagar, por ejemplo: "si el coste por tarea aceptada no queda por debajo de la mitad del actual, paramos".
Semana 2. Defina autoridad y pruebas. Decida el nivel de autoridad inicial (A1 o A2), quién revisa y qué cuenta como tarea aceptada. Separe de 50 a 100 casos reales con la respuesta correcta conocida. Todo cambio en el sistema pasa por ellos antes de llegar a los usuarios.
Semana 3. Póngalo en el flujo. La solución lee y escribe en los sistemas donde ocurre el trabajo. En las primeras semanas, revise el 100% de las salidas y registre cada una como aceptada, corregida o rehecha. Cada error encontrado se vuelve un nuevo caso de prueba.
Semana 4. Haga la cuenta y decida. Complete la hoja de cálculo de nueve campos y compárela con la línea de base. Las decisiones posibles son ampliar (más volumen, menos revisión o más autoridad), ajustar (volver a la semana 2 con los errores mapeados) o apagar, si el criterio de la semana 1 no se alcanzó.
Apagar un proyecto que no pasó el criterio también es un resultado: en cuatro semanas usted sabe que ese proceso no compensa. Sin el criterio escrito, el mismo descubrimiento suele tardar un año y aparecer en una reunión de directorio.
Ese ciclo de planificar, ejecutar, verificar y corregir es el mismo que la ISO/IEC 42001, norma de sistema de gestión de IA, adopta como mejora continua.
Hacia dónde ir después
El SEI, en el modelo de madurez publicado con Accenture en 2026, define la madurez en IA como la capacidad de construir sistemas confiables y resilientes, con práctica rigurosa de ingeniería y gobernanza ligada a resultados de negocio.
Haga el diagnóstico con su directorio, elija un proceso y haga la cuenta en la planilla. Si quiere ayuda con el primer proceso, Catech Forward pone ingenieros dentro de su operación, con línea de base, pruebas y coste por tarea aceptada desde la primera semana.
Nota de método
Los cinco niveles y las seis dimensiones son una síntesis de CatechLabs. El SEI usa ocho dimensiones y Microsoft, cinco pilares. Condensamos esas estructuras para que quepan en un diagnóstico de directorio de una empresa mediana. La correspondencia entre los niveles es aproximada, porque cada modelo mide cosas algo distintas:
| Nivel CatechLabs | SEI / Accenture (2026) | Microsoft (2026) | Gartner | AWS |
|---|---|---|---|---|
| Exploración | Exploratory | 100 Initial | Awareness | Envision |
| Experimentación | Implemented | 200 Repeatable | Active | Experiment |
| Operación | Aligned | 300 Defined | Operational | Launch |
| Escala | Scaled | 400 Capable | Systemic | Scale |
| Transformación | Future-Ready AI | 500 Efficient | Transformational | (no tiene) |
Los niveles de autoridad (A0 a A4), la hoja de cálculo de nueve campos y el plan de cuatro semanas vienen de nuestra práctica. Los números de referencia (muestras de 30 a 50 tareas, 50 a 100 casos de prueba) son puntos de partida prácticos, sin base estadística.
Referencias
Carnegie Mellon SEI y Accenture, AI Adoption Maturity Model v1.0 (2026)
Modelo en cinco niveles y ocho dimensiones, orientado a llevar a las organizaciones de la experimentación a resultados predecibles.
Microsoft, Agentic AI Adoption Maturity Model (2026)
Cinco niveles y cinco pilares, con orientación para evaluar cada pilar por separado y con base en evidencia.
Gartner, AI Maturity Model Toolkit
Escala de cinco niveles, de Awareness a Transformational.
AWS, Generative AI Maturity Model
Cuatro niveles (Envision, Experiment, Launch, Scale) evaluados por aspecto.
NIST, AI Risk Management Framework 1.0 (2023)
Gestión de riesgo de IA en cuatro funciones: gobernar, mapear, medir y gestionar.
ISO/IEC 42001:2023 y 23894:2023
Sistema de gestión de IA y orientación para la gestión de riesgo de IA.
Secretaría de Gobierno Digital, Guia Unificado de Inteligência Artificial para o Setor Público
Ciclo de proyectos de IA en siete fases, de la prospección a la desactivación.
OCDE, BCG e INSEAD, The Adoption of Artificial Intelligence in Firms (2025)
Encuesta con empresas del G7 y de Brasil sobre adopción de IA y barreras, incluida la incertidumbre sobre el retorno.
Stanford HAI, AI Index 2026, capítulo de economía
Datos de adopción de IA, IA generativa y agentes en las organizaciones.
McKinsey, The state of AI: How organizations are rewiring to capture value (2025) y The state of AI in 2025
Rediseño de flujos de trabajo como la característica más asociada al impacto financiero, y datos sobre agentes a escala.
Brynjolfsson, Li y Raymond, Generative AI at Work, NBER y Quarterly Journal of Economics
Efecto causal de la asistencia de IA en la productividad de 5.179 agentes de soporte.
METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity (2025) y actualización (2026)
Experimento controlado en el que la percepción de ganancia divergió del desempeño medido.
Hamel Husain y Shreya Shankar, LLM Evals FAQ
Referencia práctica sobre cómo probar la calidad de sistemas de IA.
Anthropic, Building effective agents (2024)
Recomendaciones de quien construyó agentes con decenas de equipos: empezar por la solución más simple, probar en un entorno aislado y definir salvaguardas.
The Register, Vibe coding service Replit deleted user's production database y Replit makes vibe-y promise to stop its AI agents making vibe coding disasters (2025)
El incidente en que un agente borró una base de producción durante una congelación de código, y la respuesta de Replit.
Klarna, Klarna AI assistant handles two-thirds of customer service chats in its first month (2024), y Bloomberg, Klarna Turns From AI to Real Person Customer Service (2025)
El anuncio de los resultados del asistente y la revisión posterior de la estrategia por la propia empresa.
Civil Resolution Tribunal de la Columbia Británica, Moffatt v. Air Canada, 2024 BCCRT 149
Decisión que responsabilizó a la empresa por la información errónea dada por su asistente virtual.
Preguntas frecuentes
- ¿Cómo implementar IA en una empresa?
- Elija un proceso con volumen, responsable y costo conocido. Mida cómo funciona hoy, defina qué puede hacer la IA por sí sola y qué necesita aprobación, ponga la solución dentro del flujo de trabajo real y compare el antes y el después con los mismos indicadores. Repartir licencias es el comienzo del uso. La implementación comienza cuando un proceso cambia y el cambio se puede medir.
- ¿Por dónde empezar un proyecto de IA?
- Por el proceso. La elección del modelo viene después. El mejor primer caso tiene volumen alto, reglas conocidas, un responsable claro y un costo actual que alguien ya sabe calcular. Antes de construir, conviene preguntar si el problema necesita IA: el NIST recuerda que un sistema de IA puede no ser la solución adecuada para la tarea.
- ¿Qué es la madurez en IA?
- Es la capacidad de una organización de convertir la inteligencia artificial en resultado de negocio de forma repetible, medible y controlada. Depende de estrategia, procesos, personas, datos y tecnología, gobernanza y medición. La cantidad de herramientas contratadas dice poco sobre ella.
- ¿Cuáles son los niveles de madurez en IA?
- Cinco: exploración (uso individual), experimentación (pilotos aislados), operación (IA dentro de un proceso real, con responsable y métricas), escala (casos comprobados replicados sobre una base común) y transformación (procesos rediseñados considerando lo que las personas, el software y la IA hacen mejor). La evaluación debe hacerse por dimensión, sin una nota única para la empresa.
- ¿Cómo medir el ROI de la IA?
- Compare el coste total por tarea aceptada con el coste de la misma tarea antes de la IA. El coste total incluye el modelo, la infraestructura, el mantenimiento y el tiempo de las personas que revisan y corrigen el resultado. Después, verifique si el ahorro o la capacidad liberada apareció en un indicador de negocio, como plazo, margen, ingresos o riesgo.
- ¿Qué KPIs usar para inteligencia artificial?
- Organícelos en cuatro capas: uso (quién usa y con qué frecuencia), producción (cuántas tareas se completaron), desempeño (tiempo, coste, tasa de aceptación y retrabajo por tarea) y resultado (plazo, costo operativo, ingresos, margen, riesgo). Uso y producción indican adopción. Solo desempeño y resultado indican valor.
- ¿Cómo saber si una empresa está lista para agentes de IA?
- Un agente ejecuta acciones, así que la pregunta es si la empresa puede decir qué puede hacer, verificar lo que hizo y detenerlo cuando se equivoque. Eso exige un proceso documentado, acceso controlado a los sistemas, un conjunto de casos de prueba con respuesta conocida, un responsable del resultado y una línea de base para comparar.
- ¿Cómo escalar un piloto de IA a producción?
- Un piloto se convierte en operación cuando recibe responsable, integración con los sistemas donde ocurre el trabajo, reglas de revisión humana, pruebas de calidad repetidas ante cada cambio y métricas seguidas cada mes. Escalar es repetir eso en otros procesos reaprovechando lo ya construido: integraciones, controles de acceso, pruebas y paneles.