Como implementar IA na empresa e medir o resultado
Um guia para responder quanto a IA rendeu na sua empresa: diagnóstico de maturidade em 15 minutos, custo por tarefa aceita numa planilha de nove campos e um plano de quatro semanas para o primeiro processo.
Sua empresa assinou ferramentas de IA há um ano. Numa reunião de diretoria, alguém pergunta quanto isso rendeu. A resposta vem em número de usuários ativos, de mensagens enviadas, talvez de horas "economizadas" segundo uma pesquisa interna. Ninguém na sala sabe dizer se algum processo ficou mais barato, mais rápido ou mais confiável.
Para responder essa pergunta com número, você precisa de três coisas, e dá para começar a usá-las na segunda-feira: um diagnóstico de maturidade que se faz em 15 minutos, uma conta de custo por tarefa aceita que cabe numa planilha de nove campos, para baixar, e um plano de quatro semanas para colocar o primeiro processo em operação.
O método junta o que publicaram o Software Engineering Institute da Carnegie Mellon, a Microsoft, o Gartner, a AWS e o NIST com o que vemos nos projetos que fazemos. Onde a síntese é nossa, dizemos.
Para quem tem cinco minutos:
- Adoção de IA já é alta: 88% das organizações usam, segundo o AI Index 2026, de Stanford. O que falta é operar. Agentes aparecem em menos de 10% das empresas na maioria das funções de negócio.
- Implementar IA é mudar um processo e conseguir medir a mudança. Distribuir licenças fica no primeiro nível.
- Avalie a maturidade por dimensão, sem nota única. Uma média de 2,5 esconde que a empresa sabe construir e não sabe medir.
- Decida quanto a IA pode fazer sozinha em cada processo. Manter a IA preparando a ação para uma pessoa aprovar pode ser a escolha mais madura.
- Meça o custo por tarefa aceita. Num exemplo típico, o modelo custa R$ 2,30 por tarefa e a tarefa aceita custa R$ 7,22, porque alguém precisa conferir e corrigir.
- Antes de começar, escreva em que condição você desliga o projeto.
As quatro perguntas da reunião de diretoria
Uma empresa madura em IA consegue responder, para cada processo em que a IA trabalha:
- Quanto custa uma tarefa aceita? Somando modelo, infraestrutura e o tempo das pessoas que conferem e corrigem.
- Quanto ela acerta? Medido em casos com resposta conhecida, que qualquer pessoa pode conferir.
- O que ela pode fazer sozinha? E quem aprova o resto, e quem pode desligá-la.
- Qual indicador do negócio mudou? Prazo, custo operacional, receita, margem ou risco.
Se você responde às quatro, sabe onde investir a seguir. Se não responde a nenhuma, comece pelo diagnóstico mais abaixo.
O caso que muita gente citou pela metade
Em fevereiro de 2024, a Klarna anunciou que seu assistente de atendimento com IA havia conduzido 2,3 milhões de conversas no primeiro mês. Eram dois terços dos atendimentos por chat, o equivalente ao trabalho de 700 atendentes em tempo integral. O tempo de resolução caiu de 11 para menos de 2 minutos, e a empresa estimou um ganho de US$ 40 milhões no lucro daquele ano. Também informou satisfação dos clientes equivalente à do atendimento humano.
O anúncio virou referência de ROI de IA em apresentações pelo mundo. Em maio de 2025, o CEO Sebastian Siemiatkowski disse à Bloomberg que a empresa tinha dado peso demais ao custo, e que a qualidade caiu. A Klarna voltou a recrutar atendentes humanos.
Os números de 2024 mediam uso, volume e velocidade: conversas conduzidas, tempo por conversa, custo evitado. A correção de 2025 é sobre outra coisa, a parcela do trabalho que o cliente e a empresa aceitaram como bem feito. Custo por tarefa executada e custo por tarefa aceita contam histórias diferentes, e a segunda é a que chega ao resultado.
A distância entre usar e operar
O AI Index 2026, de Stanford, registra que 88% das organizações pesquisadas usavam IA em 2025 e 70% usavam IA generativa em pelo menos uma função. O uso de agentes aparecia na casa de um dígito em quase todas as funções. Na pesquisa da McKinsey de novembro de 2025, 23% das empresas dizem escalar agentes em algum ponto da organização, e em nenhuma função esse número passa de 10%.
No Brasil, o relatório da OCDE com BCG e INSEAD ouviu 167 empresas do estado de São Paulo. A incerteza sobre o retorno aparece para 38% delas, atrás apenas de privacidade e segurança (44%). Já escrevemos sobre essa distância em A IA chegou às empresas. O resultado ainda não.
A diferença entre usar e implementar fica clara quando se olha para onde a IA entra:
| Onde a IA entra | Exemplo | O que muda |
|---|---|---|
| Ferramenta | Uma pessoa usa o ChatGPT para escrever um e-mail | O tempo daquela pessoa |
| Tarefa | O time usa um assistente padronizado para resumir contratos | Uma etapa, sem ligação com o resto |
| Fluxo | A IA lê a solicitação, busca dados internos e prepara uma resposta para aprovação | Um trecho do processo |
| Processo | A resposta aprovada é registrada no sistema, com histórico, e o indicador do processo é acompanhado | O resultado do processo |
| Operação | Vários processos compartilham integrações, controles de acesso, testes e painéis | A forma como a empresa trabalha |
As duas primeiras linhas são uso. A partir da terceira, a IA lê, busca, prepara, submete para aprovação e registra, e cada um desses verbos depende de algo que o modelo não entrega sozinho: acesso aos sistemas, permissões, regra de revisão e registro do que aconteceu.
Os 5 níveis de maturidade em IA
| Nível | Como a empresa está | Sinais observáveis |
|---|---|---|
| 1. Exploração | Pessoas usam IA por conta própria | Licenças avulsas, uso individual, nenhum processo depende da IA |
| 2. Experimentação | Casos de uso começam a aparecer | Pilotos com responsável, automações isoladas, resultado medido por impressão |
| 3. Operação | A IA entra em um processo real | Integração com sistemas, dono do processo, linha de base e métricas mensais |
| 4. Escala | Casos comprovados são replicados | Integrações, controles de acesso e testes reaproveitados entre processos |
| 5. Transformação | Processos são redesenhados considerando a IA | Papéis e etapas mudaram, e os indicadores do negócio refletem a mudança |
Os níveis são uma síntese nossa dos modelos do SEI, da Microsoft, do Gartner e da AWS. A correspondência está na nota de método, no fim do texto.
O salto mais difícil é do nível 2 para o 3. É onde o piloto ganha dono, integração e medida, e onde a maior parte dos projetos para.
Nenhuma empresa precisa levar todos os processos ao nível 5. Uma triagem de documentos com milhares de itens por mês justifica chegar à escala. Um relatório trimestral feito por duas pessoas talvez nunca precise passar da experimentação.
O nível 5 depende de redesenhar o trabalho, e há evidência de que é aí que o dinheiro aparece. A McKinsey testou 25 características organizacionais na pesquisa de março de 2025, e o redesenho dos fluxos de trabalho foi a que teve maior efeito sobre o impacto da IA generativa no resultado operacional. Só 21% das empresas tinham redesenhado de forma fundamental pelo menos alguns fluxos.
Diagnóstico de maturidade em 15 minutos
Uma empresa não está em um nível só. O modelo da Microsoft recomenda avaliar cada pilar separadamente, sem transformar o resultado em nota geral, e registrar só o que acontece de forma consistente. Exemplo isolado e intenção ficam de fora. O diagnóstico abaixo segue essa regra.
Como usar. Responda sim ou não para cada pergunta, com base no que existe hoje e pode ser mostrado. Em cada dimensão, comece no nível 1 e suba um nível a cada "sim", parando no primeiro "não". O nível 5 fica de fora, porque depende de redesenho de processo, que se avalia caso a caso.
1. Estratégia e valor
- N2: Existe uma lista de casos de uso de IA, com um responsável para cada um?
- N3: Cada caso em uso tem um objetivo de negócio e uma meta numérica aprovados pela diretoria?
- N4: Novos casos são priorizados por valor e viabilidade num ritual que se repete, como uma revisão trimestral?
2. Processo
- N2: Algum piloto de IA funciona com usuários reais, mesmo fora do sistema oficial?
- N3: Pelo menos um processo tem desenhado o que a IA faz, o que a pessoa faz e em que ordem?
- N4: Um segundo processo entrou em operação reaproveitando o desenho do primeiro?
3. Pessoas e responsabilidade
- N2: Alguém da área de negócio acompanha cada piloto?
- N3: Cada processo com IA tem um dono na área de negócio que responde pelo indicador, e os usuários foram treinados nele?
- N4: Existe um time ou papel fixo que ajuda novas áreas a colocar IA em operação?
4. Dados e tecnologia
- N2: O piloto trabalha com dados reais da empresa, mesmo que exportados à mão?
- N3: A solução lê e grava nos sistemas onde o trabalho acontece, respeitando as permissões de cada usuário?
- N4: Integrações, controle de acesso e registro de uso são compartilhados entre processos?
5. Governança e autoridade
- N2: Existe uma política sobre que dados podem ser enviados a ferramentas de IA?
- N3: Para cada processo, está escrito o que a IA faz sozinha, o que exige aprovação e quem pode desligá-la?
- N4: Toda ação da IA fica registrada e é revisada periodicamente por alguém de fora do time que a construiu?
6. Medição
- N2: Alguém juntou exemplos de acerto e de erro do piloto?
- N3: Existe linha de base do processo antes da IA e um conjunto de casos de teste com resposta conhecida?
- N4: Toda mudança no sistema passa pelos testes antes de chegar aos usuários, e os indicadores são revisados todo mês?
Como ler o resultado
Um perfil possível:
| Dimensão | Nível |
|---|---|
| Estratégia e valor | 3 |
| Processo | 2 |
| Pessoas e responsabilidade | 2 |
| Dados e tecnologia | 4 |
| Governança e autoridade | 3 |
| Medição | 1 |
A média daria 2,5 e não diria nada. O perfil diz que a empresa sabe construir e tem regras, mas não mudou processos e não consegue provar valor. O próximo investimento vai para dono de processo e linha de base, antes de qualquer tecnologia nova.
A regra geral: invista na dimensão mais baixa que impede o próximo processo de chegar ao nível 3. Nos diagnósticos que fazemos, costuma ser medição ou dono de processo.
Quanto a IA está autorizada a fazer
Jake Moffatt perguntou ao assistente virtual da Air Canada como funcionava a tarifa para viagem por luto. O assistente respondeu que ele poderia comprar a passagem e pedir o desconto depois. A política da empresa dizia o contrário. Quando o reembolso foi negado, a Air Canada argumentou no tribunal de disputas civis da Colúmbia Britânica que o assistente era uma entidade separada, responsável pelos próprios atos. O tribunal rejeitou o argumento em 2024: o assistente "ainda é só uma parte do site da Air Canada", e a empresa responde por tudo o que está no site. Ela teve de pagar a diferença da tarifa.
O valor foi pequeno, e a regra que saiu dali vale para qualquer empresa: quando a IA fala ou age em nome dela, a empresa responde. Por isso cada processo precisa de um nível de autoridade definido.
| Nível de autoridade | A IA pode | Exemplo |
|---|---|---|
| A0. Consultar | Responder perguntas e resumir | Resumo de um contrato para leitura do advogado |
| A1. Recomendar | Sugerir uma decisão, que a pessoa toma | Indicação de quais notas fiscais parecem divergentes |
| A2. Preparar | Deixar a ação pronta para alguém aprovar | Rascunho de resposta ao cliente, preenchido com dados do sistema |
| A3. Executar com aprovação | Executar depois de um clique de confirmação | Pedido de transferência entre lojas, liberado pelo comprador |
| A4. Executar dentro de limites | Executar sozinha, dentro de regras e valores definidos | Reclassificação de despesas abaixo de um valor, com registro |
Quando o sistema só recomenda, um erro custa o tempo de quem revisa. Quando executa, o erro vira um pedido errado, um pagamento indevido ou uma promessa ao cliente que a empresa terá de honrar.
As regras que usamos:
- Comece em A1 ou A2. Suba de nível quando os números mostrarem que o erro ficou raro e barato. A sensação de conforto da equipe costuma chegar antes dos números.
- Autoridade é por processo. A mesma empresa pode ter a IA executando sozinha a classificação de despesas pequenas e apenas preparando respostas a clientes.
- Escreva quem desliga. O NIST AI Risk Management Framework pede que os processos de supervisão humana sejam definidos, avaliados e documentados. Numa empresa média, isso cabe numa página por processo.
Como medir resultados de IA
Número de usuários ativos, de mensagens e de tokens consumidos mede consumo de IA. Token é a unidade em que os provedores de IA cobram pelo texto que o modelo lê e escreve, um pedaço de palavra. Ele explica a fatura e diz pouco sobre a qualidade do trabalho. A medição útil tem quatro camadas:
| Camada | Pergunta | Exemplos de indicador |
|---|---|---|
| Uso | Quem usa e com que frequência? | Usuários ativos, processos com IA, frequência de uso |
| Produção | Quanto trabalho saiu? | Tarefas concluídas, documentos processados, respostas geradas |
| Desempenho | O trabalho ficou melhor e mais barato? | Tempo por tarefa, custo por tarefa, taxa de aceitação, taxa de erro, retrabalho |
| Resultado | A empresa ganhou alguma coisa? | Prazo, custo operacional, receita, margem, conversão, risco |
Uso e produção mostram adoção. Valor só aparece em desempenho e resultado. O anúncio da Klarna em 2024 era forte em produção e velocidade, e a correção veio de desempenho.
Estas medidas costumam ser confundidas, e você precisa de todas:
- Teste de qualidade: a IA faz a tarefa certo? Hamel Husain e Shreya Shankar definem essas avaliações como a medida de se um sistema de IA funciona para seus usuários em tarefas e dados realistas. Exemplo: 94% de acerto em 300 casos com resposta conhecida.
- Indicador de operação: quanto custa e quanto demora? Exemplo: R$ 7,22 e menos de 8 minutos por tarefa aceita, somando a IA e a revisão.
- Indicador de negócio: o que mudou na empresa? Exemplo: o prazo de resposta ao cliente caiu de três dias para um.
Um sistema pode acertar 94% dos testes e não mudar nenhum indicador de negócio, porque entrou numa etapa que não era o gargalo.
Não pergunte, meça
Em um experimento controlado da METR em 2025, 16 desenvolvedores experientes previram que a IA os deixaria 24% mais rápidos. Depois do trabalho, acreditavam ter ganhado cerca de 20%. A medição mostrou que as tarefas com IA levaram 19% mais tempo. Uma nova rodada, em 2026, teve resultado misto, com viés de seleção reconhecido pelos autores. Nos dois casos, a percepção de quem usa não serviu como medida.
O efeito também muda com quem usa. No estudo de Brynjolfsson, Li e Raymond publicado pelo NBER, com 5.179 atendentes de suporte, a IA aumentou em 14% os problemas resolvidos por hora. Entre novatos, 34%. Entre os mais experientes, quase nada. A média de um estudo não prevê o ganho no seu processo, e só a medição dele responde.
Custo por tarefa aceita
Quando a IA passa a executar trabalho, a pergunta útil deixa de ser quanto custa o modelo. Passa a ser quanto custa produzir uma unidade de trabalho que a empresa pode aceitar.
Custo por tarefa aceita = (custo da IA + custo do tempo humano de conferência e correção) ÷ tarefas aceitas
Um exemplo com números
O exemplo é ilustrativo e serve para mostrar a conta.
Antes. Um analista leva 45 minutos por tarefa, com custo de R$ 80 por hora. Cada tarefa custa R$ 60. Em 1.000 tarefas por mês, são R$ 60.000.
Depois. A IA executa cada tarefa em 4 minutos, com custo mensal de R$ 2.300, ou R$ 2,30 por execução. É esse o número que costuma ir para a apresentação do projeto. A conta completa inclui as pessoas:
| Item | Cálculo | Custo mensal |
|---|---|---|
| IA (modelo, infraestrutura, manutenção) | 1.000 execuções | R$ 2.300 |
| Conferência das 870 tarefas aceitas de primeira (87%) | 2 min cada, 29 h | R$ 2.320 |
| Correção das 130 tarefas que voltaram (13%) | 15 min cada, 32,5 h | R$ 2.600 |
| Total para 1.000 tarefas aceitas | R$ 7.220 |
O custo por tarefa aceita é de R$ 7,22: três vezes o custo do modelo e 88% abaixo dos R$ 60 do processo anterior. O ganho é real, e o número que deve chegar à diretoria é R$ 7,22.
Agora o mesmo processo com um erro de desenho. A IA erra de forma imprevisível, ninguém sabe quais tarefas conferir, e a equipe passa a revisar tudo do zero: 45 minutos por tarefa, mais o custo da IA. São R$ 62.300 por mês, ou R$ 62,30 por tarefa aceita. A IA ficou mais cara que o processo antigo.
O que separa os dois cenários são os testes de qualidade, a regra de revisão e a confiança da equipe para conferir por amostragem. A empresa decide tudo isso sem trocar de modelo.
A planilha de nove campos
Para fazer a conta no seu processo, você precisa de nove números. A planilha para baixar já traz as fórmulas e os valores do exemplo acima. Troque pelos seus. A aba de registro conta, tarefa a tarefa, quantas foram aceitas, corrigidas ou refeitas, e entrega os campos 5, 7 e 9.
| Campo | Onde obter |
|---|---|
| 1. Tarefas por mês | Sistema ou controle da área |
| 2. Minutos por tarefa, antes da IA | Cronometragem de uma amostra de 30 a 50 tarefas |
| 3. Custo por hora da equipe | Salário com encargos, dividido pelas horas trabalhadas |
| 4. Custo mensal da IA | Fatura do modelo, infraestrutura e manutenção rateada |
| 5. % de tarefas aceitas de primeira | Registro de aceite na revisão |
| 6. Minutos de conferência por tarefa aceita | Cronometragem de uma amostra |
| 7. % de tarefas corrigidas | Registro de aceite na revisão |
| 8. Minutos de correção por tarefa | Cronometragem de uma amostra |
| 9. % de tarefas refeitas do zero | Registro de aceite na revisão |
Custo antes = campo 2 × campo 3 ÷ 60. Custo depois = campo 4 dividido pelas tarefas, mais o tempo de conferência, correção e refação convertido em reais. Os campos 5, 7 e 9 exigem uma coisa simples: registrar, para cada tarefa, se ela foi aceita, corrigida ou refeita.
Métricas para agentes de IA
Quando a IA executa tarefas, cinco taxas completam a conta:
| Métrica | Cálculo |
|---|---|
| Taxa de aceitação | resultados aceitos ÷ resultados gerados |
| Taxa de intervenção humana | tarefas que exigiram intervenção ÷ tarefas executadas |
| Taxa de conclusão autônoma | tarefas concluídas sem intervenção ÷ total de tarefas |
| Taxa de escalonamento | tarefas enviadas para uma pessoa decidir ÷ total |
| Taxa de retrabalho | tarefas corrigidas depois de concluídas ÷ tarefas concluídas |
A meta é o nível de autonomia que dá o menor custo por tarefa aceita dentro do risco que a empresa aceita correr. Em muitos processos, esse ponto fica em A2 ou A3.
Os erros que mais vemos
O SEI atribui boa parte das falhas de adoção a expectativas desalinhadas, aplicações mal escolhidas e implementação mal executada. Nos diagnósticos que fazemos, esses motivos aparecem com sintomas reconhecíveis:
| O que você vê | O que costuma faltar | O que fazer |
|---|---|---|
| A discussão é sobre qual IA contratar | Um processo escolhido | Escolha o processo primeiro e deixe o modelo para depois |
| O piloto "funcionou", mas ninguém sabe dizer quanto | Linha de base | Cronometre 30 a 50 tarefas do jeito atual antes de mudar qualquer coisa |
| O piloto funciona na demonstração e trava com arquivos reais | Acesso aos dados | Teste com o volume e a bagunça reais desde a primeira semana |
| As pessoas copiam a resposta da IA e colam em outro sistema | Integração | Faça a IA ler e gravar onde o trabalho acontece |
| Tecnologia construiu, negócio não assumiu | Dono do processo | Nomeie o dono na área de negócio antes de começar |
| A avaliação é "parece bom" | Casos de teste | Monte um conjunto de exemplos reais com a resposta certa conhecida |
| A equipe revisa tudo, ou não revisa nada | Regra de revisão | Defina o nível de autoridade e o que se confere por amostragem |
| O relatório mensal mostra acessos e mensagens | Medida de desempenho | Troque por custo por tarefa aceita e pelo indicador do processo |
O caso mais citado de agente sem limite aconteceu em julho de 2025. Jason Lemkin, fundador da SaaStr, testava o agente de programação da Replit na construção de um aplicativo. Com o projeto em congelamento de código, e depois de pedir onze vezes, em letras maiúsculas, que nada fosse alterado, ele viu o agente apagar o banco de dados de produção. O agente ainda afirmou que a restauração era impossível, e ela funcionou (The Register). O CEO da Replit, Amjad Masad, chamou o episódio de inaceitável e anunciou a separação automática entre o banco de desenvolvimento e o de produção (The Register).
A falha estava na autoridade. O agente executava comandos no ambiente real sem aprovação, o nível A4 da tabela de autoridade, sem os limites que esse nível exige. A instrução "não altere nada" era um pedido, e nenhuma regra do sistema a garantia. A Anthropic, que trabalhou com dezenas de times que constroem agentes, faz a mesma recomendação no guia sobre agentes: a autonomia aumenta o custo e o risco de erros que se acumulam, e por isso pede testes extensos em ambiente isolado, com as salvaguardas adequadas.
O primeiro processo em quatro semanas
Antes da semana 1: pergunte se o problema precisa de IA. O NIST lembra que um sistema de IA pode não ser a solução adequada para a tarefa. O Guia Unificado de Inteligência Artificial do governo federal começa por uma fase de prospecção, em que o desafio é identificado e priorizado antes de qualquer experimento. Às vezes uma regra simples ou uma integração entre sistemas resolve.
Semana 1. Escolha e meça. Escolha um processo com volume alto, regras conhecidas e um dono na área de negócio. Cronometre de 30 a 50 tarefas do jeito atual e registre volume, tempo, custo e taxa de erro. Escreva a meta e o critério de desligar, por exemplo: "se o custo por tarefa aceita não ficar abaixo de metade do atual, paramos".
Semana 2. Defina autoridade e testes. Decida o nível de autoridade inicial (A1 ou A2), quem revisa e o que conta como tarefa aceita. Separe de 50 a 100 casos reais com a resposta certa conhecida. Toda mudança no sistema passa por eles antes de chegar aos usuários.
Semana 3. Coloque no fluxo. A solução lê e grava nos sistemas onde o trabalho acontece. Nas primeiras semanas, revise 100% das saídas e registre cada uma como aceita, corrigida ou refeita. Cada erro encontrado vira um novo caso de teste.
Semana 4. Faça a conta e decida. Preencha a planilha de nove campos e compare com a linha de base. As decisões possíveis são ampliar (mais volume, menos revisão ou mais autoridade), ajustar (voltar à semana 2 com os erros mapeados) ou desligar, se o critério da semana 1 não foi atingido.
Desligar um projeto que não passou no critério também é resultado: em quatro semanas você sabe que aquele processo não compensa. Sem o critério escrito, a mesma descoberta costuma levar um ano e aparecer numa reunião de diretoria.
Esse ciclo de planejar, executar, verificar e corrigir é o mesmo que a ISO/IEC 42001, norma de sistema de gestão de IA, adota como melhoria contínua.
Para onde ir depois
O SEI, no modelo de maturidade publicado com a Accenture em 2026, define maturidade em IA como a capacidade de construir sistemas confiáveis e resilientes, com prática rigorosa de engenharia e governança ligada a resultados de negócio.
Faça o diagnóstico com sua diretoria, escolha um processo e faça a conta na planilha. Se quiser ajuda no primeiro processo, o Catech Forward coloca engenheiros dentro da sua operação, com linha de base, testes e custo por tarefa aceita desde a primeira semana.
Nota de método
Os cinco níveis e as seis dimensões são uma síntese da CatechLabs. O SEI usa oito dimensões e a Microsoft, cinco pilares. Condensamos essas estruturas para caber num diagnóstico de diretoria de uma empresa média. A correspondência entre os níveis é aproximada, porque cada modelo mede coisas um pouco diferentes:
| Nível CatechLabs | SEI / Accenture (2026) | Microsoft (2026) | Gartner | AWS |
|---|---|---|---|---|
| Exploração | Exploratory | 100 Initial | Awareness | Envision |
| Experimentação | Implemented | 200 Repeatable | Active | Experiment |
| Operação | Aligned | 300 Defined | Operational | Launch |
| Escala | Scaled | 400 Capable | Systemic | Scale |
| Transformação | Future-Ready AI | 500 Efficient | Transformational | (não tem) |
Os níveis de autoridade (A0 a A4), a planilha de nove campos e o plano de quatro semanas vêm da nossa prática. Os números de referência (amostras de 30 a 50 tarefas, 50 a 100 casos de teste) são pontos de partida práticos, sem base estatística.
Referências
Carnegie Mellon SEI e Accenture, AI Adoption Maturity Model v1.0 (2026)
Modelo em cinco níveis e oito dimensões, voltado a levar organizações da experimentação a resultados previsíveis.
Microsoft, Agentic AI Adoption Maturity Model (2026)
Cinco níveis e cinco pilares, com orientação para avaliar cada pilar separadamente e com base em evidência.
Gartner, AI Maturity Model Toolkit
Escala de cinco níveis, de Awareness a Transformational.
AWS, Generative AI Maturity Model
Quatro níveis (Envision, Experiment, Launch, Scale) avaliados por aspecto.
NIST, AI Risk Management Framework 1.0 (2023)
Gestão de risco de IA em quatro funções: governar, mapear, medir e gerenciar.
ISO/IEC 42001:2023 e 23894:2023
Sistema de gestão de IA e orientação para gestão de risco de IA.
Secretaria de Governo Digital, Guia Unificado de Inteligência Artificial para o Setor Público
Ciclo de projetos de IA em sete fases, da prospecção à desativação.
OCDE, BCG e INSEAD, The Adoption of Artificial Intelligence in Firms (2025)
Pesquisa com empresas do G7 e do Brasil sobre adoção de IA e barreiras, incluindo a incerteza sobre retorno.
Stanford HAI, AI Index 2026, capítulo de economia
Dados de adoção de IA, IA generativa e agentes nas organizações.
McKinsey, The state of AI: How organizations are rewiring to capture value (2025) e The state of AI in 2025
Redesenho de fluxos de trabalho como a característica mais associada ao impacto financeiro, e dados sobre agentes em escala.
Brynjolfsson, Li e Raymond, Generative AI at Work, NBER e Quarterly Journal of Economics
Efeito causal da assistência de IA na produtividade de 5.179 atendentes de suporte.
METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity (2025) e atualização (2026)
Experimento controlado em que a percepção de ganho divergiu do desempenho medido.
Hamel Husain e Shreya Shankar, LLM Evals FAQ
Referência prática sobre como testar a qualidade de sistemas de IA.
Anthropic, Building effective agents (2024)
Recomendações de quem construiu agentes com dezenas de times: começar pela solução mais simples, testar em ambiente isolado e definir salvaguardas.
The Register, Vibe coding service Replit deleted user's production database e Replit makes vibe-y promise to stop its AI agents making vibe coding disasters (2025)
O incidente em que um agente apagou um banco de produção durante um congelamento de código, e a resposta da Replit.
Klarna, Klarna AI assistant handles two-thirds of customer service chats in its first month (2024), e Bloomberg, Klarna Turns From AI to Real Person Customer Service (2025)
O anúncio dos resultados do assistente e a revisão posterior da estratégia pela própria empresa.
Civil Resolution Tribunal da Colúmbia Britânica, Moffatt v. Air Canada, 2024 BCCRT 149
Decisão que responsabilizou a empresa pela informação errada dada por seu assistente virtual.
Perguntas frequentes
- Como implementar IA em uma empresa?
- Escolha um processo com volume, dono e custo conhecido. Meça como ele funciona hoje, defina o que a IA pode fazer sozinha e o que precisa de aprovação, coloque a solução dentro do fluxo de trabalho real e compare o antes e o depois com os mesmos indicadores. Distribuir licenças é o começo do uso. A implementação começa quando um processo muda e a mudança pode ser medida.
- Por onde começar um projeto de IA?
- Pelo processo. A escolha do modelo vem depois. O melhor primeiro caso tem volume alto, regras conhecidas, um responsável claro e um custo atual que alguém já sabe calcular. Antes de construir, vale perguntar se o problema precisa de IA: o NIST lembra que um sistema de IA pode não ser a solução adequada para a tarefa.
- O que é maturidade em IA?
- É a capacidade de uma organização transformar inteligência artificial em resultado de negócio de forma repetível, mensurável e controlada. Depende de estratégia, processos, pessoas, dados e tecnologia, governança e medição. A quantidade de ferramentas contratadas diz pouco sobre ela.
- Quais são os níveis de maturidade em IA?
- Cinco: exploração (uso individual), experimentação (pilotos isolados), operação (IA dentro de um processo real, com dono e métricas), escala (casos comprovados replicados sobre uma base comum) e transformação (processos redesenhados considerando o que pessoas, software e IA fazem melhor). A avaliação deve ser feita por dimensão, sem uma nota única para a empresa.
- Como medir o ROI da IA?
- Compare o custo total por tarefa aceita com o custo da mesma tarefa antes da IA. O custo total inclui o modelo, a infraestrutura, a manutenção e o tempo das pessoas que revisam e corrigem o resultado. Depois, verifique se a economia ou a capacidade liberada apareceu em um indicador de negócio, como prazo, margem, receita ou risco.
- Quais KPIs usar para inteligência artificial?
- Organize em quatro camadas: uso (quem usa e com que frequência), produção (quantas tarefas foram concluídas), desempenho (tempo, custo, taxa de aceitação e retrabalho por tarefa) e resultado (prazo, custo operacional, receita, margem, risco). Uso e produção indicam adoção. Só desempenho e resultado indicam valor.
- Como saber se uma empresa está pronta para agentes de IA?
- Um agente executa ações, então a pergunta é se a empresa consegue dizer o que ele pode fazer, conferir o que ele fez e parar quando errar. Isso exige um processo documentado, acesso controlado aos sistemas, um conjunto de casos de teste com resposta conhecida, um responsável pelo resultado e uma linha de base para comparar.
- Como escalar um piloto de IA para produção?
- Um piloto vira operação quando recebe dono, integração com os sistemas onde o trabalho acontece, regras de revisão humana, testes de qualidade repetidos a cada mudança e métricas acompanhadas todo mês. Escalar é repetir isso em outros processos reaproveitando o que já foi construído: integrações, controles de acesso, testes e painéis.