Cálculo feito por IA: quando confiar no relatório
Como saber se o número que a IA entregou foi calculado ou chutado: o que exigir de rastro, o que as normas do CFC já cobram e como testar antes de assinar.

Um cálculo feito por IA é confiável quando dá para refazer o caminho do número — e não quando o modelo é mais novo. Um modelo de linguagem (o sistema que gera texto prevendo a palavra mais provável) não é uma calculadora: quando está incerto, chuta um número plausível em vez de dizer que não sabe. O que torna confiável um relatório gerado por IA é arquitetura: cálculo executado por código determinístico (o mesmo dado sempre produz o mesmo resultado), dados normalizados na entrada, rastro de cada número até o documento de origem e revisão de um contador.
Por isso a pergunta útil não é “posso confiar na IA?”, e sim “esse relatório me deixa refazer o caminho do número?”. Se você consegue pegar um valor, ver a fórmula, ver as contas que entraram nela e chegar ao documento que originou cada saldo, você tem o que revisar e assinar. Se não consegue, o número é só uma frase bem escrita.
Por que a IA erra a conta?
O mecanismo tem estudo. Em Why Language Models Hallucinate (arXiv:2509.04664, de 4 de setembro de 2025), Kalai, Nachum, Vempala e Zhang resumem assim: “Como estudantes diante de questões difíceis de prova, grandes modelos de linguagem às vezes chutam quando estão incertos, produzindo afirmações plausíveis porém incorretas em vez de admitir incerteza.” Para os autores, isso acontece porque treinamento e avaliação recompensam o chute em vez do reconhecimento da incerteza.
Repare no detalhe que importa para você: o erro sai plausível, sem asterisco e sem aviso. Uma margem de 18,4% inventada tem a mesma cara de uma margem de 18,4% calculada.
Um estudo de 13 de agosto de 2025 (arXiv:2508.09932) analisou erros em aritmética, álgebra e teoria dos números e concluiu que os erros procedimentais — errar um passo da execução — foram mais frequentes e mais impactantes que os conceituais. Ou seja: o modelo costuma saber a fórmula da liquidez corrente. O risco está em ele executar a divisão.
O que muda quando o cálculo sai do modelo e vai para o código?
Há evidência direta de que o problema é arquitetural, e não questão de esperar o próximo modelo. Um estudo de cálculos clínicos publicado na npj Digital Medicine em 17 de março de 2025 (Goodell et al., DOI 10.1038/s41746-025-01475-8) testou modelos com e sem acesso a uma ferramenta de cálculo dedicada. Na análise focada, com 10.000 ensaios, o GPT-4o acertou 36,1% na configuração base e 95,2% com a calculadora acoplada; o LLaMa-3.1-70b foi de 11,4% para 84,0%. A redução de erro foi de 13 vezes e de 5,5 vezes. Na análise exploratória, com 42 calculadoras, as respostas foram incorretas em um terço dos ensaios (n=212).
Dois avisos. O domínio é clínico, não contábil: não existe benchmark público equivalente para cálculo contábil ou tributário brasileiro, então não transponha os percentuais. O que se transpõe é o mecanismo: o ganho não veio de um modelo mais esperto, e sim de tirar a conta do modelo e entregá-la a uma calculadora determinística.
Na sua realidade: numa ferramenta bem construída, a IA decide que precisa da liquidez corrente e identifica quais contas entram; quem divide ativo circulante por passivo circulante é o código; o modelo só lê o resultado e escreve o comentário. É também por isso que separar o trabalho em etapas ajuda — a lógica de encadear agentes especializados está em agentes de IA na análise contábil. Com as etapas separadas, você sabe em qual delas procurar o erro.
A contabilidade brasileira já exige rastrear o número até o documento
Você não precisa de uma norma sobre IA para exigir rastreabilidade: a exigência já existe e é anterior a essa discussão. A ITG 2000 (R1), publicada pelo CFC em 2011 e com a redação consolidada em 5 de dezembro de 2014, diz no item 1 que se aplica à escrituração feita “por meio de qualquer processo” — não distingue planilha, ERP ou inteligência artificial. E o que ela cobra é o rastro:
- Item 5(e): a escrituração se faz “com base em documentos de origem externa ou interna ou, na sua falta, em elementos que comprovem ou evidenciem fatos contábeis”.
- Item 6(f): o registro deve conter “informação que permita identificar, de forma unívoca, todos os registros que integram um mesmo lançamento contábil”.
- Item 14: no Livro Diário, os lançamentos entram “com individualização, clareza e referência ao documento probante”.
- Item 32: na retificação, “o histórico do lançamento deve precisar o motivo da retificação, a data e a localização do lançamento de origem”.
O item 32 é o mais revelador: a norma já exige rastro de correção. Ferramenta que recalcula em silêncio e entrega um número diferente do de ontem, sem registrar o que mudou e por quê, contraria essa lógica — mesmo sem norma citar IA.
A régua do “auditor experiente”
Para saber se o rastro é suficiente, tome emprestada uma régua da auditoria. É analogia declarada: a NBC TA 230 (R1) rege auditoria independente, não escrituração nem relatório gerencial. Mas o critério do item 8 serve. Ele exige documentação que permita “que um auditor experiente, sem nenhum envolvimento anterior com a auditoria, entenda: (a) a natureza, época e extensão dos procedimentos; (b) os resultados e a evidência obtida; e (c) assuntos significativos identificados, as conclusões obtidas e os julgamentos profissionais significativos”.
Aplique ao relatório que a IA gerou: um colega contador que nunca viu esse cliente entende como cada número foi obtido e por que a conclusão é aquela? Se ele precisa perguntar “de onde saíram esses 18,4%?”, o problema é seu, não do fornecedor. A NBC TA 315 (R2), item A137 (também norma de auditoria), descreve o mesmo caminho: rastrear lançamentos “desde a iniciação nos registros contábeis até o registro no razão geral”.
A assinatura é sua, e ela não se delega a software
A pesquisa da IOB com o CFC e a Fenacon, divulgada em 3 de setembro de 2026, ouviu 393 profissionais: 78% usam ferramentas de IA no trabalho ao menos uma vez por semana e 53% dos usuários, diariamente; só 2% veem a tecnologia como ameaça ao trabalho humano e 42% acham que ela será revolucionária. Uso alto e confiança alta pedem contrapeso.
A ITG 2000 (R1), item 12, é direta: a emissão de “relatórios, peças, análises, demonstrativos e demonstrações contábeis” é de “atribuição e de responsabilidade exclusivas do profissional da contabilidade legalmente habilitado”.
O Código de Ética fecha o cerco. A NBC PG 01, em vigor desde 1º de junho de 2019, manda no item 4(j) “despender os esforços necessários e se munir de documentos e informações para inteirar-se de todas as circunstâncias, antes de emitir opinião sobre qualquer caso”. O item 5(c) veda “assinar documentos ou peças contábeis elaborados por outrem alheio à sua orientação, supervisão ou revisão”, e o 5(w) veda atuar “com negligência, imperícia ou imprudência”.
O item 6(c) serve como analogia: permite “transferir, parcialmente, a execução dos serviços a seu cargo a outro profissional, mantendo sempre como sua a responsabilidade técnica”. A norma fala em outro profissional, não em ferramenta. Mas a lógica se aplica: delegar execução nunca delegou responsabilidade. Com software, menos ainda, porque software não tem registro no CRC.
Afaste também um mal-entendido comum: a LGPD não obriga revisão humana. O art. 20 da Lei 13.709/2018 (LGPD) garante ao titular pedir revisão de decisão automatizada e, no § 1º, obriga o controlador a dar “informações claras e adequadas a respeito dos critérios e dos procedimentos utilizados” — a expressão “por pessoa natural” saiu do caput pela Lei 13.853/2019 e o § 3º foi vetado. É explicabilidade, não revisão. O dever de revisar vem da ITG 2000 e da NBC PG 01.
O que a LGPD acrescenta ao cálculo é o art. 6º, V, o princípio da qualidade dos dados: “exatidão, clareza, relevância e atualização dos dados”. É a versão jurídica do que o presidente do CFC, Joaquim de Alencar Bezerra Filho, disse ao comentar a pesquisa: “Algoritmos sofisticados continuarão produzindo decisões equivocadas quando alimentados por dados ruins.” Dado sujo entra, número errado sai — com gráfico bonito.
Como testar um relatório gerado por IA em 15 minutos
Não é preciso auditar a ferramenta inteira. Escolha um relatório e faça estes seis testes.
| # | Teste | O que fazer | Sinal de alerta |
|---|---|---|---|
| 1 | Reprodução | Pegue três números e refaça a conta na planilha | Diferença que ninguém explica |
| 2 | Repetição | Peça o mesmo cálculo de novo, com o mesmo arquivo | O valor muda sem o dado ter mudado |
| 3 | Origem | Para cada número, chegue à conta e ao documento que o originou | Só chega ao relatório, não ao lançamento |
| 4 | Fórmula | Peça a fórmula usada e os valores de entrada | Resposta genérica, sem os valores |
| 5 | Classificação | Confira como as contas foram agrupadas na normalização | Conta relevante no grupo errado |
| 6 | Correção | Corrija um dado de entrada e veja se fica registrado o que mudou | Recalcula em silêncio, sem histórico |
O teste 5 é sobre a normalização — o passo que traduz o plano de contas do cliente para um padrão comum antes de qualquer cálculo — e costuma achar mais erro do que os outros juntos. Erro de classificação não parece erro: vira um indicador bem formatado e completamente errado. Um empréstimo de longo prazo classificado como circulante derruba a liquidez corrente sem nenhum sintoma no gráfico. O método de leitura que sustenta essa conferência está em como transformar DRE e balancete em diagnóstico financeiro, e os indicadores que mais pedem atenção mensal, em 4 indicadores financeiros que todo empresário deve ler.
A parte cansativa é o teste 5 feito à mão, cliente por cliente, em planos de contas diferentes. O Lucrro separa a análise em agentes de IA por etapa — normalização das contas, cálculo dos indicadores, montagem do relatório e recomendação —, recebe DRE, balancete e fluxo de caixa em CSV, XLS ou XLSX em leiautes variados e devolve dashboards com textos explicativos, sugestões e alertas. Com as etapas separadas, você sabe em qual delas conferir cada coisa; a revisão e a assinatura continuam suas.
O que exigir do fornecedor antes de contratar?
O PL 2338/2023, o marco legal da IA, foi aprovado no Senado em dezembro de 2024 e remetido à Câmara pelo Ofício 235/2025 do Senado Federal, recebido em 17 de março de 2025. O relator, deputado Aguinaldo Ribeiro, foi designado em 20 de maio de 2025. Em 22 de setembro de 2026, o projeto aguarda parecer do relator na Comissão Especial e não está em vigor. Se virar lei, o art. 80 prevê vacatio de 730 dias.
Mesmo assim, o texto é um bom roteiro de compra. Entre os princípios do art. 3º estão “supervisão e determinação humana efetiva e adequada no ciclo de vida da IA” (III), “transparência e explicabilidade” (VI), “diligência devida e auditabilidade” (VII) e “confiabilidade e robustez” (VIII). E o art. 18, I, descreve o que o aplicador de sistema de alto risco deveria manter: documentação de todas as etapas do ciclo de vida, processos que permitam avaliar acurácia e robustez, documentação de testes de confiabilidade e segurança e do grau de supervisão humana, e informações que permitam interpretar os resultados.
Vire isso em perguntas para a reunião comercial:
- O cálculo é executado por código ou gerado pelo modelo? Peça para ver. É a pergunta que separa arquitetura de discurso.
- O relatório mostra a fórmula e os valores de entrada de cada indicador?
- Dá para chegar do número à conta e da conta ao documento de origem?
- O mesmo arquivo produz sempre o mesmo resultado?
- Correções ficam registradas, com o que mudou e quando?
- Que testes de acurácia vocês fazem e o que documentam deles?
- Onde e como o dado do meu cliente é processado e guardado?
Nenhuma delas é exigência legal hoje. Todas são exigência comercial inteligente e antecipam a regra que provavelmente virá. Quem responde com evidência tem arquitetura; quem responde com adjetivo tem folheto. E essa conversa é parte do serviço que você vende: explicar por que o número é confiável está na mesma prateleira de cobrar por consultoria financeira.
Em resumo
Modelo de linguagem não é calculadora e chuta quando está incerto. O que torna cálculo e relatório de IA confiáveis é arquitetura: conta executada por código determinístico, dados normalizados na entrada, rastro do número até o documento e revisão do contador. A exigência de rastreabilidade não é nova nem depende de norma sobre IA: a ITG 2000 (R1) já a impõe a qualquer processo de escrituração, e a responsabilidade pelo relatório é exclusiva do profissional habilitado (item 12), reforçada pela NBC PG 01, item 5(c). Se o fornecedor não deixa você refazer o caminho do número, a ferramenta não serve para assinar.
Fontes
- Goodell et al. — Large language model agents can use tools to perform clinical calculations (npj Digital Medicine, 17/03/2025)
- Kalai, Nachum, Vempala, Zhang — Why Language Models Hallucinate (arXiv:2509.04664, 04/09/2025)
- Análise de erros de raciocínio matemático em modelos de linguagem (arXiv:2508.09932, 13/08/2025)
- ITG 2000 (R1) — Escrituração Contábil — CFC
- NBC PG 01 — Código de Ética Profissional do Contador — CFC
- NBC TA 230 (R1) — Documentação de Auditoria — CFC
- NBC TA 315 (R2) — Identificação e Avaliação dos Riscos de Distorção Relevante — CFC
- PL 2338/2023 (marco legal da IA), ficha de tramitação — Câmara dos Deputados
- PL 2338/2023 — texto remetido à Câmara dos Deputados
- Lei nº 13.709/2018 (LGPD), texto compilado — Planalto
- Pesquisa mostra avanço da inteligência artificial na rotina dos profissionais da contabilidade — CFC
Perguntas frequentes
+ − A IA pode errar uma conta simples?
Pode. Modelo de linguagem não é calculadora: ele prevê o texto mais provável. O estudo de Kalai, Nachum, Vempala e Zhang (arXiv:2509.04664, de 4 de setembro de 2025) mostra que os modelos tendem a chutar quando estão incertos, porque treinamento e avaliação recompensam o chute em vez do reconhecimento da incerteza. Em um estudo de cálculos clínicos publicado na npj Digital Medicine em 17 de março de 2025, o acerto do GPT-4o subiu de 36,1% para 95,2% quando o modelo passou a usar uma ferramenta de cálculo dedicada.
+ − Se o número saiu errado, de quem é a culpa?
Sua, perante o cliente e o Conselho. A ITG 2000 (R1), item 12, diz que a emissão de relatórios, análises, demonstrativos e demonstrações contábeis é de atribuição e responsabilidade exclusivas do profissional habilitado. A NBC PG 01, item 5(c), proíbe assinar peça elaborada fora da sua orientação, supervisão ou revisão. Não há como transferir essa responsabilidade a um software.
+ − O CFC já regulamentou o uso de IA?
Até 22 de setembro de 2026, não foi localizada norma, resolução ou orientação técnica do CFC específica sobre o uso de inteligência artificial pelo contador. Valem as regras gerais: ITG 2000 (R1) para escrituração e relatórios e NBC PG 01 para conduta. O marco legal da IA (PL 2338/2023) aguarda parecer do relator na Comissão Especial da Câmara e não está em vigor.
+ − Como sei se a ferramenta calcula de verdade ou só escreve o número?
Faça o teste da reprodução: peça a fórmula usada, os valores de entrada e a conta de origem de cada valor, e refaça o cálculo por fora. Depois repita a mesma pergunta em outro momento. Se o resultado oscilar sem que o dado tenha mudado, o número está sendo gerado como texto, não calculado por código.
+ − Preciso revisar tudo o que a IA gera?
Você precisa revisar tudo o que sai com o seu nome. A NBC PG 01, item 4(j), manda se munir de documentos e informações para inteirar-se de todas as circunstâncias antes de emitir opinião sobre qualquer caso. Na prática, priorize o que muda decisão: números que sustentam recomendação ao cliente, variações fora do padrão e qualquer valor que você não consiga rastrear até um documento.
Publicado em 22 de setembro de 2026 e revisado em 22 de setembro de 2026.