Blog
prova por iaadmissibilidade probatóriainteligência artificial no direitoevidência digitalcaso puloka

Prova produzida por IA: o roteiro que o magistrado (e o engenheiro) precisam conhecer

Como a justiça avalia evidências geradas por IA? Análise do caso Puloka, admissibilidade probatória, impactos para produtos digitais e roteiro para magistrados

Autor

Alexandre Satochi Yamamoto

12 de setembro de 2026
8 min de leitura
Prova produzida por IA: o roteiro que o magistrado (e o engenheiro) precisam conhecer

Quando a defesa de Joshua Puloka apresentou o vídeo gravado por uma testemunha durante o tiroteio de 2021, o tribunal se viu diante de uma questão que mistura direito processual, tecnologia de imagem e uma pitada de filosofia da percepção. As imagens, capturadas em baixa resolução, passaram por um processo de aprimoramento assistido por inteligência artificial antes de se tornarem utilizáveis para o julgamento. Em poucos minutos, o caso saiu do âmbito criminal e entrou no território espinhoso da admissibilidade probatória em uma era de deepfakes, alucinações e reconstruções generativas.

O caso não é isolado. Gabinetes de juízes em todo o mundo vêm recebendo, com frequência crescente, evidências que passaram por algum tipo de processamento algorítmico — seja um upscaling de resolução, seja uma reconstrução 3D de uma cena de acidente, seja uma transcrição gerada por modelo de linguagem. A pergunta central não é mais "a IA produz prova?", mas sim "confiamos no processo que gerou essa prova?". Essa mudança de perspectiva é o que separa a maturidade técnica da simples adoção entusiasta de ferramentas.

O problema não é a IA, é o processo invisível

O que torna o caso Puloka emblemático não é o fato de um réu ter usado IA para melhorar uma gravação. É o fato de que o tribunal precisou estabelecer um roteiro de análise para algo que os peritos e engenheiros já sabiam há anos: o maior risco de uma evidência processada por IA não está na intenção deliberada de manipular, mas na impossibilidade de auditar cada etapa da transformação.

Do ponto de vista técnico, qualquer pipeline de aprimoramento de imagem envolve decisões que raramente são documentadas — qual modelo foi usado, com quais pesos, em qual versão, com quais hiperparâmetros, sobre qual recorte da imagem original. Um engenheiro de software sabe que o mesmo vídeo processado por dois modelos de upscaling diferentes produzirá resultados distintos, e que até mesmo o mesmo modelo em versões diferentes pode entregar variações perceptíveis. Para o magistrado, porém, essa distinção é muitas vezes invisível: a imagem chega pronta, com uma aparência de objetividade que a tornam até mais convincente que o original sem tratamento.

Aqui surge um paradoxo que eu observo com frequência no desenvolvimento de produtos que envolvem IA: a sofisticação do algoritmo cria uma ilusão de precisão que supera a confiança depositada em processos tradicionais e auditáveis. Uma foto original, com ruído e granulação, é "imperfeita", mas sua imperfeição é reconhecível. Uma imagem reconstruída por IA pode parecer cristalina, mas carrega uma cadeia de inferências estatísticas que não correspondem necessariamente à realidade do que foi capturado.

O roteiro do magistrado como um teste de qualidade de software

O roteiro proposto pela doutrina para que o juiz avalie a admissibilidade da prova por IA — e que orientou o caso Puloka — lembra, em sua estrutura, os critérios de aceitação de um pipeline de dados em uma aplicação crítica. Não é uma coincidência. Já trabalhei em sistemas de processamento de documentos com exigência de auditabilidade em setores regulados, e as preocupações são as mesmas: de onde veio o dado, por quais transformações passou, qual é o nível de confiança em cada etapa e como provar que não houve adulteração no caminho.

Os elementos que o magistrado deve verificar incluem, em linhas gerais, a origem do material original, a rastreabilidade das etapas de processamento, a identificação do software e da versão utilizada, a presença de intervenção humana no processo e a possibilidade de reprodução do mesmo resultado por um perito independente. Como profissional de tecnologia, leio essa lista como um conjunto de requisitos funcionais de um sistema de evidências digitais — e minha avaliação é que a maioria dos produtos de IA disponíveis no mercado não foi desenhada para atender a esses requisitos.

Considere, por exemplo, o critério de reprodutibilidade. No desenvolvimento de software, um teste que falha de forma intermitente é tratado como um bug crítico. Em ferramentas de IA generativa, porém, não há sequer a garantia de que o mesmo input produzirá o mesmo output — a temperatura do modelo, a aleatoriedade do sampling e até a ordem de execução em lote podem gerar variações. Para uma prova criminal, essa instabilidade não é um detalhe técnico: é uma fratura na confiabilidade de qualquer conclusão baseada nesse resultado.

Regras de admissibilidade e o risco da caixa-preta

A discussão sobre admissibilidade da prova produzida por IA remete a um princípio processual fundamental: o direito de contraditório e ampla defesa. Se a defesa não consegue compreender como a evidência foi gerada, ela não consegue testar sua validade — e aí temos uma assimetria que compromete o julgamento em sua base. É o equivalente jurídico do problema da explicabilidade em modelos de aprendizado de máquina, que enfrentamos quando um algoritmo toma decisões que impactam vidas.

Talvez o ponto mais sensível do debate seja a distinção entre prova que a IA *produz* — como uma análise preditiva de comportamento ou uma reconstrução de um rosto — e prova que a IA *aperfeiçoa*, como no caso do vídeo de Puloka. No primeiro cenário, a IA está criando informação nova a partir de padrões estatísticos; no segundo, está tentando aproximar a evidência de uma realidade que existiu no momento da captura. São problemas epistemológicos diferentes, com riscos diferentes e com níveis de aceitação judicial potencialmente distintos.

Para um magistrado, o viés de confirmação é um risco real: uma imagem aprimorada que parece mostrar um rosto ou uma placa de veículo pode ser mais convincente do que ela deveria ser, não porque o modelo inventou aquilo, mas porque o cérebro humano é predisposto a completar padrões ambíguos. A IA não precisa alucinar para enganar; ela precisa apenas gerar uma imagem suficientemente plausível para que nossa cognição assuma o restante. Esse é um ponto que engenheiros de produto conhecem bem: quando você adiciona um recurso de "auto-correção" a uma interface, os usuários passam a confiar demais no que veem, delegando sua própria criticidade ao sistema.

Implicações práticas para o desenvolvimento de produtos com IA

Se você trabalha com produtos digitais — e eu imagino que sim, já que está lendo este texto — o caso Puloka oferece uma lição que transcende o ambiente forense. Toda aplicação que gera, transforma ou apresenta informação para tomada de decisão deveria incorporar mecanismos de auditabilidade desde o início do desenvolvimento. Não como uma camada de compliance adicionada ao final, mas como requisito arquitetural.

Ao projetar um sistema que envolve IA e decisões relevantes, questione-se sobre o nível de transparência que sua ferramenta oferece. O usuário pode entender como o resultado foi gerado? O processo é repetível? Existe a possibilidade de se obter o mesmo resultado em condições controladas? Essas perguntas, formuladas no contexto judicial pelo roteiro do magistrado, são as mesmas que separam produtos de IA maduros de protótipos sofisticados.

A prática de versionar não apenas o código, mas também os pesos dos modelos, os datasets e as configurações de execução, é uma decisão técnica que pode ter implicações jurídicas profundas. Empresas que não mantêm esses registros estão, na prática, produzindo informação sem procedência — e isso vale tanto para um relatório gerencial quanto para uma evidência em um processo criminal.

Roteiro para equipes técnicas: como se preparar

Não é preciso aguardar um processo judicial para implementar boas práticas de rastreabilidade. Equipes de engenharia podem (e deveriam) adotar padrões de registro de experimentos, documentação de pipelines e testes de consistência mesmo quando o produto não tem finalidade probatória. A diferença é que, em contextos críticos, essas boas práticas passam de recomendação para exigência legal.

Recomendo, como ponto de partida, a criação de um manifesto de rastreabilidade por produto, que documente: (1) a origem dos dados de treinamento e inferência, (2) as transformações aplicadas, (3) o modelo e versão utilizados, (4) os parâmetros de execução e (5) a responsável pela aprovação de cada etapa. Esse documento, mantido em versionamento, é o equivalente técnico do laudo pericial — e pode ser o elemento que torna sua ferramenta admissível em um ambiente que exige confiança.

Há, ainda, a questão da preservação de evidências. É necessário garantir a integridade do material original e sua distinção clara em relação às versões processadas. Técnicas de hash e assinatura digital já são amplamente utilizadas para esse fim, mas frequentemente negligenciadas em produtos que não se enxergam como "forenses". O custo de implementar esse tipo de mecanismo é baixo; o custo de não tê-lo quando surge uma disputa pode ser altíssimo.

Limitações e desafios que a tecnologia ainda não resolve

É importante reconhecer, com honestidade, que nem todos os problemas levantados pelo caso Puloka têm solução técnica imediata. A explicação completa de modelos de aprendizado profundo permanece um desafio em aberto. Nenhum framework de explicabilidade é capaz de traduzir, de forma integralmente compreensível, as milhões de operações internas que resultaram em uma reconstrução de imagem.

A pergunta que segue sem resposta definitiva é: até que ponto a confiança na prova processada por IA deve se basear na possibilidade de compreensão, e até que ponto ela pode se apoiar na confiabilidade do processo? Se confiássemos apenas na explicação completa, nenhum laudo médico ou análise laboratorial seria admissível — ninguém explica integralmente como um exame de ressonância magnética funciona, e ainda assim confiamos nele. A diferença é que a tecnologia de imagem médica passou por décadas de validação empírica e padronização, algo que ainda está por se consolidar no campo da IA generativa.

Não estou advogando por uma posição de ceticismo total, mas sim de rigor proporcional ao risco. Uma IA que sugere um e-mail de resposta automática não exige o mesmo nível de escrutínio que uma IA que contribui para uma condenação criminal. O desafio dos próximos anos será calibrar esses níveis de exigência de forma gradual, adaptativa e baseada em evidências de confiabilidade real, não em percepções de sofisticação tecnológica.

O caso Puloka representa o fim de um período de inocência tecnológica em que acreditávamos que o processamento por computador era, por definição, mais confiável que a intervenção humana. A verdade, demonstrada cotidianamente aos engenheiros de software, é que algoritmos são sistemas de crenças formalizadas — e crenças podem ser errôneas, enviesadas ou simplesmente incompletas. A pergunta que juízes, engenheiros e produtos precisam responder já não é se confiamos na IA, mas se confiamos nos processos humanos que a projetaram, treinaram, calibraram e supervisionaram. Essa é uma pergunta que nenhum modelo, por mais sofisticado, pode responder sozinho.