IA que explica segura cerca de 0,27 desvio-padrão na prova de conhecimento, enquanto a IA que escreve por você perde o ganho de qualidade do texto em cerca de uma semana: esse é o resultado central de um experimento randomizado presencial com 211 universitários, publicado como IZA Discussion Paper 18792 (Contractor e Reyes, 2026), Experimental Evidence on the Learning Impact of Generative AI (https://docs.iza.org/dp18792.pdf).
No desenho, alunos de graduação estudam um tema técnico desconhecido, escrevem um ensaio analítico com ou sem acesso a IA generativa de prateleira (ChatGPT e equivalentes), e depois fazem avaliações sem ajuda, na hora e cerca de uma semana depois. O acesso à IA eleva a nota do teste imediato em 6,7 pontos percentuais sobre uma média de controle de 56,3% de acertos, o equivalente a 0,27 desvio-padrão. Cerca de 76% desse efeito imediato permanece no teste de retenção (mais 5,1 pontos percentuais). No ensaio, a história muda: a qualidade muda pouco enquanto a IA está ligada, mas estilo e relevância sobem na redação sem ajuda uma semana depois, e esse ganho atrasado é maior entre quem usa a ferramenta para explicar conceitos (augmentation), não para gerar o texto (automation).
Para o concurseiro da Polícia Rodoviária Federal, a regra operacional que sai do paper é direta. Peça explicação, contraste e checagem. Não peça o resumo pronto nem a redação pronta. O mesmo modelo que ensina também pode escrever no seu lugar. O que muda a retenção é o modo de uso.
O que o experimento IZA 18792 mediu?
Zara Contractor e Germán Reyes (Middlebury College) rodaram duas sessões presenciais supervisionadas, com cerca de uma semana de intervalo, na primavera de 2025. Na Sessão 1, os alunos recebiam um tema entre três opções técnicas pouco familiares (sistemas de captura de carbono, CRISPR e um terceiro tópico técnico do mesmo pacote), faziam um pré-teste, tinham até 35 minutos para estudar e escrever um ensaio analítico de cerca de 500 palavras, e em seguida faziam um pós-teste de múltipla escolha sem recursos externos. Na Sessão 2, todos repetiam teste e ensaio sem IA e sem internet.
A randomização separava braço com IA permitida e braço com IA proibida. No braço tratado, havia ChatGPT (GPT-4o) já logado, além de Wikipedia e biblioteca. No controle, Google, Wikipedia e biblioteca, com proibição explícita de assistentes generativos. Proctors, logs de conversa e autorrelato monitoravam conformidade. Dos 256 que se inscreveram, 211 fizeram a Sessão 1 e 204 completaram as duas. O aluno típico tinha cerca de 20 anos, GPA médio 3,68 e pouco conhecimento prévio do tema (cerca de 30% de acerto no baseline).
A amostra não é de concurseiro brasileiro. É de college americano já familiarizado com IA (adoção no campus acima de 80%). O valor do estudo para a preparação PRF está no mecanismo: IA de prateleira, sem tutor customizado, em tarefa de aprender conteúdo novo e demonstrar entendimento sob tempo.
O que significa o ganho de 0,27 DP no teste?
No pós-teste imediato da Sessão 1, feito sem IA por todos, o braço com acesso à ferramenta na fase de estudo marcou 6,7 pontos percentuais a mais (p = 0,034), ou 0,27 DP padronizado pelo desvio do controle. Em termos do próprio paper, isso é mais que o dobro da mediana de 0,10 DP relatada por Kraft (2020) em centenas de RCTs educacionais, e fica na ordem de magnitude de tutoria humana estruturada em meta-análises recentes, com a diferença de que não depende de fila de tutor.
O ganho se concentra no meio da distribuição: sobe a chance de passar de faixas intermediárias de acerto, com pouco efeito nas caudas de nota perfeita. Não altera a autoavaliação de conhecimento (a nota subjetiva sobe nos dois braços de forma parecida). Ou seja: a IA melhorou o desempenho objetivo no teste, não só a sensação de ter aprendido.
Uma semana depois, no teste de retenção sem recursos, o braço tratado ainda marca 5,1 pontos percentuais a mais (p = 0,027), cerca de 76% do efeito imediato. O paper trata isso como persistência substancial do ganho de conhecimento factual e conceitual medido por múltipla escolha.
Augmentation versus automation: o que muda na redação?
Cerca de 68% dos alunos do braço com IA usaram a ferramenta na sessão. Nos logs, explicar conceitos foi o uso mais frequente (57%), seguido de redigir respostas (31%) e resumir leituras (17%). Oitenta e oito por cento dos usuários disseram que a IA foi útil para a tarefa.
Os autores classificam padrões de conversa: 49% dos usuários de IA como augmentation (trabalham com a IA) e 32% como automation (delegam o trabalho à IA). Augmentation trata o modelo como tutor personalizado. Automation pede rascunho do ensaio e aparece com taxa bem mais alta de texto marcado como gerado por IA no detector (cerca de 53,6% do texto versus 20,9% no grupo augmentation).
Na Sessão 1, com a IA ainda disponível, o efeito sobre a qualidade do ensaio é grande para automation (+0,54 DP) e pequeno para augmentation (+0,05 DP). No teste, o padrão se inverte em magnitude relativa: augmentation tende a ganhar mais na prova (+0,44 DP versus +0,33 DP na automation). Na Sessão 2, sem IA, a qualidade do ensaio da automation some (estimativas perto de zero). Augmentation mantém tendência positiva na qualidade do texto sem ajuda e ganho relevante no teste (+0,29 DP, p = 0,061). Em resumo: o “texto bonito” feito pela IA some quando a ferramenta some; o ganho de quem usou a IA para entender o conceito tende a sobrar.
No agregado da Sessão 2, estilo e clareza e relevância ao enunciado sobem de forma significativa no braço que teve IA na Sessão 1. Traços de detecção de IA e diferenças estilísticas da Sessão 1 esmaecem, o que reforça que o ganho atrasado no texto não é só cola remanescente, e sim algo que o aluno consegue produzir sozinho depois.
Quais mecanismos explicam o ganho de aprendizagem?
Dois canais aparecem com clareza. Primeiro, o acesso à IA não muda o tempo total de estudo, mas muda a composição: os tratados gastam cerca de 12% menos tempo em atividades de escrita e cerca de 10% mais tempo lendo e buscando informação. Parte da redação é terceirizada; sobra tempo para input de conteúdo. Segundo, o prazer reportado na tarefa sobe cerca de 13%. Há também aumento de violações de regra no primeiro teste, mas os autores estimam que isso explica no máximo uma fatia modesta do ganho de nota.
A interpretação alinhada ao ângulo do concurseiro é: quando a IA libera tempo de digitação e o aluno redireciona esse tempo para ler e esclarecer conceito, o teste sobe e o ganho pode persistir. Quando a IA só entrega o parágrafo pronto, a qualidade do produto sobe na hora e some na prova sem ferramenta.
O que o concurseiro PRF deve pedir à IA?
O paper não ensina “motivação”. Ele separa dois prompts.
Pedido de augmentation: “Explique este artigo do CTB / este trecho de súmula em linguagem simples. Contraste com o erro comum da banca. Faça três perguntas para eu checar se entendi. Não escreva a resposta da questão discursiva por mim.”
Pedido de automation: “Escreve um resumo pronto para eu decorar.” Ou: “Redige a resposta completa da discursiva.” Ou: “Gera o mapa mental final sem eu tentar antes.”
No IZA 18792, automation pode melhorar o texto na sessão com IA. Uma semana depois, sem IA, esse ganho de qualidade some. Augmentation é o perfil em que o ganho de conhecimento e a tendência de melhor texto sem ajuda se sustentam. Para quem estuda legislação de trânsito, direito administrativo ou criminologia para a PRF, o paralelo é: use a IA para destrinchar o conceito e para checar o seu raciocínio; não para substituir a redação do caderno ou o resumo que você deveria reconstruir de memória.
O que já vale e o que não vale concluir?
Já vale: acesso a IA generativa de prateleira, em tarefa de aprender conteúdo novo sob tempo, elevou o teste imediato em 0,27 DP e manteve boa parte do efeito cerca de uma semana depois. O modo de uso importa. Explicar conceito (augmentation) e gerar texto (automation) produzem trajetórias diferentes quando a ferramenta é retirada.
Já vale para a rotina de concurso: medir a sessão pelo texto que a IA entregou é métrica errada. A métrica alinhada ao paper é o desempenho sem IA, no mesmo dia e dias depois.
Não vale: generalizar 0,27 DP de um college americano em tema de captura de carbono ou CRISPR para a nota final do concurso da PRF. A amostra é pequena (211 na Sessão 1), a tarefa é curta (dezenas de minutos) e o conteúdo não é edital brasileiro. Não vale também concluir que “usar IA na redação é sempre perda”. Automation sobe qualidade com a ferramenta ligada; o problema documentado é a evaporação desse ganho quando a prova é sem IA.
Não vale vender que qualquer uso de ChatGPT “segura 0,27 DP”. O 0,27 DP é o efeito médio de ter acesso na fase de estudo sobre o teste imediato. Dentro do tratado, quem automatiza e quem aumenta esforço não são iguais na persistência.
Como isso conversa com Khanmigo, NUMI e Bastani?
A fila editorial recente do QbStudy já trouxe três vizinhos. No Khanmigo (NBER w35620), acesso a tutor configurado para orientar sem entregar resposta gerou ganho alinhado à prática, com engajamento fino no chat. No NUMI (NBER w35621), o valor da IA apareceu no pós-erro dentro de fluxo de mastery. Em Bastani e colegas, GPT aberto pode melhorar a prática com a ferramenta e piorar a prova sem ajuda.
O IZA 18792 entra no mesmo mapa com outra lente: IA de prateleira, sem freio de produto, e a moderação vem do comportamento do aluno. Quem pede explicação se aproxima do braço que retém. Quem pede o texto pronto se aproxima do padrão em que o produto sobe e a habilidade não. A mensagem cruzada das pautas é consistente: o modelo importa menos do que a estrutura de uso e do que o que acontece depois que a aba fecha.
Qual é o erro comum ao ler “IA sobe a nota”?
O erro comum é ler só o 0,27 DP e ignorar a divisão augmentation versus automation. Outro erro é olhar a qualidade do ensaio com a IA ligada e celebrar. No paper, essa qualidade misturada com texto gerado não é a mesma coisa que aprendizagem. A prova limpa é a Sessão 2: sem IA, sem Google, mesmo tema.
O terceiro erro, na mesa de estudo, é transformar o chat em fábrica de resumos e discursivas. Isso pode deixar o caderno “bonito” na noite e vazio no simulado da semana seguinte. O desenho de Contractor e Reyes mede exatamente essa evaporação no perfil automation.
O que muda na prática de quem estuda com ChatGPT ou Claude?
Muda o critério de qualidade da sessão. Sessão boa não é a que gerou o maior bloco de texto colado. É a que, depois de fechar o chat, ainda segura acerto no teste curto e, dias depois, ainda segura parte desse acerto. No paper, isso aconteceu no agregado do braço com IA, e de forma mais clara entre quem usou a ferramenta para explicar.
Na prática operacional: leia o material (lei, informativo, doutrina curta) antes de abrir o modelo. Tente explicar com suas palavras. Só então peça contraste, exemplo e pergunta de checagem. Escreva a resposta discursiva ou o quadro-resumo você. Use a IA para criticar o que você escreveu, não para escrever no seu lugar. Se a única interação for “gera o texto”, você está no modo cujo ganho de qualidade some em uma semana no experimento.
O estudo foi aprovado pelo IRB de Middlebury College e divulgado na série IZA Discussion Paper (ISSN 2365-9793), número 18792, julho de 2026. Os números citados seguem o abstract e o corpo do PDF oficial em https://docs.iza.org/dp18792.pdf.
Em QbStudy.com, a linha sobre estudo e performance continua a mesma: fato experimental, dose e modo de uso antes do hype. IA que explica segura na prova. IA que escreve por você some quando a ferramenta some.