IA com mastery muda o aprendizado quando o valor aparece depois do erro: em um ensaio de campo randomizado com mais de 6 mil alunos dos anos finais do ensino fundamental (middle school, 6º ao 8º ano) no distrito de Hamilton County, no Tennessee, o tutor de inteligência artificial da plataforma NUMI melhorou a recuperação pós-erro (próxima tentativa mais correta e menos tentativas para voltar ao acerto), e o sinal mais claro de retenção uma semana depois surgiu quando a IA estava embutida no fluxo de mastery, com ganho marginalmente significativo no material praticado. O trabalho é o NBER Working Paper 35621, de Philip Oreopoulos, Michael Liut, Alp Sungu e Nina Low (2026), Making AI Tutoring Productive: Evidence from a Mastery-Based Math Practice Experiment, DOI 10.3386/w35621 (também EdWorkingPaper 26-1552).
O desenho separa o que o concurseiro costuma misturar. Um braço compara apoio de IA versus aprendizado assistido por computador sem IA (CAL-only). Outro compara progressão com mastery versus sem mastery. O resultado prático para quem estuda para a Polícia Rodoviária Federal não é “abrir o ChatGPT”. É configurar o modelo em modo coach e só avançar depois de acertar, de modo que o erro force raciocínio, e não o pedido do gabarito pronto.
O que o experimento NUMI testou?
Oreopoulos, Liut, Sungu e Low conduziram o ensaio no fim de março e início de abril de 2026, em aulas de matemática do 6º ao 8º ano, em cerca de 20 escolas e quase 100 professores de Hamilton County Schools (incluindo Chattanooga). Na primeira semana (23 a 27 de março), os alunos fizeram uma atividade NUMI de cerca de 50 minutos, apresentada como revisão para a avaliação estadual. Na semana seguinte (30 de março a 3 de abril), fizeram uma prova retardada de 15 a 20 minutos, com itens praticados e não praticados.
A randomização ocorreu no login, em três eixos. Cada aluno recebia um de dois pacotes de tópicos de matemática da sua série. Recebia ou o tutor de IA do NUMI, ou a mesma plataforma CAL sem IA. E recebia progressão com mastery ou sem mastery. No braço mastery, era preciso assistir pelo menos um minuto do vídeo relevante e acertar três questões seguidas antes de avançar. No braço sem mastery, bastava tentar pelo menos uma questão para circular com mais liberdade. O registro no AEA RCT Registry é AEARCTR-0018678. As tabelas de prática usam amostras na casa de cerca de 7 mil observações; o abstract resume o campo como mais de 6 mil alunos.
O NUMI combina vídeo curto, exercícios, feedback imediato e soluções trabalhadas. No braço CAL-only, depois do erro a plataforma mostra a solução pronta. No braço com IA, o tutor é guard-railed: evita entregar a resposta direta e oferece apoio estruturado (incluindo um botão ocasional “Help me get started” com pergunta de raciocínio de múltipla escolha sobre o primeiro passo, e walkthroughs após o erro). A comparação principal, portanto, não é IA versus lápis e papel. É IA versus CAL já completo, medindo o valor adicional do modelo de linguagem.
AI versus CAL: o que muda no ritmo e na qualidade?
A IA não fez o aluno terminar mais trabalho. Fez o contrário no volume e o contrário no cuidado. Alunos com IA progrediram mais devagar e tentaram menos questões, mas acertaram mais nas tentativas a que chegaram. No Exercício 1, a atribuição à IA reduziu o número de questões concluídas e aumentou o tempo por questão em cerca de 1,64 minuto. No braço mastery, a IA freou ainda mais a progressão em relação ao mastery sem IA.
Os autores descrevem isso como tradeoff ritmo-qualidade. A IA não ajuda a “passar mais conteúdo” na sessão. Ela muda a qualidade e o timing do trabalho que o aluno realmente faz. Para o concurseiro, o paralelo é imediato: sessão com chat aberto que “resolve” dez itens em vinte minutos não é o mesmo fenômeno que sessão mais lenta em que cada erro vira diálogo e a próxima tentativa melhora.
Mastery versus não mastery: o que a regra força?
A hipótese do desenho é comportamental. Sem mastery, depois do erro o aluno pode olhar a solução, pular adiante ou seguir. Com mastery, precisa acertar três seguidas. Usar a IA só como muleta deixa a pessoa presa, porque a próxima questão ainda precisa ser resolvida sozinha. A regra cria demanda por ajuda que realmente ensina o passo, e não por atalho.
Na prática, mastery funcionou como alavanca comportamental. No Exercício 1, no braço CAL-only, a regra aumentou o número de questões tentadas e concluídas em 4,62, o número de acertos em 1,23 e a probabilidade de chegar a três acertos seguidos em 28,7 pontos percentuais. Também elevou o tempo no Exercício 1 em 6,69 minutos. Ou seja: a plataforma registrou mais prática e mais “sucesso” definido pela própria regra.
Aqui entra o ponto que o paper chama de puzzle. Mastery sozinha não gerou ganhos claros na prova retardada de uma semana depois. O coeficiente de mastery nos desfechos de retenção ficou perto de zero. Aumentar a chance de três acertos seguidos na sessão não foi, por si só, a mesma coisa que reter o conteúdo sete dias depois. Streak curto na plataforma não equivale a aprendizagem durável.
Onde está o mecanismo: o que acontece depois do erro?
O mecanismo mais nítido aparece nos eventos de erro, dentro do fluxo mastery. Entre alunos em mastery que erraram, a IA elevou em 8,5 pontos percentuais a probabilidade de a próxima tentativa ser correta e reduziu em 0,96 o número de tentativas necessárias para voltar a um acerto. Ao mesmo tempo, aumentou em 2,88 minutos o tempo de relógio até o próximo acerto. Em outras palavras: a recuperação ficou mais produtiva e mais lenta. O aluno não “chuta até passar”. Ele gasta tempo com suporte estruturado e volta ao acerto com menos tentativas extras.
Isso é o centro da matéria e o centro do ângulo para concurso. O valor da IA, neste RCT, não aparece no headline de “mais questões feitas”. Aparece no pós-erro: próxima tentativa certa e caminho mais curto de volta ao acerto, com mais tempo por item. Sem essa estrutura, o risco clássico permanece: pedir a resposta pronta, sentir produtividade e perder retenção.
Os autores ainda checam se o efeito pós-erro seria só o botão de ajuda do primeiro passo. A decomposição no apêndice sugere que parte do ganho nas primeiras transições cabe ao canal de hint inicial, mas em transições posteriores (por exemplo, do erro na Questão 2 para o acerto na Questão 3) sobra vantagem da IA mesmo sob correção conservadora. A leitura principal não depende disso: o tratamento experimental empacota hint inicial e walkthrough pós-erro, e ambos fazem parte do pacote.
A prova de uma semana depois confirma o quê?
A evidência de retenção é a mais cautelosa do paper, e deve ser lida assim. O sinal mais encorajador aparece quando a IA está embutida no fluxo mastery, concentrado no material praticado do Exercício 1 (o conteúdo que quase todos alcançaram e que menos sofre com seleção para etapas posteriores).
Entre alunos em mastery, 37,0% do braço CAL-only acertaram a questão retardada do Exercício 1 praticado. No braço com IA, a taxa foi 40,2%, diferença de cerca de 3,1 pontos percentuais (p = 0,065 na tabela principal, portanto marginalmente significativa e sugestiva, não definitiva). Na questão correspondente não praticada do Exercício 1, a diferença IA versus CAL fica próxima de zero. O padrão é consistente com ganho no material treinado, e não com diferença genérica de “saber fazer prova”.
Os autores notam que o efeito não é transformador: a maioria ainda erra a questão retardada. Mas a magnitude se aproxima do próprio efeito de prática medido no estudo para esse exercício. No desenho 2×2 completo, a interação Mastery × AI é levemente positiva e imprecisa; o AI sozinho no braço sem mastery fica perto de zero. A mensagem agregada: LLM pode agregar valor sobre CAL padrão, mas o valor depende de estrutura que transforma o erro em momento de aprendizagem produtiva.
Como isso conversa com o paper Khanmigo (NBER w35620)?
Este NUMI é o par irmão do Khanmigo produzido na véspera editorial. No w35620, acesso a tutor de IA configurado para orientar sem entregar resposta, em reforço diário de dois anos, gerou ganhos de nota alinhados à prática na plataforma, com engajamento fino no chat (acesso quase universal, diálogo mediano raro). A restrição vinculante foi engajamento.
No w35621, o desenho aperta o parafuso: randomiza AI versus CAL e mastery versus não mastery na mesma sessão, e olha o microprocesso depois do erro. O contraste é útil. Ter chat disponível (Khanmigo) não basta. Forçar streak sem qualidade de suporte (mastery sozinha no NUMI) também não basta para retenção. O que o NUMI sugere é a combinação: regra que impede pular o erro mais suporte de IA que guia a recuperação.
O paper também se posiciona em relação a Bastani e colegas: acesso aberto a GPT pode melhorar a prática com a ferramenta e prejudicar a prova sem ajuda; tutor com freio mitiga o dano, mas nem sempre gera ganho claro frente a sem IA. O NUMI difere ao embutir tutor guard-railed dentro de CAL e de regra de mastery, e encontra valor adicional modestamente concentrado no material praticado sob essa estrutura.
Como o concurseiro deve configurar ChatGPT ou Claude?
O ângulo prático não é lista de motivação. É protocolo de sessão derivado do desenho experimental.
Primeiro, modo coach. Peça pista, pergunta socrática ou verificação do próximo passo. Proíba a resposta final até você declarar que já tentou de novo. Isso espelha o guard-rail do NUMI (não entregar o gabarito; forçar raciocínio).
Segundo, regra de mastery pessoal. Escolha um bloco (por exemplo, cinco questões de legislação de trânsito ou de direito administrativo). Só avance de tópico depois de acertar três itens seguidos sem olhar o gabarito. Se errar, a sessão não “segue para a próxima”. A sessão para no erro.
Terceiro, uso da IA só no pós-erro. Antes da primeira tentativa, feche o chat. Depois do erro, abra e peça: “Não me diga a alternativa certa. Mostre onde meu raciocínio quebrou e me dê uma pista para a próxima tentativa.” Refaça. Só então confira. Isso reproduz o mecanismo medido: próxima tentativa mais correta e menos tentativas extras para voltar ao acerto, com mais tempo por item.
Quarto, aceite o tradeoff ritmo-qualidade. No NUMI, IA significou menos questões e mais minutos por questão. Se a métrica da sua noite for “quantas eu matei”, você vai otimizar o braço errado do experimento. A métrica alinhada ao paper é “depois que errei, a próxima ficou certa sem gabarito”.
O que já vale e o que não vale concluir?
Já vale: desenho experimental com AI versus CAL e mastery versus não mastery deixa claro que “ter LLM” e “aprender com LLM” são coisas diferentes. O mecanismo mais limpo está no pós-erro. Mastery sozinha infla sucesso de plataforma sem garantir retenção de uma semana. A combinação AI + mastery é onde aparece o sinal mais encorajador de prova retardada no material praticado.
Já vale para concurso: pedir gabarito pronto é o oposto do tratamento que agregou valor. Configurar coach e travar avanço até acertar aproxima a mesa de estudo do braço que o NBER destaca.
Não vale: extrapolar 3 pontos percentuais em uma questão de matemática de middle school nos EUA para a nota final da PRF. A população, a disciplina e a duração da intervenção (cerca de uma aula de 50 minutos mais prova uma semana depois) são específicas. Não vale vender “IA com mastery revoluciona”. Os próprios autores dizem que o efeito não transforma a aprendizagem em escala grande e que as estimativas de retenção são imprecisas.
Não vale também tratar três acertos seguidos como prova de domínio real. O paper mostra exatamente que a regra eleva esse indicador sem, sozinha, elevar a prova retardada. Para o concurseiro, streak no app de questões é métrica frágil se a checagem uma semana depois (simulado sem consulta) não confirma retenção.
Qual é o erro comum ao estudar com IA depois deste RCT?
O erro comum é medir a sessão pelo volume de itens “resolvidos” com o chat. No NUMI, quem tinha IA fez menos itens e gastou mais tempo. O ganho útil estava na recuperação após o erro. Outro erro comum é impor mastery só como checklist (três verdes seguidos) sem qualidade de suporte no momento do erro. Mastery sem IA, neste estudo, não melhorou a retenção de uma semana.
O terceiro erro é misturar os papers. Khanmigo mostrou que acesso sem engajamento não entrega diálogo. NUMI mostra que engajamento forçado (mastery) sem suporte de qualidade no erro também não garante retenção, e que o LLM agrega quando a estrutura torna o pós-erro o ponto de uso. A linha editorial coerente é: estrutura + freio + diálogo no erro. Não: aba aberta + gabarito.
O que o concurseiro PRF deve levar deste paper?
Leve o desenho, não a população. AI versus CAL responde se o modelo adiciona algo além de vídeo, exercício e solução pronta. Mastery versus não mastery responde se a regra de só avançar após acertar cria demanda real por ajuda. O mecanismo pós-erro responde o que muda quando a ajuda chega no momento certo. A prova retardada responde se sobrou algo uma semana depois no material praticado.
Na mesa de estudo da PRF, isso vira rotina objetiva. Feche o gabarito. Tente. Se errar, abra o modelo em modo coach. Peça pista, não a letra. Refaça até acertar três seguidas no bloco. Meça retenção depois, sem chat. Se a única interação com a IA for colar o enunciado e copiar a resposta, você está no braço que o paper evita: esforço evitado, não erro transformado em aprendizagem.
Em QbStudy.com, a série sobre estudo e performance segue o fato experimental antes do hype. No NUMI (NBER w35621), o valor da IA com mastery aparece depois do erro.