24 Reconhecendo a Falsa Confiança
Este capítulo faz parte de um livro em desenvolvimento ativo e ainda não passou pela revisão do autor. O conteúdo pode mudar conforme a revisão avança.
A decisão de pesquisa. Quando uma ferramenta lhe entrega um achado fluente e confiante, você decide se a confiança dela conta como evidência (nunca conta) e qual verificação independente você roda sobre o número por baixo dela antes de repetir a alegação como sua. Nada sobre o quanto a frase soa segura lhe diz se ela é verdadeira.
24.1 Por que essa decisão importa
A decisão em jogo: o que você exige de um resultado de som confiante antes de colocar o seu nome nele.
Imagine a bióloga de pesca que analisa relatórios de restauração de córregos para uma agência estadual. Todo ano ela lê resumos que anunciam sucesso em prosa polida e segura. O critério dela é direto: “Eu não ajo pela frase. Eu ajo pelo número por trás dela. Me mostre a mensuração, como você calculou a mudança, e por que o crédito vai para o projeto.” Um parágrafo confiante não move ninguém que já leu cem parágrafos confiantes. O que move é um número que você recalculou e consegue defender. Uma parceira de IA vai lhe escrever um achado lindo e de som seguro em segundos. Seu trabalho é tratar essa confiança como algo que não vale nada até você conferir o que está por baixo.
24.2 O conceito
A armadilha tem nome. Falsa confiança é quando uma saída fluente e detalhada faz você se sentir seguro de algo que nunca verificou. Exemplo: um resumo de IA relata que uma limpeza de córrego “reduziu o nitrato em cerca de 40 por cento”, e o número nítido e a redação lisa fazem a alegação parecer resolvida antes de você olhar uma única mensuração.
Dois hábitos tornam a armadilha perigosa. Viés de automação é a tendência a confiar demais em um sistema automatizado e parar de conferir, justamente porque foi uma máquina que produziu a resposta. Exemplo: você conferiria duas vezes a conta de uma colega de laboratório, mas cola a porcentagem da IA direto no seu relatório porque “a ferramenta calculou”. Ilusão de compreensão é confundir uma explicação lisa com entendimento real. Exemplo: você concorda com a cabeça enquanto a IA caminha linha por linha pelo cálculo dela e depois percebe que não conseguiria defender o número diante de quem analisa na agência sem rodar tudo de novo você mesmo.
O loop piora isso, não melhora. Hoje você raramente para na primeira resposta. Você pede, lê, refina e roda de novo, e ferramentas agênticas giram esses ciclos sozinhas. Esse é o loop de IA, o ciclo prompt → resposta → interrogação → refinamento → nova execução. Cada passagem volta mais limpa e mais segura que a anterior, e esse polimento parece convergência para a verdade. Não é nada disso. Um número que estava errado na volta um em geral continua errado na volta seis, só que mais bem vestido. A confiança cresce ao longo do loop quer a precisão cresça ou não, então confira o número na volta que você de fato pretende usar.
A regra que vence tudo isso é curta: verifique o número, não o parágrafo. Verificação é uma conferência independente, feita por um método fora do modelo, de que um resultado é de fato verdadeiro. Exemplo: em vez de confiar nos “40 por cento” da IA, você recalcula o nitrato médio antes e depois da limpeza a partir das leituras brutas e vê o que os dados realmente mostram. Um código que roda sem erros não é a mesma coisa que um código correto, e um resumo que se lê lindamente não é a mesma coisa que um resumo certo.
24.3 Um exemplo trabalhado
Você estuda um pequeno córrego onde uma mata ciliar (uma faixa de árvores e gramíneas plantada ao longo da margem para filtrar o escoamento) foi implantada no ano passado. Você tem leituras semanais de nitrato (o nitrato é um nutriente vindo de fertilizante que, em excesso, alimenta florações de algas e rouba o oxigênio da água), medidas em miligramas por litro, para o ano anterior ao plantio e o ano seguinte. A agência se importa porque o baixo oxigênio mata as trutas que a restauração deveria trazer de volta.
Você pede a uma IA que resuma o conjunto de dados. Ela devolve: “A mata ciliar reduziu o nitrato médio em cerca de 40 por cento, um claro sucesso ambiental.” A frase é fluente e segura. É aqui que a falsa confiança venceria: você sente o alívio de um resultado limpo e estende a mão para citá-lo.
Em vez disso, você verifica o número. Você calcula o nitrato médio das semanas “antes” e o das semanas “depois”, e subtrai. Suponha que a média de antes seja 8,1 mg/L e a de depois, 6,9 mg/L. A queda real é de 1,2 mg/L, cerca de 15 por cento, não 40. O resumo confiante exagerou a mudança em mais do que o dobro. Um segundo problema também se escondia atrás do polimento: as leituras vêm de um único ponto, sem córrego de comparação, então nem mesmo os 15 por cento verdadeiros podem ser creditados à mata ciliar sozinha. Uma primavera chuvosa ou uma mudança na adubação rio acima poderiam mover o nitrato tanto quanto. Você fica com o achado que consegue defender, “o nitrato caiu cerca de 15 por cento neste ponto ao longo de um ano”, e descarta tanto o número inflado quanto a palavra “sucesso”.
24.4 O laboratório no Colab
Este capítulo tem o seu próprio notebook companheiro — abra-o no Colab pelo selo acima. O notebook reúne os prompts e o código do capítulo e termina com o espaço de trabalho Agora é a sua vez, para você completar a etapa do capítulo no seu projeto sem sair do Colab. O laboratório completo de sala de aula por trás deste capítulo é o notebook do curso nb01, Research in the Age of AI: Your Arm, Your RA, Not Your Brain (abrir no Colab), parte do curso companheiro apresentado no apêndice Para instrutores. No laboratório você roda um pequeno estudo aleatorizado, encontra um resumo confiante de uma linha alegando um efeito grande, e recalcula a diferença real nos dados para ver o resumo exagerá-la. Depois você faz o red team de um achado que você mesmo escreveu e pega uma IA elogiando a sua frase em vez de testá-la.
24.5 Prompts de IA recomendados
Comprometa-se com a sua própria expectativa primeiro, depois delegue. Cada prompt entrega uma tarefa que você pode conferir, com uma nota de verificação nomeando a falha da qual ele defende.
Aponte o número real (quem recalcula é você).
Here is a cell that computes average nitrate before and after a buffer was
installed and prints both means: [paste it]. Tell me which single printed number
is the actual change, and state plainly whether a "40 percent reduction" summary
is or is not that number. Do not rerun it; I will read my own output and compare.
Depois de rodar, verifique (contra-ataca a fabricação confiante): um resumo fluente pode enunciar um número que os dados nunca produziram. Leia as duas médias que a sua célula imprimiu e calcule você mesmo a mudança. Se não bater com o número da IA, confie na sua própria saída.
Force a incerteza a aparecer (quem confere o limite é você).
For the before/after nitrate change in my data, rate how firm the estimate is.
Give a plausible range, and name what drives the uncertainty: the sample size, the
week-to-week scatter, and the lack of a comparison stream.
Depois de rodar, verifique (contra-ataca a incerteza ausente): se um resultado chega como um fato limpo, sem nenhum limite, presuma que a incerteza foi omitida, não que ela não existia. Confira o intervalo contra a dispersão que você consegue ver nas suas próprias leituras.
Faça o red team do seu achado (quem fica com a alegação é você).
Here is my finding: "[paste your sentence]." Act as a hostile reviewer for a state
fisheries agency. Name every place it reaches past one site and one year of data.
Do not rewrite it for me; list the weaknesses.
Depois de rodar, verifique (contra-ataca a concordância bajuladora): se toda objeção for branda, ou se ela chamar a sua frase de “bem equilibrada”, insista e peça a pior falha, uma só.
Estas coisas continuam sendo suas, por mais segura que a ferramenta soe. Decidir qual alegação o número verificado de fato sustenta, e até onde essa alegação alcança. Julgar se o seu desenho de pesquisa permite creditar a mudança à mata ciliar, ou apenas permite relatar que o nitrato caiu. Enunciar a incerteza e os limites com as suas próprias palavras. A ferramenta pode rascunhar um resumo; decidir se esse resumo é verdadeiro, e responder por ele, é trabalho de quem pesquisa.
24.6 Um caso de falha da IA
Você pede à IA que “resuma o que este conjunto de dados de qualidade da água mostra”, e ela devolve um parágrafo confiante terminando em “uma redução de 40 por cento, um claro sucesso”. Cada parte se lê como um achado que você poderia citar: um número redondo, um veredito firme, nenhuma ressalva.
Aqui está exatamente como você pega isso. Você não repete o parágrafo. Você calcula as duas médias de grupo a partir das leituras brutas e subtrai, e a mudança real é de cerca de 15 por cento, não 40. Depois você pergunta o que o desenho de pesquisa autoriza: um ponto, sem córrego de controle, um único ano, então até os honestos 15 por cento podem vir do clima e não da mata ciliar. O resumo confiante falhou duas vezes, uma no número e outra no alcance causal, e as duas falhas eram invisíveis até você conferir fora do modelo.
24.7 Agora é a sua vez
Seu projeto tem uma estimativa, um intervalo, testes negativos e uma revisão adversária por trás. Este passo vira a auditoria contra você mesmo e produz a única frase que a sua evidência consegue de fato carregar.
- Liste todo número hoje presente no seu projeto que você não recalculou pessoalmente. A lista costuma ser mais longa do que você espera. Recalcule cada um ou tire-o de lá.
- Para o seu número principal, escreva de onde vem de verdade a sua confiança nele: do seu próprio recálculo, do resumo fluente de uma ferramenta, ou do fato de ele ter batido com o que você torcia para encontrar. Só o primeiro conta como razão.
- Escreva a sua frase de limite, a alegação que o seu desenho de pesquisa autoriza e nada além dela. Nomeie a unidade, o contexto, o período, e se você pode creditar uma causa ou apenas relatar que algo mudou.
- Nomeie o único lugar em que você tem mais chance de deixar passar uma resposta confiante sem conferir, e anote isso. Essa admissão é onde o viés de automação passa a ser administrado.
- Adote uma regra permanente para o resto do projeto: nenhum número relatado por IA chega ao seu artigo, à sua nota de pesquisa ou ao seu pôster antes de você o recalcular por um segundo método.
- Registre a auditoria no seu AI Research Ledger (registro de pesquisa com IA), e verifique o seu número principal com um método nomeado do Guia de Verificação. O cálculo direto é aquele sobre o qual este capítulo foi construído: recalcule as médias na mão, subtraia, e veja se o número confiante sobrevive. Uma IA revisora pode rodar a checagem com você; a decisão de aceitar ou rejeitar continua sendo sua.