36 Agentes em Conflito e Escalonamento Humano
Este capítulo faz parte de um livro em desenvolvimento ativo e ainda não passou pela revisão do autor. O conteúdo pode mudar conforme a revisão avança.
A decisão de pesquisa. Os seus loops voltaram e não batem entre si, ou batem bem demais. Você decide qual das três coisas está vendo (discordância real, erro correlacionado ou consenso fabricado) e decide o momento exato de parar os loops e trazer a decisão para as suas próprias mãos.
36.1 Por que essa decisão importa
A decisão em jogo: se a concordância entre os seus revisores de IA é evidência ou eco, e o momento em que você interrompe os loops e decide por conta própria.
“Não me diga que os seus revisores concordaram. Me diga se eles poderiam ter concordado pelo mesmo motivo errado. Concordância é a coisa mais fácil do mundo de se fabricar, e a mais perigosa de se confiar.” — um colega cético na sua defesa de treino
A esta altura você já consegue rodar uma pequena equipe de papéis de IA sobre o seu trabalho, o que significa rodar vários loops ao mesmo tempo. O pensamento sedutor seguinte é que uma equipe é mais segura do que um assistente só, então três papéis abençoando o seu rascunho devem valer três confirmações. Não valem. Três loops construídos do mesmo jeito, lendo o mesmo rascunho com as mesmas instruções, tendem a cometer o mesmo erro, então a concordância deles é um erro repetido três vezes. Pior: um loop que continua rodando consegue se convencer da própria confiança, porque cada volta pole a resposta da volta anterior em vez de testá-la, e o que chega de volta até você é uma versão bem defendida do primeiro erro. Este capítulo é sobre enxergar através disso, e sobre o momento em que você para de contar votos e decide por conta própria.
36.2 O conceito
Quando os seus papéis não batem, o primeiro movimento não é escolher um vencedor. É reconciliar saídas conflitantes: decidir em que acreditar diagnosticando primeiro por que os papéis diferem. Exemplo: antes de ficar do lado do revisor contra o metodologista, você pergunta o que faria cada um deles estar certo. São três casos, e eles pedem respostas opostas.
Discordância real é quando os papéis genuinamente leem a evidência de formas diferentes. Exemplo: o seu revisor chama uma frase de clara e forte enquanto o seu metodologista sinaliza essa mesma frase por ir além dos seus dados. Este é o caso bom. O choque aponta direto para a alegação que você precisa conferir.
Erro correlacionado é quando os papéis concordam, mas sobre a mesma suposição errada, de modo que a concordância não prova nada. Exemplo: três revisores construídos a partir do mesmo modelo-base deixam passar a mesma falha porque dividem o ponto cego. A pergunta a fazer é simples: eles poderiam estar errados do mesmo jeito? Se sim, o consenso deles é um sinal, não três.
Consenso falso é quando os papéis concordam só porque o seu prompt enquadrou a tarefa de um jeito que os obrigava. Exemplo: você pede “confirme que o meu rascunho está pronto”, e todo papel obedece. Você induziu todas as testemunhas. Reformule o pedido de forma neutra e rode de novo.
A ferramenta que separa esses casos é uma checagem de independência: um teste que faz a concordância valer mais do que uma contagem de votos, seja um método independente que você mesmo roda, seja um jeito de forçar dois papéis a serem genuinamente independentes. Exemplo: dois papéis abençoam um número citado, então você abre a fonte e o recalcula você mesmo antes de confiar em qualquer um dos dois.
Aí vem a decisão que só você pode tomar. Escalonamento para o julgamento humano é o momento em que uma saída de IA resolveria, em vez de informar, uma decisão que é sua, então você para e decide você mesmo. Exemplo: um papel propõe chamar o seu resultado de “causal”, o que resolveria o limite da sua alegação, então isso escala para você. O que você faz nesse momento é um override humano: você retoma a caneta e toma a decisão com as suas próprias palavras, apoiado na sua própria checagem, mesmo quando os papéis concordaram com outra coisa. Uma decisão que apenas contou os papéis não é uma decisão. É uma votação, e votações entre modelos parecidos entre si não significam nada.
O escalonamento é também o único momento em que os loops têm de parar. Uma ferramenta agêntica deixada rodando vai continuar procurando um próximo passo e, se ninguém a interromper, vai tomar a decisão por padrão, não porque você delegou, mas porque o loop não tinha mais para onde ir. Então escreva os seus gatilhos antes de começar a rodada: as decisões específicas em que os loops pausam e esperam por você. Um gatilho que você decide na hora, com três revisões arrumadinhas na sua frente, não é um gatilho. É um estado de espírito.
36.3 Um exemplo trabalhado
Você estimou a taxa de desemprego da sua cidade (a fração de pessoas que querem trabalho remunerado e não conseguem encontrar) a partir de uma pesquisa que você mesmo aplicou. Você perguntou a 250 adultos na porta da biblioteca pública, ao longo de três tardes de dia útil, se estavam trabalhando ou procurando trabalho, e depois dividiu uma contagem pela outra. O seu rascunho relata que “o desemprego aqui é de 4.0%, em excelente concordância com a taxa oficial”.
Você roda três papéis revisores de IA. Os três devolvem o mesmo veredito: “Parece sólido. Bate com o número publicado”. Isso são três confirmações?
Diagnostique antes de comemorar. Cada um desses papéis já espera um número perto de 4%, porque é nessa faixa que ficam as taxas conhecidas das manchetes, então cada um faz correspondência de padrão entre a sua estimativa e o valor com que já chegou, e a abençoa sem conferir como você chegou lá. Isso é erro correlacionado usando a máscara da confirmação: eles dividem um ponto cego, a âncora no número familiar, e ele esconde o seu erro de verdade. Você perguntou a apenas 250 pessoas, então a sorte de quem por acaso passou na frente vale alguns pontos percentuais sozinha, e você perguntou em tardes de dia útil na porta de uma biblioteca, onde quase ninguém que esteve no trabalho o dia todo poderia aparecer. O arrumadinho “4.0%” era sorte montada sobre um método de aparência honesta.
É aqui que você escala. A concordância dos revisores resolveria a sua alegação principal, e essa alegação é sua, então você retoma a caneta. Você recalcula a taxa a partir das suas respostas brutas e carrega a incerteza de uma amostra de 250 pessoas pela aritmética, e o resultado honesto é 4.0% ± 2.4 pontos percentuais, vindo de um grupo que não podia incluir a maior parte das pessoas que estavam trabalhando. Consistente com a taxa oficial, mas nem de longe tão preciso quanto você escreveu. Você faz o override de três vereditos do tipo “ficou ótimo” e reescreve a alegação com a incerteza real. Os papéis contaram a resposta como correta. Você conferiu se ela foi conquistada.
36.4 O laboratório no Colab
Este capítulo tem o seu próprio notebook companheiro — abra-o no Colab pelo selo acima. O notebook reúne os prompts e o código do capítulo e termina com o espaço de trabalho Agora é a sua vez, para você completar a etapa do capítulo no seu projeto sem sair do Colab. O laboratório completo de sala de aula por trás deste capítulo é o notebook do curso nb16 — Managing multiple AI agents + the final defense (abrir no Colab), parte do curso companheiro apresentado no apêndice Para instrutores. Lá você liga um fluxo executor–crítico sobre um rascunho real, depois simula duas equipes de quatro revisores e vê um ponto cego compartilhado transformar concordância unânime em uma confiança falsa que você consegue medir.
36.5 Prompts de IA recomendados
Comprometa-se primeiro com o seu próprio diagnóstico, depois delegue. Cada prompt abre um loop e, com vários loops em jogo, a disciplina é a mesma de quando havia um só: leia a saída, interrogue, refine, rode de novo, e nunca deixe um loop fechar uma questão que pertence a você. Cada prompt é uma tarefa verificável, não um pedido de veredito.
Localize as decisões que precisam escalar.
Act as a research-integrity assistant. Here is my draft's headline claim and the three
never-delegate decisions I think it contains: [paste]. Using standard research-defense
criteria, list which decisions in this draft an AI output should never be allowed to
settle, and which of my three I mislabeled. Do not settle any of them for me.
Depois de rodar, verifique: confira a lista dela contra os gatilhos de escalonamento que você mesmo escreveu; a decisão que ela omitir é a que você deve guardar com mais força. Combate a ilusão de completude (uma lista arrumadinha que descarta em silêncio a decisão que mais importa).
Liste as concordâncias a verificar.
Here are three reviewer outputs on the same draft: [paste all three]. For each pair,
name one specific way they could be wrong the SAME way: a shared assumption, a shared
anchor, or a shared prompt. Rank the pairs from most to least likely to share a blind
spot.
Depois de rodar, verifique: para o par mais bem colocado, rode um dos papéis de novo com outro enquadramento e outro contexto e veja se a concordância sobrevive. Combate os erros correlacionados entre ferramentas ou papéis (concordância que é uma falha só, ecoada de volta).
Faça red team (revisão adversária) do consenso.
Act as a hostile reviewer who believes my three roles only agreed because my prompt led
them. Argue that their consensus is manufactured, name the leading words in my original
ask, and give me a neutral rewrite. Do not reassure me.
Depois de rodar, verifique: se ela não encontrar nenhuma palavra indutora, insista e exija a pior delas, e então rode a revisão de forma neutra. Combate a concordância bajuladora (elogio que ensaia o seu ego, não a sua evidência).
Quais alegações o seu rascunho consegue defender, onde cada alegação precisa parar, se uma concordância entre os seus papéis chegou a ser independente, e o momento de escalar: isso continua sendo seu. Nenhum papel decide a própria confiabilidade, e nenhuma contagem de votos entre papéis decide o limite da sua alegação ou a sua ética. Quando uma saída de IA resolveria uma dessas coisas em vez de informá-la, você para e decide.
36.6 Um caso de falha da IA
Você manda o seu rascunho para quatro papéis de IA e os quatro respondem “nenhum problema grave”. Parece uma confirmação esmagadora, e é confiantemente errada. Os quatro dividem um modelo-base e leem o mesmo rascunho com as mesmas instruções, então dividem um ponto cego. Sempre que a sua única falha real cai dentro desse ponto cego, os quatro a deixam passar juntos. O “tudo certo” unânime deles está mais para uma voz só do que para quatro. Rodar cada loop por mais tempo também não salva você. Quatro loops com o mesmo ponto cego, com mais voltas, devolvem o mesmo veredito com parágrafos melhores em volta.
Você pega o erro ao se recusar a tratar concordância como evidência. Você faz uma checagem de independência: relê a alegação sinalizada contra a sua própria declaração de indagação, ou entrega o rascunho a um papel com outro enquadramento e outro contexto. No laboratório você vai ver o tamanho dessa armadilha medido. Quatro revisores correlacionados deixam passar uma falha real cerca de sete vezes mais do que quatro independentes, e empilhar mais papéis correlacionados não fecha essa distância.
36.7 Agora é a sua vez
O seu projeto já tem um pequeno time de IA rodando sobre uma seção; este passo decide de antemão onde esses loops precisam parar e devolver a decisão para você.
- Escreva as suas regras de escalonamento antes de a próxima rodada começar. Liste as decisões específicas que nenhum loop pode fechar: o limite da sua alegação, a sua incerteza, quais fontes são reais, o que conta como pronto e qualquer coisa com uma aresta ética. Mantenha a lista curta o bastante para lembrar dela sob pressão.
- Acrescente as condições de parada que não são sobre conteúdo. Quantas voltas um loop pode rodar antes de você ler, e o que uma ferramenta agêntica pode mudar sem perguntar a você primeiro.
- Encontre uma discordância real no que os seus papéis já devolveram e diagnostique-a por escrito: discordância real, erro correlacionado ou um consenso fabricado pelo seu próprio prompt. Diga qual e por quê.
- Resolva você mesmo com uma checagem que os loops não conseguem fazer: recalcule o número, abra a fonte ou compare com um valor que nunca esteve em nenhum prompt. Escreva a resolução e a checagem juntas, porque uma sem a outra é só opinião.
- Pegue um ponto em que os seus papéis concordaram sobre algo que importava e teste se a concordância era independente. Rode um deles de novo com outro enquadramento e outro contexto, ou verifique o ponto você mesmo, fora das ferramentas.
- Registre o conflito, o diagnóstico e o override no seu AI Research Ledger (registro de pesquisa com IA), e verifique pelo menos um resultado com um método nomeado do Guia de Verificação. Um revisor de IA pode rodar a checagem com você; a decisão de aceitar ou rejeitar continua sendo sua.