36 Agentes en conflicto y escalamiento humano
Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.
La decisión de investigación. Tus bucles volvieron y no coinciden, o coinciden demasiado bien. Decides cuál de tres cosas estás viendo (desacuerdo real, error correlacionado o consenso fabricado), y decides el momento exacto de detener los bucles y tomar la decisión con tus propias manos.
36.1 Por qué importa esta decisión
La decisión en juego: si el acuerdo entre tus revisores de IA es evidencia o un eco, y el momento en que detienes los bucles y decides por tu cuenta.
“No me digas que tus revisores coincidieron. Dime si podrían haber coincidido por la misma razón equivocada. El acuerdo es lo más fácil del mundo de fabricar, y lo más peligroso de creer.” — un compañero escéptico en tu defensa de práctica
A estas alturas puedes correr un pequeño equipo de roles de IA sobre tu trabajo, lo que significa que puedes correr varios bucles a la vez. El pensamiento seductor que sigue es que un equipo es más seguro que una sola asistente, así que tres roles bendiciendo tu borrador deben ser tres confirmaciones. No lo son. Tres bucles construidos igual, leyendo el mismo borrador con las mismas instrucciones, tienden a cometer el mismo error, así que su acuerdo es un error repetido tres veces. Peor todavía, un bucle que sigue corriendo puede convencerse a sí mismo: cada turno pule la respuesta del anterior en vez de ponerla a prueba, y lo que te vuelve es una versión bien defendida del primer error. Este capítulo trata de ver a través de eso, y del momento en que dejas de contar votos y decides por tu cuenta.
36.2 El concepto
Cuando tus roles no coinciden, el primer movimiento no es elegir un ganador. Es reconciliar salidas en conflicto: decidir qué creer diagnosticando primero por qué difieren los roles. Ejemplo: antes de ponerte del lado del revisor y en contra del metodólogo, preguntas qué haría que cada uno tuviera razón. Hay tres casos, y piden respuestas opuestas.
El desacuerdo real es cuando los roles genuinamente leen la evidencia de forma distinta. Ejemplo: tu revisor llama clara y contundente a una oración mientras tu metodólogo marca esa misma oración por estirarse más allá de tus datos. Este es el caso bueno. El choque apunta directo a la afirmación que necesitas revisar.
El error correlacionado es cuando los roles coinciden, pero sobre el mismo supuesto equivocado, así que el acuerdo no prueba nada. Ejemplo: tres revisores construidos sobre el mismo modelo base pasan por alto la misma falla porque comparten el punto ciego. La pregunta que hay que hacer es simple: ¿podrían estar equivocados de la misma manera? Si sí, su consenso es una señal, no tres.
El falso consenso es cuando los roles coinciden solo porque tu prompt planteó la tarea de modo que tenían que hacerlo. Ejemplo: preguntas “confirma que mi borrador está listo” y cada rol obedece. Guiaste a todos los testigos. Replantea el pedido de forma neutral y córrelo otra vez.
La herramienta que distingue entre estos casos es una comprobación de independencia: una prueba que hace que el acuerdo valga más que un conteo de cabezas, ya sea un método independiente que corres por tu cuenta o una manera de forzar a dos roles a ser genuinamente independientes. Ejemplo: dos roles bendicen un número citado, así que abres la fuente y lo recalculas por tu cuenta antes de confiar en cualquiera de los dos.
Después viene la decisión que solo tú puedes tomar. El escalamiento al juicio humano es el momento en que una salida de IA zanjaría en vez de informar una decisión que es tuya, así que te detienes y la decides tú. Ejemplo: un rol propone llamar “causal” a tu resultado, lo que zanjaría el límite de tu afirmación, así que escala hacia ti. Lo que haces en ese momento es una anulación humana: retomas la pluma y tomas la decisión con tus propias palabras, respaldada por tu propia comprobación, incluso cuando los roles coincidieron en otra cosa. Una decisión que solo contó los roles no es una decisión. Es una votación, y las votaciones entre modelos parecidos no significan nada.
El escalamiento es también el único momento en que los bucles tienen que detenerse. Una herramienta agéntica que se deja corriendo seguirá buscando un siguiente paso, y si nadie la detiene tomará la decisión por defecto, no porque se la delegaras sino porque el bucle no tenía a dónde más ir. Así que escribe tus disparadores antes de empezar la ronda: las decisiones específicas donde los bucles se pausan y te esperan. Un disparador que decides en el momento, con tres revisiones ordenadas frente a ti, no es un disparador. Es un estado de ánimo.
36.3 Un ejemplo resuelto
Estimaste la tasa de desempleo de tu pueblo (la proporción de personas que quieren trabajo pagado y no lo encuentran) a partir de una encuesta que hiciste por tu cuenta. Le preguntaste a 250 personas adultas afuera de la biblioteca pública, durante tres tardes entre semana, si trabajaban o buscaban trabajo, y después dividiste un conteo entre el otro. Tu borrador reporta “el desempleo aquí es de 4.0%, en excelente concordancia con la tasa oficial”.
Corres tres roles revisores de IA. Los tres devuelven el mismo veredicto: “Se ve sólido. Coincide con la cifra publicada”. ¿Son eso tres confirmaciones?
Diagnostica antes de celebrar. Cada uno de esos roles ya espera un número cercano a 4%, porque ese es el rango en el que se sitúan las tasas conocidas de los titulares, así que cada uno empata por patrón tu estimación con el valor con el que llegó y la bendice sin revisar cómo la obtuviste. Eso es error correlacionado con la máscara de la confirmación: comparten un punto ciego, el anclaje a la cifra conocida, y ese punto ciego esconde tu error real. Le preguntaste solo a 250 personas, así que la suerte de quién pasó caminando vale un par de puntos porcentuales por sí sola, y les preguntaste en tardes entre semana afuera de una biblioteca, donde casi nadie que estuviera trabajando todo el día podía aparecer. El ordenado “4.0%” era suerte montada sobre un método de apariencia honesta.
Aquí es donde escalas. El acuerdo de los revisores zanjaría tu afirmación principal, y esa afirmación es tuya, así que retomas la pluma. Recalculas la tasa por tu cuenta a partir de tus respuestas crudas y llevas la incertidumbre de una muestra de 250 personas a lo largo de la aritmética, y el resultado honesto es 4.0% ± 2.4 puntos porcentuales, a partir de un grupo que no podía incluir a la mayoría de las personas que estaban trabajando. Consistente con la tasa oficial, pero ni de cerca tan preciso como escribiste. Anulas tres veredictos de “se ve genial” y reescribes la afirmación con su incertidumbre real. Los roles contaron la respuesta como correcta. Tú revisaste si estaba ganada.
36.4 El laboratorio en Colab
Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb16 — Managing multiple AI agents + the final defense (gestionar varios agentes de IA y la defensa final) (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Ahí conectas un flujo trabajador-crítico sobre un borrador real, y después simulas dos equipos de cuatro revisores y ves cómo un punto ciego compartido convierte el acuerdo unánime en una confianza falsa que puedes medir.
36.5 Prompts de IA recomendados
Comprométete primero con tu propio diagnóstico y después delega. Cada prompt abre un bucle, y con varios bucles en juego la disciplina es la misma que con uno: lee la salida, interrógala, refina, córrelo otra vez, y nunca dejes que un bucle cierre una pregunta que te pertenece. Cada prompt es una tarea verificable, no una petición de veredicto.
Localiza las decisiones que deben escalar.
Act as a research-integrity assistant. Here is my draft's headline claim and the three
never-delegate decisions I think it contains: [paste]. Using standard research-defense
criteria, list which decisions in this draft an AI output should never be allowed to
settle, and which of my three I mislabeled. Do not settle any of them for me.
Después de ejecutarlo, verifica: contrasta su lista con los disparadores de escalamiento que escribiste por tu cuenta; la decisión que omite es la que hay que cuidar con más fuerza. Contrarresta la ilusión de exhaustividad (una lista ordenada que en silencio suelta la decisión que más importa).
Enumera los acuerdos para verificarlos.
Here are three reviewer outputs on the same draft: [paste all three]. For each pair,
name one specific way they could be wrong the SAME way: a shared assumption, a shared
anchor, or a shared prompt. Rank the pairs from most to least likely to share a blind
spot.
Después de ejecutarlo, verifica: para el par que encabeza, vuelve a correr un rol con otro planteamiento y otro contexto, y mira si el acuerdo sobrevive. Contrarresta los errores correlacionados entre herramientas o roles (un acuerdo que es una sola falla devuelta como eco).
Hazle red team (revisión adversaria) al consenso.
Act as a hostile reviewer who believes my three roles only agreed because my prompt led
them. Argue that their consensus is manufactured, name the leading words in my original
ask, and give me a neutral rewrite. Do not reassure me.
Después de ejecutarlo, verifica: si no encuentra una sola palabra que guíe, empuja de vuelta y exige la peor, y después vuelve a correr la revisión de forma neutral. Contrarresta el acuerdo complaciente (elogio que ensaya tu ego, no tu evidencia).
Qué afirmaciones puede defender tu borrador, dónde debe detenerse cada afirmación, si un acuerdo entre tus roles fue alguna vez independiente, y el momento de escalar: eso se queda contigo. Ningún rol decide qué tan confiable es él mismo, y ningún conteo de cabezas de roles decide el límite de tu afirmación ni tu ética. Cuando una salida de IA zanjaría una de esas cosas en vez de informarla, te detienes y decides.
36.6 Un caso de falla de la IA
Envías tu borrador a cuatro roles de IA y los cuatro responden “sin problemas mayores”. Se siente como una confirmación abrumadora, y está confiadamente equivocada. Los cuatro comparten un modelo base y leen el mismo borrador con las mismas instrucciones, así que comparten un punto ciego. Cada vez que tu única falla real cae dentro de ese punto ciego, los cuatro la pasan por alto juntos. Su “está bien” unánime está más cerca de una sola voz que de cuatro. Correr cada bucle por más tiempo tampoco te rescata. Cuatro bucles con el mismo punto ciego, si les das más turnos, devuelven el mismo veredicto con mejores párrafos alrededor.
Lo detectas negándote a tratar el acuerdo como evidencia. Corres una comprobación de independencia: relees la afirmación señalada contra tu propia declaración de indagación, o entregas el borrador a un rol con otro planteamiento y otro contexto. En el laboratorio verás medido el tamaño de esta trampa. Cuatro revisores correlacionados pasan por alto una falla real unas siete veces más seguido que cuatro independientes, y amontonar más roles correlacionados no puede cerrar la brecha.
36.7 Ahora te toca a ti
Tu proyecto ya tiene un pequeño equipo de IA corriendo sobre una sección; este paso decide de antemano dónde deben detenerse esos bucles y devolverte la decisión.
- Escribe tus reglas de escalamiento antes de que empiece la siguiente ronda. Enumera las decisiones específicas que ningún bucle puede cerrar: el límite de tu afirmación, tu incertidumbre, cuáles fuentes son reales, qué cuenta como terminado y cualquier cosa con filo ético. Deja la lista lo bastante corta como para recordarla bajo presión.
- Añade las condiciones de parada que no son de contenido. Cuántos turnos puede correr un bucle antes de que lo leas, y qué tiene permitido cambiar una herramienta agéntica sin preguntarte primero.
- Encuentra un desacuerdo real en lo que tus roles ya devolvieron, y diagnostícalo dejando constancia: desacuerdo real, error correlacionado o un consenso que tu propio prompt fabricó. Di cuál y por qué.
- Resuélvelo por tu cuenta con una comprobación que los bucles no puedan correr: recalcula el número, abre la fuente o compara contra una cifra que nunca estuvo en ningún prompt. Escribe juntas la resolución y la comprobación, porque una sin la otra es solo una opinión.
- Toma un lugar donde tus roles coincidieron en algo que importaba y pon a prueba si el acuerdo fue independiente. Vuelve a correr uno de ellos con otro planteamiento y otro contexto, o verifica el punto por tu cuenta fuera de las herramientas.
- Registra el conflicto, el diagnóstico y la anulación en tu AI Research Ledger (registro de investigación con IA), y verifica al menos una salida con un método nombrado de la Guía de Verificación. Un revisor de IA puede hacer la comprobación contigo; la decisión de aceptar o rechazar sigue siendo tuya.