⚠️ Traducción en desarrollo. Esta edición en español aún no incorpora las revisiones más recientes y puede contener pasajes desactualizados. La edición en inglés es la versión de referencia.

37  Investigación final y portafolio de gestión de IA

WarningEn desarrollo

Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.

Open In Colab

La decisión de investigación. De todo lo que produjo tu proyecto, decides qué afirmaciones vas a respaldar en público, y armas el registro que muestra cómo dirigiste tu equipo de IA, qué mantuviste en tus propias manos y cómo se comprobó cada afirmación que sobrevivió.

37.1 Por qué importa esta decisión

La decisión en juego: sobre cuáles de tus afirmaciones aceptas el riesgo de equivocarte en público, y qué registro puedes mostrar de cómo las comprobaste.

“Para cuando te pares a defender, yo no cuento tus herramientas. Pregunto sobre qué afirmaciones aceptas el riesgo de equivocarte en público, y si puedes mostrarme que las comprobaste por tu cuenta.” — una examinadora de defensa, abriendo la carpeta que entregaste

Llegas a este capítulo con un proyecto completo detrás y una sola cosa por hacer: reunirlo en algo que puedas defender en voz alta. Meses de trabajo asistido por IA dejan un rastro de borradores, salidas de roles y comprobaciones a medio terminar. Dejado en una pila, nada de eso es defendible. La examinadora no leerá la pila. Preguntará qué afirmaciones son tuyas, dónde se detiene cada una y cómo lo sabes. Este capítulo es donde decides esas respuestas a propósito, antes de que la sala las decida por ti.

37.2 El concepto

Tu entrega final tiene dos mitades, y este capítulo construye las dos.

Un portafolio de investigación es el cuerpo reunido de tu trabajo terminado: tus afirmaciones, la evidencia detrás de ellas y la verificación que hace defendible a cada una. Ejemplo: para un proyecto de laboratorio contiene tu resultado principal, las mediciones que lo respaldan y la comprobación que corriste para confirmar que el número está bien.

Junto a él va un portafolio de gestión de IA, el registro honesto de cómo dirigiste tu equipo de IA desde la primera curiosidad hasta la última comprobación: qué tareas delegaste, dónde retomaste la decisión y qué llamadas nunca le entregaste a una herramienta. Ejemplo: muestra que un rol revisor redactó tus limitaciones, que lo anulaste cuando suavizó una afirmación que no podías sostener, y que solo tú elegiste el límite de la afirmación.

La decisión que cierra ambos es tu regla de parada, una declaración escrita de qué significa “terminado”, formulada alrededor de tu propia confianza verificada y no del acuerdo de las herramientas. Ejemplo: “me detengo cuando puedo defender cada afirmación sobreviviente ante alguien hostil con una comprobación que corrí por mi cuenta”. Una regla de parada de “cuando todos los roles coincidan” es una trampa, porque un equipo de herramientas parecidas puede coincidir en voz alta y equivocarse en conjunto.

Esa trampa tiene un nombre del que te vas a cuidar: el falso consenso, un acuerdo que existe solo porque las herramientas compartieron un punto ciego o porque hiciste una pregunta que guía. Ejemplo: les pides a tres revisores que “confirmen que mi borrador está listo”, y los tres obedecen, así que el coro no te dice nada. La cura es una comprobación de independencia, un paso que hace que el acuerdo valga más que un conteo de cabezas: una comprobación que corres por tu cuenta, fuera de las herramientas.

Todo esto termina en una defensa de la evidencia, una defensa pública y corta de tus afirmaciones en sus límites, seguida de preguntas para las que no puedes ensayar. Ejemplo: enuncias lo que encontraste, nombras exactamente lo que no afirmas y respondes cada pregunta desde tu propio registro.

37.3 Un ejemplo resuelto

Imagina un pequeño proyecto de biología vegetal. Pusiste a prueba cuántas semillas de un paquete de lechuga de verdad germinan, usando una prueba de germinación, un método estándar en el que colocas un número contado de semillas sobre papel húmedo con calor y luz constantes y después cuentas cuántas germinaron después de un número fijo de días. Tres bandejas de 50 semillas cada una dieron un promedio de 88% de germinación. Ahora eliges la afirmación que vas a defender.

Corres tres roles revisores de IA sobre tu borrador. Un rol revisor elogia tu oración titular, “La semilla de lechuga germina al 88%”. Un rol diagnosticador marca esa misma oración por estirarse más allá de tu evidencia: pusiste a prueba un paquete en tres bandejas, no la semilla de lechuga en general. Ese desacuerdo es un regalo, porque apunta directo a la decisión de límite. Retomas la pluma y reescribes la afirmación hasta lo que tus datos sostienen: “Este paquete, puesto a prueba en tres bandejas de 50, promedió 88% de germinación, con las bandejas entre 84% y 92%”. La oración más estrecha es la que vas a defender.

Después corres una comprobación de independencia que las herramientas no pueden fingir. La etiqueta del propio paquete declara una tasa de germinación de 85%, así que comparas a mano tu 88% contra ese valor. Los dos números caen cerca, y eso es tranquilidad real porque la etiqueta nunca fue parte de tu flujo de trabajo con IA. Tu regla de parada ya está satisfecha, así que te detienes. Al portafolio de gestión de IA entran cuatro cosas: los roles que corriste, el conflicto entre revisor y diagnosticador junto con tu anulación, esta regla de parada, y la comparación con la etiqueta que hizo que el acuerdo de tus revisores valiera más que un conteo de cabezas.

37.4 El laboratorio en Colab

Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb16 — Managing multiple AI agents + the final defense (gestionar varios agentes de IA y la defensa final) (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Ahí conectas un equipo trabajador-crítico, corres una simulación con semilla que muestra que cuatro revisores parecidos pasan por alto una falla real mucho más seguido que cuatro independientes, y después redactas las cuatro partes de tu propio portafolio y montas tu defensa de la evidencia.

37.5 Prompts de IA recomendados

Comprométete primero con tu propia respuesta y después delega. Cada prompt le da alcance a la herramienta, no la decisión, y cada uno abre un bucle en vez de terminar en una sola respuesta: lees lo que vuelve, empujas contra la parte más débil y lo corres otra vez. Cerrar el bucle es tu movimiento, no el de la herramienta.

Localiza el punto de referencia real.

Act as a research assistant in plant biology. I measured the germination rate of one
packet of lettuce seed. I want a published or label-stated reference value to compare
against. Give the value, the exact source it comes from, and a link. Only state a
figure you are confident is real; if you are unsure, say so and tell me where to
look.

Después de ejecutarlo, verifica: abre la fuente o lee por tu cuenta el paquete antes de confiar en el número (lectura de fuente primaria). Contrarresta la fabricación confiada, un valor de referencia citado con una fuente inventada.

Enumera cada afirmación para verificarla.

Here is my draft: [paste]. List every empirical claim in it as a table: the claim,
the number or measurement it rests on, and whether that claim stays inside my single
sample or reaches past it. Do not add any new claims.

Después de ejecutarlo, verifica: contrasta la tabla con tu propia lista de lo que mediste, y confirma que nada se estira más allá de tus datos sin estar marcado. Contrarresta la ilusión de exhaustividad, una lista ordenada que omite la única afirmación que se excede en silencio.

Hazle red team (revisión adversaria) a la defensa.

Act as a hostile but fair cross-examiner at a research defense. Here is my headline
claim, its boundary, and my two weakest verification steps: [paste]. Ask me the five
hardest questions you can, each tied to a specific claim or check. Do not soften them,
and do not answer them for me.

Después de ejecutarlo, verifica: si todas las preguntas son suaves o tu afirmación es llamada “bien respaldada”, empuja de vuelta y exige el eslabón más débil. Contrarresta el acuerdo complaciente, una compañera que ensaya tu ego en vez de tu defensa.

ImportantNo delegues

Las herramientas pueden redactar, revisar y sacar a la superficie preguntas difíciles. Nunca pueden decidir qué afirmaciones firmas con tu nombre, dónde debe detenerse una afirmación como “88% de germinación”, si tus revisores fueron alguna vez independientes, cuál es tu regla de parada, ni una sola palabra de la defensa pública. Cuando roles que coinciden bendicen una afirmación, decidir si ese acuerdo es real o solo correlacionado es tuyo. También lo es la respuesta que das cuando la sala pregunta cómo lo sabes.

37.6 Un caso de falla de la IA

Envías tu borrador terminado a tres roles revisores y le pides a cada uno que “confirme que está listo para entregar”. Los tres devuelven el mismo veredicto: “Se ve sólido, sin problemas mayores”. Se siente como tres confirmaciones. Es una. Los tres roles corren sobre el mismo modelo base, les diste el mismo prompt que guía, y comparten un punto ciego: ninguno señala que tu número titular no lleva incertidumbre, ningún rango entre tus tres bandejas. Eso es falso consenso, y confiar en él mandaría a tu defensa un resultado excedido.

Lo detectas con un replanteamiento y una comprobación que las herramientas no pueden ver. Primero sueltas el pedido que guía y corres uno neutral: “Enumera las tres afirmaciones más débiles de este borrador y por qué”. Ahora un rol nombra el rango faltante. Después dejas las herramientas por completo y recalculas por tu cuenta la dispersión de tus bandejas, lo que te entrega el límite de 84% a 92% que todos los revisores se saltaron. La lección es directa: un acuerdo vale solo lo que vale la independencia detrás de él. Cuenta las comprobaciones que corriste por tu cuenta, nunca los roles que asintieron.

37.7 Ahora te toca a ti

Tu proyecto ya tiene una nota, una cápsula, un equipo de IA gestionado y reglas de escalamiento que escribiste; este último paso reúne todo eso en el artefacto de investigación que entregas y en la defensa que das.

  1. Termina el artefacto de investigación en sí: tu artículo, tu nota o tu póster, con cada afirmación enunciada en su límite y tu incertidumbre en la misma oración que tu número titular. Este es el documento que lleva tu nombre.
  2. Arma tu portafolio de gestión de IA en cuatro partes: la descomposición de bucles que corriste, un conflicto real y la anulación que hiciste con su comprobación sin IA, tu regla de parada y tu lista de no delegar, y una comprobación de independencia que hizo que un acuerdo valiera más que un conteo de cabezas.
  3. Escribe tu regla de parada como una oración que podrías leer en voz alta, formulada alrededor de lo que has verificado y no de lo que tus herramientas aprobaron. “Cada afirmación sobreviviente tiene una comprobación que corrí por mi cuenta” es una regla de parada. “Los revisores coincidieron” no lo es.
  4. Ensaya la defensa en tres movimientos: tu afirmación y su límite, la decisión central que tomaste y el camino que no seguiste, y la verificación con la que encabezas. Después pide que alguien te haga la pregunta que menos quieres que te hagan.
  5. Lee el artefacto completo una vez más contra tu registro y corta todo lo que no puedas rastrear hasta una comprobación. Lo que quede es lo que puedes defender.
  6. Cierra el registro con la última entrada, y verifica tu afirmación principal una vez final con un método nombrado de la Guía de Verificación. Un revisor de IA puede hacer la comprobación contigo; la decisión de aceptar o rechazar sigue siendo tuya.

Ese es el libro entero. Empezaste con una curiosidad que todavía no podías responder, y ahora tienes una investigación terminada, un registro de cada herramienta que la tocó y un conjunto de afirmaciones que puedes defender en sus bordes. Las herramientas fueron rápidas. El criterio fue tuyo todo el camino, y esa es la parte que lo vuelve tu trabajo.