3 Especificar, Delegar, Interrogar, Inspeccionar, Verificar, Documentar, Defender
Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.
La decisión de investigación. Cada vez que le entregas trabajo a una herramienta de IA, decides cómo se enruta ese trabajo: qué fijas antes de preguntar, qué abres y lees cuando vuelve la respuesta, y qué estás dispuesta o dispuesto a decir con tus propias palabras al final. Tu decisión en este capítulo es dejar de improvisar esa ruta y correr la misma lista de control de siete pasos siempre.
3.1 Por qué importa esta decisión
La decisión sobre la mesa: si cada delegación se improvisa, o si pasa por la misma lista de control fija todas y cada una de las veces.
“Muéstrame la comparación, no el número. ¿Quién vio cada versión, en qué días, y medida contra qué? Un aumento que no puedo reproducir es un rumor.” — una líder de analítica, leyendo la afirmación de que una nueva página de pago convierte mejor
Una herramienta ya puede escribir el código, ejecutarlo y entregarte un resultado ordenado de un solo aliento. Justamente por eso un hábito flojo es peligroso. Si pegas el resultado directo en tu trabajo, importaste una suposición y la firmaste con tu nombre. A esa persona que revisa no le importa qué tan segura sonaba la salida. Le importa una sola pregunta, y es la pregunta que toda persona que lea tu trabajo en serio terminará haciéndote:
¿Qué montaste, qué entregaste y cómo lo revisaste antes de creerlo?
Este capítulo te da un hábito que responde esa pregunta cada vez, para que nunca tengas que reconstruir la respuesta de memoria.
3.2 El concepto
SDIIVDD es una lista de control: siete pasos que corres cada vez que le entregas trabajo de investigación a una herramienta de IA, en el mismo orden, sin importar qué tan pequeña se vea la tarea. Un protocolo es solo una secuencia fija de pasos que corres siempre, para no saltarte nunca la revisión que importa. Ya conociste el resumen de tres palabras en el Capítulo 1: Pregunta, luego Verifica, luego Documenta. SDIIVDD es ese resumen desplegado en los pasos que realmente ejecutas, y el nombre es apenas la primera letra de cada uno: Especificar, Delegar, Interrogar, Inspeccionar, Verificar, Documentar, Defender.
Córrelo como quien pilotea corre la lista previa al vuelo. No porque haya olvidado volar, sino porque el punto que se habría saltado es el que muerde.
Los siete pasos, cada uno definido una vez y con un ejemplo:
- Especificar. Escribe la tarea exacta y tu propia respuesta esperada antes de preguntar. Ejemplo: “compara la conversión de la página de pago vieja y la nueva; espero que la nueva gane por unos pocos puntos porcentuales, no por la mitad, y las dos versiones tienen que medirse en los mismos días”.
- Delegar. Entrégale a la herramienta la pieza bien especificada. Delegar es asignar un pedazo de trabajo revisable, no tu juicio. Ejemplo: “trae los valores del índice de precios al consumidor de 2019 y 2025 y escribe el código que convierte mis precios a dólares de 2025”.
- Interrogar. Pregúntale al borrador qué está suponiendo. Ejemplo: “cuando reportas la participación electoral, ¿el denominador son las personas registradas o toda la población en edad de votar?”.
- Inspeccionar. Lee lo que la herramienta produjo de verdad, no su resumen de sí misma. Ejemplo: abre el script de análisis y mira qué pozos trata como controles, en lugar de confiar en el comentario que dice que los controles fueron excluidos.
- Verificar. Confirma el resultado con una revisión real e independiente antes de confiar en él. Ejemplo: recalcula a mano el ajuste por inflación a partir de los dos valores publicados del índice y mira si llegas al mismo número.
- Documentar. Registra la herramienta, la tarea, el prompt y cómo revisaste, en un registro que viaja con tu trabajo. Ejemplo: una fila del registro que diga que la herramienta escribió el script de conversión y que tú volviste a derivar a mano la tasa de una semana.
- Defender. Enuncia el resultado con tus propias palabras, con la herramienta fuera de la sala. Ejemplo: “la participación fue seis puntos más alta en estos distritos, entre las personas registradas, en esta única elección”.
Dos de estos siete siguen siendo humanos por bueno que se ponga la herramienta: Especificar (paso 1) y Defender (paso 7). Son los soportes humanos en los extremos, y todo lo que entregas queda a salvo entre ellos. Eso es lo que los convierte en decisiones que nunca se delegan, las llamadas que siempre son tuyas: qué estás preguntando en realidad, qué cuenta como una prueba justa y qué te autoriza a afirmar tu evidencia. Una herramienta puede correr la comparación por ti. Solo tú decides que la comparación fue lo bastante justa como para reportarla.
3.2.1 El bucle, y quién lo está corriendo
El medio de la lista de control no es una línea recta. El trabajo real con IA corre en un bucle: haces el prompt, lees la salida, la interrogas, refinas el prompt o el código, y lo corres de nuevo. Los pasos 2 a 5 son ese bucle, y una sola tarea puede mandarte a darle cinco vueltas. Dar vueltas no es señal de que lo estés haciendo mal. Una primera salida que no necesita una segunda pasada es rara, lo bastante rara como para que desconfíes un poco de ella.
Lo nuevo es que ahora la herramienta puede correr el bucle sin ti. Las herramientas agénticas planean la tarea, escriben el código, lo ejecutan, leen su propio error, reescriben y vuelven a ejecutar, muchos ciclos hacia adentro, y después te entregan un resultado limpio. Eso es una ganancia real de alcance. También significa que todo el interrogar e inspeccionar que habrías hecho entre ciclos nunca ocurrió, a menos que tú lo hayas exigido.
SDIIVDD es cómo mantienes el mando en cualquiera de los dos casos. Cuando tú corres el bucle, la lista te dice qué hacer en cada pasada. Cuando la herramienta corre el bucle, la lista te dice a qué obligarla: una especificación escrita antes del primer ciclo, el trabajo intermedio abierto y leído en vez de resumido, y una revisión independiente del número final, antes de que digas nada en tu propio nombre. Los ciclos se pueden automatizar. Los soportes de los extremos, no.
El ciclo también es donde la IA se gana su lugar como compañera de lluvia de ideas: pídele preguntas candidatas, explicaciones rivales, diseños que no habías considerado. Genera ampliamente con ella; la elección sigue siendo tuya.
3.2.2 La misma lista, en 126,000 conversaciones
Un equipo de investigación del Wharton Generative AI Labs preguntó si las tácticas corrientes de persuasión humana funcionan con un chatbot. ¿Podría una apelación a la autoridad, o un recordatorio de que todos los demás ya estuvieron de acuerdo, llevar a un modelo a atender una petición que fue construido para rechazar?
La respuesta de un modelo no es la misma dos veces, así que resolver esa pregunta exige correr cada prompt cientos de veces y comparar tasas en lugar de casos aislados. El equipo construyó una herramienta para hacer las corridas. En su primer estudio, a principios de 2025, la operaron a través de su interfaz web: escribir la versión simple de una petición, escribir la versión persuasiva, decir cómo debe juzgarse una respuesta, fijar cuántas veces correr cada una, y luego leer los resultados. Ese estudio cubrió 28,000 conversaciones con un solo modelo.
Para el seguimiento le describieron el experimento a un agente de programación de IA en lenguaje común y lo dejaron conducir la herramienta. El agente ofreció distintas maneras de redactar una condición, corrió pilotos, mandó el diseño completo a tres modelos a la vez, y leyó las respuestas crudas de vuelta para señalar las que rompían el patrón. El estudio publicado reporta 126,000 conversaciones, y las tácticas de persuasión subieron el cumplimiento de cerca de 35 por ciento a cerca de 51 por ciento.
Mira cuáles pasos cambiaron de manos. Configurar las corridas, lanzarlas en paralelo y dar la primera pasada a las transcripciones: todo delegado. Escribir la petición simple, escribir la persuasiva y decidir qué cuenta como que el modelo cumplió: nunca delegado, en ninguna de las dos versiones del estudio. El resumen que el propio equipo hace de lo que permaneció en sus manos nombra el primer y el último paso de este capítulo. Quien investiga, escribe el equipo, “sigue tomando las decisiones científicas, determinando qué pregunta vale la pena hacer, qué cuenta como una comparación justa, y si los resultados son significativos”.
Una cosa que este caso no muestra es que el agente haya hecho mejor la ciencia. La hizo más grande: más conversaciones, más modelos, más transcripciones efectivamente abiertas. Si la comparación fue justa, y si 51 por ciento significa lo que parece significar, eso sigue en manos de las siete personas cuyos nombres están en el artículo. La escala no es rigor, y una especificación que erraste se vuelve más cara cuanto más rápido corre.
El estudio: Lennart Meincke, Dan Shapiro, Angela Duckworth, Ethan R. Mollick, Lilach Mollick, Christophe Van den Bulte y Robert Cialdini, “Persuading large language models to comply with objectionable requests”, PNAS, 2026, doi:10.1073/pnas.2535868123. El relato del equipo sobre el trabajo con el agente de programación: “Prompting Research Itself”, Wharton Generative AI Labs, 2026.
3.3 Un ejemplo trabajado
Estás revisando si una nueva página de pago de una tienda en línea pequeña de verdad convierte mejor que la vieja. La tasa de conversión es la proporción de visitas que terminan en compra, así que 40 compras de 1,000 visitas es 4 por ciento. Mira correr la lista de control.
Especificar. Escribes primero tu expectativa: “la página nueva debería ganar por unos pocos puntos porcentuales como máximo, y las dos versiones tienen que medirse en los mismos días, sobre el mismo tipo de comprador”.
Delegar. Le pides a la herramienta que escriba el script que calcula la tasa de conversión de cada versión a partir del registro de sesiones y reporta la diferencia.
Interrogar. Preguntas: “¿qué supone tu cálculo sobre quién vio cada versión?”. Admite que juntó todas las sesiones del archivo.
Inspeccionar. Lees el script y luego los datos. La tienda corrió una rebaja en todo el sitio la primera semana, que llenó el sitio de cazadores de ofertas que miran y se van. La página nueva solo entró en línea en la segunda semana. El script le cargó a la versión A una semana entera de gente que solo miraba vitrinas y que la versión B nunca vio.
Verificar. Restringes ambas versiones a la segunda semana, cuando corrieron lado a lado, y recalculas. También confirmas que las dos versiones cuentan una compra de la misma manera.
Documentar. Registras el prompt, el arreglo y los números verificados.
Defender. Escribes: “entre quienes compraron y vieron cualquiera de las dos versiones durante los cinco días en que ambas estuvieron activas, la página nueva convirtió alrededor de 6 por ciento mejor. No la he probado durante una rebaja, y no he mirado el tráfico móvil por separado”.
La herramienta hizo el tecleo. Tú hiciste la investigación.
3.4 El laboratorio en Colab
Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb01 — Research in the age of AI: your arm, your RA, not your brain (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Ahí corres el protocolo en vivo: atrapas una cita fabricada recuperándola por tu cuenta, y después atrapas un resumen seguro que exagera un número que los datos nunca tuvieron. Ambos son los pasos Inspeccionar y Verificar bajo presión real.
3.5 Prompts de IA recomendados
Comprométete primero con tu propia respuesta y después delega. Cada prompt de abajo es un encargo revisable, no una petición de veredicto, y cada uno es el movimiento de apertura de un bucle, no la conversación entera.
Localizar el método estándar.
Act as a business-analytics assistant. I need to compare conversion rates for two
versions of a checkout page. Before any code, name the standard statistical test
for comparing two proportions and the exact library function that implements it,
citing the official documentation section. Only name functions you are confident
exist.
Después de ejecutarlo, verifica: abre la documentación oficial y confirma que la función y sus valores por defecto existen. Contrarresta la fabricación confiada (un nombre de función inventado llega con la misma seguridad que uno real).
Delegar, con una lista de control para verificar.
Write the script that computes the conversion rate for version A and version B
from this session log. Then return a table of every assumption your calculation
makes: which sessions are included and excluded, how you count a purchase, whether
both versions ran over the same days, and how repeat visits are handled.
Después de ejecutarlo, verifica: recalcula a mano la tasa de una versión para un solo día y revisa que coincida. Contrarresta el método plausible pero equivocado (un cálculo que en silencio compara condiciones desiguales).
Hacerle red team (revisión adversaria) a tu aumento.
Here is my claim: "the new checkout page converts about 6 percent better."
Act as a hostile reviewer. Name every way this comparison could be unfair or this
number could mislead. Do not rewrite the claim for me.
Después de ejecutarlo, verifica: si solo elogia la afirmación, insiste y exige el peor defecto, uno solo. Contrarresta el acuerdo complaciente (elogio que revisa tu ego, no tu evidencia).
Especificar y Defender nunca salen de tus manos. Tú decides qué pregunta responde la comparación, qué cuenta como una comparación justa y si los datos detrás de ella son honestos para la afirmación que quieres hacer. Eres dueña o dueño de la oración final, de su límite y de su incertidumbre. La herramienta puede calcular las tasas, pero no puede decidir que la prueba fue justa ni que la afirmación se ganó. Esas son tuyas.
3.6 Un caso de falla de la IA
Pides el análisis y la herramienta reporta, con total seguridad, que “la nueva página de pago convierte 50 por ciento mejor”. El número está mal, y el código que lo produjo corre sin un solo error. Aquí está la trampa: el script juntó todas las sesiones del registro. Los números de la página vieja incluyen la semana de rebaja, cuando el sitio estaba lleno de cazadores de ofertas que nunca pensaron comprar, y la página nueva solo existió después. La comparación le cargó a una versión una multitud que la otra jamás conoció.
Lo atrapas en Inspeccionar y Verificar. Leer el script muestra que nunca filtra por fecha. Restringir ambas versiones a los días en que de verdad corrieron lado a lado derrumba el “50 por ciento” a cerca de 6. Un visto bueno verde no es un resultado correcto. Verificas el número, no el párrafo sobre el número.
3.7 Ahora te toca a ti
Ya tienes una lista de tareas que dice qué estás dispuesta o dispuesto a delegar. Ahora delegas algo real, y mantienes el mando desde la primera palabra hasta la última.
- Elige una afirmación genuina y revisable de tu propia área: una tasa, un total, una comparación, cualquier cosa que una fuente o un cálculo pudieran zanjar. Escríbela como una sola oración.
- Especificar. Antes de abrir ninguna herramienta, escribe tu propia respuesta esperada y cómo se vería una manera justa de obtenerla.
- Delegar, Interrogar, Inspeccionar. Entrega la tarea. Pregúntale a la salida qué supone. Después abre lo que produjo de verdad, la fuente o el código o la tabla, en lugar de su resumen de sí misma. Espera varias pasadas por ese bucle, y anota qué cambió en cada una.
- Verificar. Corre una revisión independiente. Si la revisión y la salida no coinciden, no las promedies; averigua cuál está equivocada.
- Defender. Con la herramienta cerrada, escribe una oración que enuncie el resultado con tus propias palabras, y una oración que nombre qué no establece.
- Documenta la corrida completa en tu AI Research Ledger (tu registro de investigación con IA), nombrando el método de verificación que usaste de la Guía de Verificación y el paso donde atrapaste algo que la herramienta hizo mal. Una IA revisora puede correr la revisión contigo; la decisión de aceptar o rechazar sigue siendo tuya.