21 Robustez y sensibilidad
Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.
La decisión de investigación. Tú decides la lista completa de verificaciones de robustez y sensibilidad que vas a correr, y la decides antes de mirar un solo resultado, y después las reportas todas. Mismo código, misma tabla, integridad opuesta: lo único que separa un hallazgo defendible de un recorte afortunado es el orden en que miras y decides.
21.1 Por qué importa esta decisión
La decisión sobre la mesa: qué versiones alternativas de tu análisis te comprometes a correr y a reportar, elegidas antes de ver ninguna de sus respuestas.
“Todo el mundo me muestra la versión del análisis que funcionó. Doy por hecho que esa existe. Mi pregunta real es qué pasó con todas las versiones razonables que podrías haber corrido en su lugar, y si las miraste antes o después de ver esta respuesta.” — una revisora de revista académica, abriendo la primera lectura seria que recibirá tu trabajo
Esa revisora no te está acusando de hacer trampa. Está nombrando un hecho llano sobre el análisis. Casi toda estimación real depende de decisiones que podrías haber tomado de otra manera, y cualquier decisión aislada puede favorecer el resultado. Si reportas solo la versión que funcionó, entregaste un número sin ninguna forma de distinguir una verdad delicada de un recorte afortunado. Este capítulo te da el hábito que responde la pregunta antes de que te la hagan.
21.2 El concepto
Una estimación no es un número. Es un número que depende de varias decisiones, y quien critica ataca las decisiones. Así que tú las atacas primero. Dos ataques con nombre hacen ese trabajo, y la gente los confunde todo el tiempo.
Una verificación de robustez consiste en volver a correr el mismo hallazgo bajo una decisión distinta pero igual de defendible, para ver si la respuesta se queda. Ejemplo: reportaste un valor promedio de pedido, así que también lo calculas después de eliminar la única cuenta que resultó ser un comprador mayorista, y confirmas que la historia se sostiene. Una verificación de sensibilidad, que en algunos campos llaman análisis de sensibilidad, consiste en cambiar a propósito un supuesto para ver cuánto se mueve la respuesta. Ejemplo: supusiste que el sistema de pago registró todas las compras, así que preguntas cuánto se desplazaría tu resultado si calladamente se le hubiera escapado un dos por ciento de ellas.
Los dos ataques apuntan al mismo blanco, la estimación principal: el único número que representa todo tu hallazgo. La atacas desde cuatro palancas, y todo plan honesto gira una o más de ellas. La muestra es qué datos conservas. La medición es cómo conviertes un concepto en un número. La especificación es el conjunto de decisiones de modelado detrás de la estimación. La métrica es la vara con la que reportas.
Girar todas las palancas a la vez y graficar los resultados da una curva de especificaciones: una imagen de una estimación bajo muchas decisiones defendibles, una al lado de la otra. Si la curva entera se queda de un solo lado del cero, tu dirección es robusta. Su dispersión es tu rango honesto.
El peligro tiene nombre. La búsqueda de especificaciones, cuyo nombre cotidiano es p-hacking, consiste en correr muchos análisis y reportar solo el que dio el resultado que querías, sin revelar la búsqueda. Su opuesto son las verificaciones prelistadas: escribir cada verificación que vas a correr, y comprometerte a reportarlas todas, antes de ver ningún resultado.
Esa distinción está bajo una presión nueva, y conviene que sepas por qué. Trabajar con un asistente de IA significa trabajar en un bucle de IA: el ciclo prompt → respuesta → interrogación → refinamiento → nueva ejecución, con herramientas agénticas que ya giran esos ciclos solas. Cada vuelta del bucle puede cambiar un filtro, una variable o un modelo, lo que significa que cada vuelta es una especificación nueva. Veinte vueltas son veinte análisis. Si seguiste re-preguntando porque el número decepcionaba, corriste una búsqueda de especificaciones y la herramienta no guardó ningún registro de eso por ti. Lleva tu propia bitácora de los ciclos, y tu plan prelistado sobrevive al contacto con el bucle.
21.3 Un ejemplo resuelto
Tu equipo prueba si un nuevo descuento de fidelidad sube el valor promedio de pedido, el monto promedio que gasta una clientela por compra. Tu titular: quienes recibieron la oferta del descuento gastan alrededor de un doce por ciento más que quienes no la recibieron. Antes de defender ese número, lo atacas desde las cuatro palancas.
- Muestra. Toda la clientela, o toda la clientela menos la única cuenta que resultó ser un comprador mayorista haciendo pedidos al por mayor por el sitio minorista, que es una exclusión legítima según tu definición de cliente, no una exclusión conveniente.
- Medición. El valor del pedido leído como el monto total cobrado, o leído con el envío y los impuestos descontados.
- Especificación. El gasto promediado sobre todas las personas a las que se les ofreció el descuento, o promediado solo sobre quienes efectivamente hicieron un pedido.
- Métrica. La ganancia en dólares, o la ganancia en porcentaje.
Prelistas las dieciséis combinaciones, las corres y graficas la curva de especificaciones. Todas vuelven positivas: el descuento ayuda sin importar qué decisión defendible tomes. La magnitud va de alrededor de más ocho por ciento a más quince por ciento. Así que el titular honesto no es “doce por ciento”. Es “mayor gasto en todas las especificaciones que corrimos, de aproximadamente ocho a quince por ciento”.
Después corres un ataque más, una prueba de placebo: divides en grupos falsos “A” y “B” a quienes recibieron la misma oferta y confirmas que la brecha entre ellos queda cerca de cero. Si una clientela idéntica mostrara una brecha, sería tu medición, y no el descuento, la que la estaría fabricando.
21.4 El laboratorio en Colab
Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb10 — Comparte la investigación y ataca el análisis (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Ahí vuelves a correr una brecha principal sobre una rejilla prelistada y lees su curva de especificaciones, ves cómo la búsqueda de especificaciones fabrica un resultado “significativo” a partir de datos sin ningún efecto real, y corres una prueba de placebo y una verificación de influencia dejando uno fuera sobre código con semilla fija, para que sientas la diferencia entre un hallazgo robusto y uno frágil.
21.5 Prompts de IA recomendados
Comprométete primero con tu propia respuesta, y luego delega. Cada prompt es un trabajo verificable, no una solicitud de veredicto.
Ubica las verificaciones estándar.
Act as a methods assistant for a two-group comparison of average customer spending.
Before any code, name the standard families of robustness and sensitivity checks for
this design and the four things I can vary to stress the estimate. Cite a real methods
reference you are confident exists; if you are unsure a source is real, say so.
Después de ejecutarlo, verifica: abre la referencia y confirma que las verificaciones y la fuente existen. Contrarresta la fabricación confiada (un método o una cita inventados llegan con la misma seguridad que unos reales).
Delega, con una lista que puedas verificar.
Here is my pre-listed robustness grid for one estimate: I vary the sample (all
shoppers / drop the wholesale account), the measurement (total charged / shipping and
taxes stripped out), the specification (averaged over everyone offered / averaged over
buyers only), and the metric (dollars / percent). Name up to three additional, equally
defensible specifications I did NOT list, and for each say which direction you expect
it to push the estimate.
Después de ejecutarlo, verifica: contrasta cada sugerencia con las cuatro palancas y agrega solo las que de verdad puedas correr con tus propios datos. Contrarresta la ilusión de exhaustividad (una rejilla ordenada que calladamente omite la única decisión que rompería la afirmación).
Haz red team (revisión adversaria) a tu rango.
Here is my claim: "higher spending in every specification we ran, by roughly 8 to 15
percent." Act as a hostile reviewer of a retail pricing study. Name the single worst
way this could be specification searching rather than robustness, and the one check
that would expose it. Do not rewrite the claim for me.
Después de ejecutarlo, verifica: corre contra tus propios datos la verificación que nombre; la falla es real solo si tus números la confirman. Contrarresta el acuerdo complaciente (elogios que revisan tu ego, no tu evidencia).
Tres decisiones siguen siendo tuyas. Tú decides qué verificaciones te comprometes a correr antes de mirar, qué problemas señalados confirman de verdad los datos y la afirmación final, con su rango y su límite, que defiendes. Un revisor, humano o de IA, propone. Tú verificas contra tus propios datos, y la evidencia decide.
21.6 Un caso de falla de la IA
Pegas tu rejilla de cuatro palancas y le pides a una IA que escriba tu sección de robustez. Vuelve un pasaje largo y bien organizado que corre la palanca de muestra, la de especificación y la de métrica, y cierra con “el resultado del doce por ciento es robusto en todas las especificaciones estándar”. Se lee minucioso y completo. La trampa es que nunca listó la palanca de medición, el monto total cobrado frente al monto con el envío y los impuestos descontados, y esa es precisamente la decisión que más mueve tu estimación. La sección parece exhaustiva mientras omite la única verificación que un revisor buscaría primero.
Lo detectas porque prelistaste tú las cuatro palancas antes de abrir la herramienta. Al leer su sección contra tu propia lista, notas que falta la medición, corres esa comparación y ves la estimación deslizarse hacia el extremo bajo de tu rango. Un pasaje que se ve completo no es lo mismo que uno que está completo. Contrastas su lista con la tuya, no con lo terminado que suena.
21.7 Ahora te toca a ti
Tu proyecto tiene un análisis que corriste con un asistente y un número principal que volviste a derivar por tu cuenta. Este paso intenta romper ese número antes de que un revisor tenga la oportunidad.
- Escribe tu estimación principal en una oración. Después lista sus cuatro palancas: la muestra que conservaste, la medición que elegiste, la especificación que ajustaste y la métrica que reportas. Para cada una, nombra una alternativa que podrías defender tan bien como la que elegiste.
- Prelista las verificaciones que vas a correr, al menos dos, apuntadas a las palancas que una lectura hostil atacaría primero. Escríbelas antes de correr ninguna, y comprométete desde ahora a reportarlas todas, salgan como salgan.
- Corre todas las verificaciones de tu lista. Reporta el hallazgo como una dirección más un rango, del tipo “positivo en las cuatro versiones, entre ocho y quince por ciento”, en vez del único número más amable.
- Agrega un placebo: construye grupos que sabes que son idénticos, corre el mismo análisis sobre ellos y confirma que la brecha queda cerca de cero. Si no, es tu maquinaria la que está produciendo el efecto.
- Vuelve a leer tu bitácora de ciclos con la IA y marca cada nuevo prompt que siguió a un número decepcionante. Toda versión que de verdad corriste pertenece al reporte, incluidas las que no te ayudaron.
- Registra el plan prelistado y sus resultados completos en tu AI Research Ledger (registro de investigación con IA), y verifica al menos una salida con un método nombrado de la Guía de Verificación. Una cacería de contraejemplos le queda bien a una afirmación de robustez: intenta honestamente construir una especificación defendible que invierta el signo, y si la encuentras, esa especificación va en tu reporte. Una IA revisora puede hacer la comprobación contigo; la decisión de aceptar o rechazar es tuya.