13 Investigación experimental descriptiva
Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.
La decisión de investigación. Una moneda al aire no decide qué tipo de pregunta hiciste. Tú decides si tu estudio aleatorizado está midiendo una propiedad que el mundo ya tiene o probando una intervención que implementarías, y nombras los artefactos que tu medición todavía tiene que descartar antes de que el número signifique algo.
13.1 Por qué importa esta decisión
La decisión sobre la mesa: si el número que reporta tu estudio aleatorizado es una propiedad que el mundo ya tiene, o un efecto que saldrías a provocar.
Imagina a quien te asesora deteniéndose en una sola línea de tu página de métodos. “Aleatorizaste”, te dice, “así que escribiste causa. Muéstrame primero la pregunta.” La asignación aleatoria se siente causal por reflejo, y ese reflejo es la trampa que este capítulo desactiva. Lo que fija el tipo de una pregunta es la pregunta, no el procedimiento. Dirige una moneda al aire hacia “¿qué cambiaría si implementáramos esto?” y tienes un estudio causal. Dirige esa misma moneda hacia “¿cuánto de esta propiedad hay en el mundo ahora mismo?” y tienes una medición. Etiqueta la segunda como si fuera la primera y afirmas de más. Prometes una palanca que tu evidencia nunca probó, y quien lee con cuidado deja de confiar en el resto de tu trabajo.
13.2 El concepto
Tres términos sostienen la idea. Conócelos uno por uno.
- Característica latente: una propiedad real que no puedes leer de forma directa, así que un diseño tiene que revelarla. Ejemplo: cuántos clics atrae la posición de una interfaz de búsqueda, al margen de qué tan bueno es cada resultado.
- Estímulo controlado: una versión de un prompt, un ítem o una configuración que fijas a propósito y asignas al azar, de modo que cualquier diferencia en la respuesta se atribuya a la versión y no a quién la recibió. Ejemplo: el mismo resultado mostrado en el lugar 1 para algunas sesiones y en el lugar 5 para otras, elegido al azar.
- El experimento como instrumento de medición: usar estímulos controlados asignados al azar para exponer una característica latente y reportarla como una descripción simple. El número que reportas es el estimando, la cantidad exacta que el diseño está construido para declarar, y aquí describe el mundo tal como está.
Una medición puede ser segura y aun así estar equivocada, porque el montaje mismo es uno de los ingredientes. Dos artefactos hacen casi todo el daño. Un efecto de demanda ocurre cuando las personas medidas adivinan qué buscas y se desplazan hacia ello; ejemplo: quienes notan que están en un estudio hacen clic con más cuidado del que tendrían en casa. Un efecto del instrumento ocurre cuando el aparato de medición o la redacción mueven la lectura por su cuenta; ejemplo: el lugar 1 muestra una miniatura más grande, así que el registro le acredita a la posición la atención que ganó la imagen. Ambos amenazan la validez de constructo, el grado en que tu número estima el concepto que querías y no algo cercano. Aleatorizar quién ve qué no hace nada contra un sesgo que golpea por igual a todas las unidades, y por eso estos se diseñan aparte.
13.3 Un ejemplo resuelto
Un equipo de streaming de música quiere precisar una propiedad latente de su estante “Recomendado para ti”: cuánto del conteo de reproducciones de una canción viene de dónde está colocada frente a qué tan bien coincide con quien escucha. Ese número no está impreso en ninguna parte, así que construyen un instrumento. Para una porción aleatoria de sesiones insertan una canción sonda fija, con audio idéntico y portada idéntica, y asignan su posición en el estante al azar entre seis lugares; luego registran la tasa de reproducción por lugar. Como la canción nunca cambia y el lugar se reparte al azar, la dispersión de la tasa de reproducción entre lugares aísla el tirón de la posición por sí sola. El estimando es la curva de atención del estante: cuánta atención acapara cada rango, descrita para estas sesiones.
Aquí es donde muerde la decisión. Dentro del estudio sí existe un efecto causal del lugar sobre los clics, pero la pregunta del equipo era descriptiva, y el reporte honesto lo dice así: “para estas sesiones, el lugar 1 atrajo alrededor del triple de reproducciones que el lugar 5, a igual calidad”. La frase prohibida es “promover canciones al lugar 1 triplicará sus reproducciones”, porque esa es una afirmación causal y accionable que el diseño nunca probó. Y antes de confiar siquiera en el número descriptivo, el equipo descarta dos artefactos: un efecto de demanda si la sonda parece un anuncio, y un efecto del instrumento si la portada más grande del lugar 1 o un registro atado al lugar infla el conteo. El rediseño muestra todos los lugares de forma idéntica y registra las impresiones del lado del servidor.
13.4 El laboratorio en Colab
Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb07 — Experimental descriptive research (investigación experimental descriptiva) (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Ahí lees un experimento de encuesta real como la medición de una actitud ya asentada, recuperas una prevalencia oculta con un experimento de lista que una pregunta directa no alcanza, y luego declaras, diagnosticas y rediseñas un experimento de medición para que un número construido sobre todo con artefactos de demanda y de instrumento vuelva a caer sobre el constructo que debía reportar.
13.5 Prompts de IA recomendados
Comprométete primero con tu propia respuesta y luego delega. Cada prompt de abajo termina con una comprobación que corres tú. Y trata cada uno como la jugada de apertura de un bucle de IA, no como un pedido de un solo tiro: el ciclo prompt → respuesta → interrogación → refinamiento → nueva ejecución. Lees la salida, discutes la parte más débil, afinas el prompt y lo vuelves a correr. Hoy las herramientas agénticas corren varias vueltas de ese bucle por su cuenta, lo que no retira tu comprobación. Solo significa que entre una comprobación y otra llega más salida.
Act as a literature scout. List three real, published experiments used to MEASURE
a latent characteristic (position bias in a ranking interface, a hidden prevalence,
a preference weight) rather than to test a deployable intervention. For each give
authors, year, venue, and the single quantity measured, in a table. Only include
work you are confident exists; mark any row you are unsure about.
Después de ejecutarlo, verifica: abre una base de datos y recupera cada estudio por tu cuenta; cualquier fila que no puedas encontrar en un minuto es una fabricación confiada (confident fabrication), así que elimínala.
Here is code that estimates an interface's attention curve as the difference in
play rate across randomly assigned slots: [paste]. Name every assumption this
estimator needs to be valid, and for each, one concrete way it could fail in my
logs.
Después de ejecutarlo, verifica: contrasta cada supuesto con tu procesamiento real; un estimador que suena estándar pero supone algo que tus datos rompen es un método plausible pero equivocado.
Act as a hostile measurement reviewer. Here is my construct and how I measure it:
[plan]. List every demand effect and instrument effect that could produce my number
even if the true value were different, and the redesign that rules each one out.
Después de ejecutarlo, verifica: compara la lista con el artefacto que escribiste tú primero; si el tuyo falta, esa salida ordenada acaba de reprobar la prueba de la ilusión de exhaustividad, así que devuélvelo a la lista.
Tres decisiones siguen siendo tuyas. Si tu indagación es descriptiva o causal, porque el tipo vive en las palabras de tu pregunta y ninguna herramienta puede leer tu intención. Si el diseño mide de verdad tu constructo y no algo cercano, que es un juicio sobre significado, no sobre código. Y qué artefactos estás en condiciones de firmar como descartados con tu nombre. Un socio de IA puede redactar, localizar y atacar. Tú declaras y defiendes.
13.6 Un caso de falla de la IA
Pegas tu resultado de la curva de atención en una herramienta de IA y le pides que escriba la frase de hallazgos. Devuelve algo fluido: “Mover canciones al primer lugar causa un aumento de tres veces en las reproducciones, así que el equipo debería promover sus mejores coincidencias al lugar 1”. Suena a triunfo, pero es un cambio silencioso de alcance: preguntaste cómo se distribuye la atención, y la herramienta respondió en silencio una pregunta causal y accionable sobre qué haría promover. Lo detectas poniendo su frase junto a la tuya, palabra por palabra. La tuya preguntaba cuánto tira la posición; su respuesta preguntaba qué hacer. Las señales son “causa”, “debería” y el “aumento” imaginado de una intervención que nunca corriste. Recházala y reescribe la afirmación acotada a las unidades que observaste.
13.7 Ahora te toca a ti
Tu diseño ya está declarado y diagnosticado. Este paso le hace una pregunta más estrecha: ¿tu estudio está midiendo una propiedad que el mundo ya tiene y, si es así, puede hacerlo con honestidad?
- Lee tu pregunta guía en voz alta y subraya el verbo. ¿Pregunta cuánto de algo ya existe allá afuera, o qué cambiaría si intervinieras? Escribe la respuesta en una línea. Esa línea decide si esta ruta es la tuya.
- Si lo es, nombra la característica latente que tu proyecto tiene que revelar, la propiedad que nadie publica en ninguna parte, y el estímulo controlado que asignarás al azar para revelarla.
- Escribe tu estimando en una oración: la cantidad exacta, para qué unidades, descrita tal como está. Debajo, escribe la oración causal que te prohíbes a ti mismo, la que empieza con “si nosotros”.
- Nombra el efecto de demanda y el efecto del instrumento que más temes, cada uno con el rediseño que lo descarta.
- Si esta ruta no es la tuya, corre igual los pasos 2 a 4 como ejercicio, tratando tu pregunta como si tuvieras que medirla en vez de intervenir. Lo que se rompe es tu evidencia de que la ruta que elegiste encaja mejor. Escribe eso en dos líneas.
- Registra el paso en tu AI Research Ledger (registro de investigación con IA) y verifica al menos una salida con un método nombrado de la Guía de Verificación. Una prueba de falsación encaja bien con este capítulo: fija el efecto verdadero exactamente en cero en una versión de juguete de tu diseño y confirma que tu instrumento reporta alrededor de cero. Una IA revisora puede hacer la comprobación contigo; la decisión de aceptar o rechazar es tuya.