9 Modelo, indagación, estrategia de datos y estrategia de respuesta
Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.
La decisión de investigación. Las cuatro partes de tu propio diseño, escritas antes de que exista dato alguno: un modelo del mundo, la única cantidad con nombre que quieres sacar de él, un plan de cómo llegan los datos y un plan para convertir esos datos en tu cantidad. Y luego la decisión más difícil: si esas cuatro partes de verdad apuntan a lo mismo.
9.1 Por qué importa esta decisión
La decisión sobre la mesa: las cuatro partes de tu diseño, y si las cuatro apuntan a la misma cantidad.
Imagina a la persona que lidera analítica leyendo tu diseño de una página antes de que le dediques meses. Su preocupación es simple: «Muéstrame el número exacto que buscas y después muéstrame que la manera en que recoges y procesas los datos de verdad puede llegar a ese número. Si esas dos cosas se separan, cada resultado que me traigas responde una pregunta que nunca hice». Un diseño que se salta este paso no es riguroso. Es una esperanza con buen formato. Lograr que las cuatro partes coincidan, sobre el papel, antes de que exista un solo dato, es el control de calidad más barato que vas a correr en tu vida.
9.2 El concepto
Todo diseño de investigación tiene las mismas cuatro partes. Este libro las llama MIDA, una letra cada una (por sus siglas en inglés: Model, Inquiry, Data strategy, Answer strategy).
- Modelo: tu retrato escrito de cómo podría funcionar el mundo, es decir, qué cosas existen y qué podría afectar a qué. Ejemplo: «la probabilidad de que una persona acepte una canción recomendada va de 0 a 1, y un recomendador nuevo podría empujarla hacia arriba».
- Indagación: la única cantidad exacta que quieres de ese mundo, nombrada antes de que lleguen los datos. Ejemplo: «el aumento promedio en la tasa de aceptación que el nuevo recomendador causa entre quienes escuchan».
- Estrategia de datos: tu plan de cómo llegan a existir los datos, es decir, a quién se muestrea y quién recibe cada condición. Ejemplo: «mandar al azar cada sesión al recomendador viejo o al nuevo, y registrar cada aceptación».
- Estrategia de respuesta: tu plan para convertir los datos en una estimación de la indagación. Ejemplo: «tasa de aceptación del grupo nuevo menos tasa de aceptación del grupo viejo».
Las cuatro no son una lista que llenas en cualquier orden. Tienen que alinearse, es decir, tus estrategias de datos y de respuesta de verdad tienen que alcanzar la indagación que tu modelo hace preguntable. Ejemplo de desalineación: una indagación causal («el aumento que el recomendador causa») servida por una estrategia de datos en la que quienes ven la versión nueva difieren sistemáticamente de quienes no. Lo que esa comparación entrega es una asociación, es decir, dos cosas que se mueven juntas sin prueba de que una causó la otra.
Lee eso con cuidado, porque es fácil sacar la lección equivocada. Alinearse no significa que tus datos puedan reescribir tu pregunta. La indagación sigue siendo causal; este diseño simplemente no la alcanza. Y la ausencia de aleatorización tampoco zanja el asunto: los diseños observacionales pueden cargar respuestas causales cuando traen un argumento de identificación defendido y adecuado al diseño, que es el tema entero de un capítulo más adelante. El diagnóstico honesto nombra la brecha: indagación causal, actualmente no identificada bajo esta estrategia de datos y de respuesta. Nombrar eso sobre el papel es todo el trabajo aquí.
9.3 Un ejemplo resuelto
Toma una empresa de streaming musical que está probando si un nuevo recomendador de reproducción automática aumenta la frecuencia con que quienes escuchan se quedan con la canción sugerida. Recorre las cuatro partes.
El modelo dice que cada persona tiene dos tasas de aceptación posibles, una con el recomendador viejo y otra con el nuevo, y que la nueva podría ser mayor, menor o igual. La indagación es la diferencia promedio entre esas dos tasas entre todas las personas que escuchan: un número, causal por su tipo. La estrategia de datos reparte al azar cada sesión entrante entre viejo y nuevo, de modo que nada sobre la persona decide qué versión recibe. La estrategia de respuesta calcula la tasa de aceptación en cada grupo y resta.
Ahora audita la alineación. La indagación pide una diferencia causada. El reparto aleatorio es lo que autoriza esa palabra, porque rompe cualquier vínculo entre quién es la persona y qué versión ve. Así que las cuatro partes coinciden. Contrasta con un atajo tentador: lanzar el recomendador nuevo a los usuarios nuevos y compararlos con los usuarios existentes que siguen con el viejo. Esa estrategia de datos ya no se alinea con una indagación causal, porque los usuarios nuevos y los existentes difieren en cosas que también mueven la tasa de aceptación. La indagación sigue siendo exactamente la que era: el aumento causado. Lo que cambia es la afirmación que esta evidencia sostiene, que cae de «causa» a «está asociado con», dejando la indagación en sí causal y actualmente no identificada. Misma pregunta, alineación rota.
9.4 El laboratorio en Colab
Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb04 — The anatomy of a research design: MIDA + declare → diagnose → redesign (la anatomía de un diseño de investigación: MIDA + declarar → diagnosticar → rediseñar) (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Allí construirás un pequeño mundo simulado, escribirás sus cuatro partes MIDA y verás qué le pasa a tu respuesta cuando una estrategia de datos deja calladamente de coincidir con la indagación.
9.5 Prompts de IA recomendados
Escribe primero tu propio borrador de cada parte y solo después pregunta. Comprometerte primero le da a la salida de la IA algo con lo que estar en desacuerdo. Y cuenta con dar más de una vuelta: redactas, lees la respuesta, corriges la única parte que salió mal, pegas tu corrección de vuelta y vuelves a preguntar. Ese es el bucle de IA: el ciclo prompt → respuesta → interrogación → refinamiento → nueva ejecución. Cada vuelta debería afilar la indagación hacia menos palabras, no hacia más.
Act as a research-design tutor. Here is my research question: [paste it].
Draft the four MIDA parts as a labeled list — Model, Inquiry, Data strategy,
Answer strategy. State the Inquiry as one exact quantity. Mark each part
"confident" or "guessing." Do not smooth over gaps.
Después de ejecutarlo, verifica: lee las palabras de la indagación redactada junto a las palabras de tu pregunta. ¿Coinciden el tipo y el alcance? Esto contrarresta el cambio silencioso de alcance (silent scope change), donde la herramienta responde una pregunta vecina más fácil que la que hiciste.
Act as a hostile methodologist. Here are my four MIDA parts: [paste them].
Name the single worst misalignment — a place where my data or answer strategy
cannot reach my stated inquiry. Give one concrete way my design fails, not
praise.
Después de ejecutarlo, verifica: contrasta la objeción con tu propia nota de alineación. Esto contrarresta el acuerdo complaciente (sycophantic agreement), donde la herramienta declara sólido un diseño porque tú lo propusiste.
Find one real, published study that used a design like mine to answer a similar
question. Give title, authors, year, and venue. If you are not confident it
exists, say so instead of inventing one.
Después de ejecutarlo, verifica: abre una base de datos de biblioteca y localiza el estudio exacto antes de citarlo. Esto contrarresta la fabricación confiada (confident fabrication), donde la herramienta devuelve una cita plausible de un artículo que no existe.
Tres elecciones siguen siendo tuyas. Qué mundo supone tu pregunta (el modelo, y por lo tanto qué podría confundirlo). Qué única cantidad quieres (la indagación, nombrada con tus palabras, no con la paráfrasis de la IA). Y si tus cuatro partes se alinean, y por lo tanto si el límite de tu afirmación es causa, solo está asociado con, o causal, pero todavía no identificada por este diseño. Ese tercer estado es una respuesta de verdad, y conservar tu pregunta admitiendo que el diseño no la alcanza es más honesto que encoger la pregunta para que quepa en los datos. Una IA puede redactar partes candidatas. Decidir que coinciden, y hacerte cargo de la afirmación que se desprende, es un juicio de investigación que no puedes ceder.
9.6 Un caso de falla de la IA
Pegas tu pregunta sobre streaming y pides el MIDA. La herramienta devuelve cuatro partes seguras y bien formateadas, y llama «riguroso» al diseño. Léelo con cuidado: escribió la estrategia de datos como «comparar usuarios nuevos con el recomendador nuevo contra usuarios existentes con el viejo», y dejó la indagación redactada como un aumento causado. Eso son dos fallas a la vez. La estrategia de datos es plausible pero equivocada (plausible-but-wrong-method), porque la antigüedad del usuario mueve la tasa de aceptación por su cuenta. Y el borrador presenta esa comparación como si respondiera a la indagación del aumento causado, un cambio silencioso de alcance (silent scope change) entre lo que la evidencia sostiene (una asociación) y lo que el texto afirma (una causa). La indagación puede conservar su redacción causal; lo que no puede es tomar prestada esta comparación como su respuesta. La atrapas de dos maneras: pon las palabras de la indagación al lado de la estrategia de datos y pregunta si de verdad hubo aleatorización, y luego dibuja el modelo como un diagrama y busca una flecha que vaya de «antigüedad del usuario» tanto a la versión vista como a la tasa de aceptación. Esa flecha abierta es el factor de confusión que el borrador fluido nunca mencionó.
9.7 Ahora te toca a ti
Tienes una pregunta y un vacío que puedes defender. Este paso los convierte en un diseño, en una página, en cuatro partes que tienen que coincidir entre sí.
- Escribe tu modelo en tres o cuatro oraciones de lenguaje llano. Qué unidades existen, qué podría afectar a qué, y qué puede variar. No hacen falta ecuaciones. Después dibújalo como cajas y flechas, aunque quede feo.
- Escribe tu indagación como una oración que nombre una cantidad: un promedio, una diferencia, una tasa, una proporción. Si necesitas la palabra «y» para enunciarla, tienes dos indagaciones. Elige la que defenderías primero.
- Escribe tu estrategia de datos: quién o qué se muestrea, de qué lista, y quién recibe cada condición, si es que hay condiciones. Di con honestidad si algo se aleatoriza o si el mundo asignó las condiciones por ti.
- Escribe tu estrategia de respuesta: la aritmética que convierte tus datos en tu indagación. Restar dos promedios cuenta. Aquí lo simple es una virtud.
- Audita la alineación por tu cuenta y escribe la oración que importa: «Como mi estrategia de datos es , la redacción honesta más fuerte de mi resultado es ». Si esa oración aterriza en está asociado con en lugar de causa, no fracasaste: encontraste temprano el límite de tu afirmación, que es justamente el punto.
- Registra el borrador en tu AI Research Ledger (registro de investigación con IA) y después verifica la afirmación de alineación con un método nombrado de la Guía de Verificación; tanto el razonamiento con pares como un diagrama causal encajan. Una IA revisora puede discutir contigo la desalineación; la decisión de aceptar o rechazar la objeción es tuya.