⚠️ Traducción en desarrollo. Esta edición en español aún no incorpora las revisiones más recientes y puede contener pasajes desactualizados. La edición en inglés es la versión de referencia.

6  Preguntas descriptivas, predictivas y causales

WarningEn desarrollo

Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.

Open In Colab

La decisión de investigación. Dónde se ubica tu pregunta en la brújula de la indagación: qué tipo de respuesta quiere (descriptiva o causal) y hasta dónde tiene que llegar esa respuesta (los datos a la mano, una población, o casos que no has visto). Tú la ubicas, y defiendes la ubicación por la respuesta que la pregunta de verdad quiere, no por las palabras que le tocó cargar.

6.1 Por qué importa esta decisión

La decisión sobre la mesa: qué tipo de respuesta quiere tu pregunta, y para qué unidades tiene que valer esa respuesta.

Quien dirige tu tesis lo pone claro en la primera reunión de comité: “Antes de aprobar un solo método, te hago responder dos preguntas sobre tu pregunta. ¿Qué tipo de respuesta quiere, y para quién tiene que valer esa respuesta?”. Todo lo que viene después cabe dentro de la caja que dibujan esas dos respuestas. Clasifica mal tu pregunta y cada método posterior apuntará al blanco equivocado, porque un método que describe lo que hay no puede decirte qué cambiaría una intervención. La brújula fija qué puede afirmar tu evidencia antes de que gastes meses recolectándola.

6.2 El concepto

Todo proyecto se estrecha hasta una pregunta de investigación: la única oración que la evidencia puede responder y sobre la cual puede equivocarse, como “¿una segunda caja acorta la fila?”. Antes de elegir un método, clasificas esa pregunta en la brújula de la indagación, el mapa que ordena cualquier pregunta según exactamente dos cosas. La brújula está adaptada de Research Design in the Social Sciences (Blair, Coppock y Humphreys, 2023, cap. 7).

El primer eje es el tipo. Una pregunta descriptiva pregunta qué es o qué fue el mundo, sin necesidad de intervenir; miras y registras, como en “¿qué fracción de quienes cursan primer año se salta el desayuno?”. Una pregunta causal pregunta qué cambiaría si alguien interviniera, lo que obliga a una comparación con un mundo que no ocurrió, como en “¿un desayuno gratis aumenta la asistencia?”.

El segundo eje es el alcance: para qué unidades tiene que valer la respuesta. Datos a la mano significa solo las unidades que efectivamente observaste. Una población significa un grupo más grande al que tu muestreo llega, más allá de los datos. Casos no vistos significa unidades que todavía no has observado, por lo general futuras.

Cruzar los dos ejes da cuatro nombres conocidos. Descripción es descriptiva sobre los datos a la mano. Generalización es descriptiva sobre una población, y tiene que pagar su alcance con un diseño de muestreo que permita a las unidades que viste representar a las que no. Predicción es descriptiva sobre casos no vistos; pronostica un caso nuevo a partir de un patrón. La predicción sigue siendo descriptiva, no causal: adivinar quién va a desertar no es lo mismo que saber qué hace que deserte. Razonamiento causal es el tipo causal, la única posición que se gana la palabra “porque”.

Esos cuatro nombres son etiquetas, no cajas que respondan nada por ti. Las preguntas causales también tienen alcance, y el alcance cambia lo que estás preguntando. Puedes querer el efecto para las unidades que estudiaste, el efecto para una población más amplia que tu muestra representa, o el efecto dentro de un subgrupo con nombre. Son tres preguntas distintas con tres respuestas distintas, así que di cuál quieres. Ejemplo: el efecto de una segunda caja en los doce almuerzos que cronometraste no es la misma cantidad que su efecto en todos los almuerzos de día hábil del semestre.

Ahora la regla que mantiene honesta toda la brújula, y es la que más se rompe. Tus datos nunca cambian el tipo de la pregunta que hiciste. Una pregunta sobre lo que cambiaría una intervención sigue siendo causal aunque tu evidencia no pueda responderla. Cuando tu diseño no puede aislar esa respuesta, el estado honesto es actualmente no identificada: la pregunta sigue siendo causal y este diseño todavía no la alcanza. Ejemplo: quieres saber si una segunda caja recorta la espera, pero los gerentes solo la abren cuando la fila ya es larga, así que el gentío y las cajas se mueven juntos.

Cuando eso pasa, todavía tienes algo que reportar, y mantener tres etiquetas separadas te dice qué. La pregunta es lo que preguntaste, y su tipo lo fijan sus palabras: ¿una segunda caja recortaría la espera? La licencia es la razón del diseño por la que tu evidencia puede responderla, y aquí falta, porque el gentío decide qué mostradores reciben la caja. El resultado es lo que esta evidencia sostiene de todos modos: en los periodos que observaste, los mostradores con dos cajas tuvieron esperas más largas. Ese resultado es descriptivo, real y digno de constar. Queda junto a tu pregunta causal; no la reemplaza. En algunos diseños la licencia que falta es parcial, no ausente, y la evidencia aún puede estrechar la respuesta, acotándola o fijando su signo, sin clavarla.

Desde ahí tienes dos movimientos legítimos. Fortalecer el diseño hasta que sostenga una respuesta causal, o declarar deliberadamente una nueva pregunta descriptiva y registrar el cambio como una decisión tuya. Deslizarse en silencio entre las dos es como un proyecto termina afirmando más de lo que ganó.

Una duda que siempre aparece aquí: si mis datos no pueden responder una pregunta causal, ¿debería simplemente reescribirla como descriptiva?

Solo si una pregunta descriptiva es genuinamente lo que ahora quieres preguntar. Tu resultado actual puede muy bien ser descriptivo mientras tu pregunta causal sigue sin respuesta a su lado. Escribe “actualmente no identificada” junto a la causal, y luego decide entre rediseñar o cambiar de pregunta. Ambas salidas son respetables. Cambiar la pregunta en silencio y conservar la redacción causal no lo es.

Un último peligro. Una pregunta doble es una sola oración que en secreto hace dos preguntas de tipos distintos, como “¿qué tan común es el agotamiento, y lo causa el trabajo nocturno?”. No se puede responder como una sola, y el arreglo es partirla en dos preguntas limpias, cada una con su propia posición.

6.3 Un ejemplo trabajado

Empieza con una curiosidad cotidiana de negocios: “¿por qué la fila del café del campus es tan lenta al mediodía?”. Dale bordes y se vuelve un tema: el tiempo de espera en los mostradores de comida del campus. Ese único tema esconde cuatro preguntas distintas, una en cada posición de la brújula. Un resultado estándar en investigación de operaciones dice que el tiempo de espera trepa bruscamente cuando la clientela llega casi tan rápido como el mostrador alcanza a atender. Con ese telón de fondo, cronometras cuánto esperan doce personas para ser atendidas.

  1. “Entre estas doce personas, ¿cuál fue la espera promedio?”. Esto pregunta solo lo que dicen los números que registraste. Es descriptiva con alcance datos a la mano. Posición: Descripción.
  2. “A lo largo de toda la clientela de este mostrador durante el almuerzo entre semana, ¿cuál es la espera media?”. El mismo tipo descriptivo, pero la respuesta tiene que valer para una población que no mediste, pagada con un diseño de muestreo que hace que tus doce representen al resto. Posición: Generalización.
  3. “Llega alguien mañana al mediodía; ¿cuánto va a esperar?”. Sigue siendo descriptiva, porque solo necesitas un patrón que viaje hasta un caso que no has visto. Posición: Predicción. Pronosticas la espera sin saber por qué una fila en particular corre rápido o lento.
  4. “¿Abrir una segunda caja acorta la espera?”. Ahora el tipo cambia. Para responderla tienes que comparar la misma hora de almuerzo en dos mundos, uno con segunda caja y otro sin ella, y solo uno de esos mundos ocurre de verdad. Esa comparación imaginada es la firma de una pregunta causal. Posición: Razonamiento causal.

Un movimiento cierra la habilidad. Alguien del equipo ofrece lo que llama una sola pregunta: “¿qué tan largas son nuestras filas, y una segunda caja las acorta?”. Es doble: fusiona el promedio descriptivo de la pregunta 1 con la comparación causal de la pregunta 4, y ningún diseño único responde ambas. La partes, y cada mitad se queda con su propia posición.

6.4 El laboratorio en Colab

Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb02 — From curiosity to a research problem: descriptive, predictive, causal (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Ahí bajas tu propia curiosidad hasta una pregunta, ves cómo un clasificador ingenuo por palabras clave se deja engañar con un mazo de ocho preguntas, y ubicas tu propia pregunta en la brújula con la forma que vas a reutilizar cada vez que declares un diseño.

6.5 Prompts de IA recomendados

Comprométete primero con tu propia respuesta en todos los casos. Escribe tu clasificación antes de abrir la herramienta, para que su respuesta tenga algo tuyo con qué discrepar. Y trata un desacuerdo como el inicio de un bucle, no como un veredicto: si la herramienta asigna una posición distinta, pregúntale qué palabra de tu oración provocó esa lectura, reescribe la oración y pregunta de nuevo. Dos o tres pasadas suelen mostrar si la discusión es sobre tu redacción o sobre tu diseño.

Clasificar, después de haberlo clasificado tú:

Act as a research-methods tutor. I have already classified my question:
[paste your question and your own kind + reach]. For my question, give its
KIND (descriptive or causal) and REACH (data at hand, a population, or
unseen cases), name the single word that most influenced you, and say
whether answering it needs an intervention or only a pattern. Use a table.

Después de ejecutarlo, verifica (contrarresta el cambio silencioso de alcance): relee contra las dos definiciones la posición que devuelve, usando las palabras de tu pregunta y no los datos que por casualidad tienes. Si llama causal a tu pregunta, pregúntate si tu diseño puede aislar esa respuesta. Si no puede, el estado es causal y actualmente no identificada, nunca descriptiva.

Partir una pregunta que sospechas que es doble:

Here is a question I think secretly asks two things: [paste it]. Split it
into exactly two clean questions. For each half name its KIND and REACH. Do
not add any unit, outcome, or population that was not in my sentence.

Después de ejecutarlo, verifica (contrarresta la ilusión de exhaustividad): una partición ordenada puede dejar caer una mitad en silencio o colar una variable nueva. Confirma que las dos mitades juntas cubren tu oración entera y que ninguna agregó algo que tú no escribiste.

Hacerle red team (revisión adversaria) a tu propia ubicación:

Act as a hostile methodologist. Here is my question and the compass position
I assigned it: [paste both]. Argue the strongest case that I classified it
wrong. If you claim it is causal, name the method you would use and the one
assumption that method needs, in a table.

Después de ejecutarlo, verifica (contrarresta el acuerdo complaciente y el método plausible pero equivocado): el elogio sin objeción es una bandera roja, así que fuerza la objeción. Para cualquier método que nombre, revisa si tus datos de verdad pueden cumplir el supuesto que lista. Un supuesto que no puedes cumplir convierte un método seguro en uno equivocado.

ImportantNo delegues

Tres decisiones siguen siendo tuyas: qué problema vas a estudiar, cómo redactas tu pregunta, y a qué posición de la brújula pertenece. Una herramienta puede ofrecer una etiqueta, pero solo tú puedes decidir qué respuesta quiere de verdad tu pregunta, y solo tú puedes defender la ubicación cuando alguien la cuestione. Si todavía no puedes clasificar tu pregunta con limpieza, eso es un hallazgo, no un fracaso; una pregunta que no se deja sentar en una sola caja suele seguir siendo doble, y nombrarlo es avanzar.

6.6 Un caso de falla de la IA

Supón que tu proyecto solo registra tiempos de espera en mostradores que ya funcionan con dos cajas. Nunca se asigna nada; mides los mostradores tal como los encuentras. Le pides a un chatbot que clasifique “¿es una segunda caja una manera efectiva de recortar la espera?”. Lee la pregunta como causal, lo cual es correcto, y entonces reporta la diferencia entre mostradores llenos con dos cajas y mostradores más tranquilos con una como si fuera el efecto. Eso es fluido, bien formateado y equivocado, porque los mostradores que recibieron una segunda caja son justamente los llenos. El gentío empuja a la vez la caja y la espera, así que la comparación no carga ninguna respuesta causal.

El error de la herramienta no fue la etiqueta. Fue saltarse el paso entre una pregunta causal y una respuesta causal: mostrar por qué esta comparación aísla el efecto de la caja y nada más. Lo atrapas preguntando qué hace que un mostrador difiera de otro, y si eso mismo también mueve el tiempo de espera. Aquí lo mueve. Así que tu estado honesto es causal y actualmente no identificada, y ahora eliges a la vista. Puedes buscar un diseño que cargue la respuesta, como periodos de apertura sorteados, o un horario fijado de antemano por razones sin ninguna relación con el gentío esperado; un horario que sigue calladamente la hora del almuerzo es el mismo confusor con reloj. O puedes declarar una pregunta descriptiva que sí puedes responder, anotar que la cambiaste, y dejar de usar la palabra “efectiva”.

6.7 Ahora te toca a ti

Ya tienes un problema de investigación delimitado. Este paso decide qué tipo de respuesta está pidiendo, lo que fija qué se le permitirá decir a tu evidencia.

  1. Escribe tu problema de investigación como preguntas, tres o cuatro, cada una una oración que la evidencia podría responder y sobre la cual podría equivocarse. Los problemas casi siempre esconden más de una.
  2. Clasifica cada pregunta en los dos ejes, tipo y alcance, y nombra la posición. Al lado de cada una, escribe una línea de razonamiento basada en la respuesta que la pregunta quiere, no en las palabras que le toca usar.
  3. Caza las preguntas dobles. Cualquier oración con una “y” que esconda una segunda pregunta de otro tipo se parte en dos preguntas limpias, cada una con su propia posición.
  4. Elige tu pregunta principal, aquella alrededor de la cual se va a construir tu proyecto. Escribe una oración sobre por qué esa y no las otras, y una oración que nombre una afirmación que su posición te prohíbe incluso si la respuesta sale preciosa.
  5. Si tu pregunta principal es causal, describe el mundo de comparación que necesita: la versión de los hechos que no ocurrió y que tu diseño va a tener que sustituir. Luego di si tu diseño puede hacer esa sustitución. Si todavía no puede, escribe “causal, actualmente no identificada” y conserva la pregunta. Eso es un hallazgo sobre el diseño, no una razón para reetiquetar lo que preguntaste.
  6. Registra la ubicación en tu AI Research Ledger (tu registro de investigación con IA) y verifícala con un método con nombre de la Guía de Verificación. Una clasificación es un juicio, así que usa el razonamiento con pares: lleva a alguien por las dos definiciones y por tu argumento, y mira si sobrevive a su pregunta más dura. Si tu posición es causal, agrega una segunda revisión independiente dibujando un diagrama causal y confirmando que el efecto está realmente identificado. Una IA revisora puede correr cualquiera de las dos revisiones contigo; la decisión de aceptar o rechazar sigue siendo tuya.