⚠️ Traducción en desarrollo. Esta edición en español aún no incorpora las revisiones más recientes y puede contener pasajes desactualizados. La edición en inglés es la versión de referencia.

11  Investigación observacional descriptiva

WarningEn desarrollo

Este capítulo forma parte de un libro en desarrollo activo y todavía no ha pasado por la revisión del autor. El contenido puede cambiar a medida que avanza la revisión.

Open In Colab

La decisión de investigación. Por cuál grupo pueden hablar honestamente tus datos observados, y dónde cae exactamente la línea a partir de la cual una descripción de tu muestra ya no puede convertirse en una afirmación sobre una población más amplia. Tú trazas esa línea, y escribes la oración del otro lado que te niegas a decir.

11.1 Por qué importa esta decisión

La decisión sobre la mesa: por cuál grupo pueden hablar honestamente tus datos.

Imagina a alguien con responsabilidad en política pública leyendo tu informe antes de decidir si aplica a su ciudad. Su primera pregunta nunca es sobre tus cuentas. Es: «¿A qué grupo llegó realmente tu procedimiento?» Un resultado que describe calladamente a un grupo mientras dice hablar por otro es la falla más común del trabajo observacional: una estimación precisa, bien formateada y sobre el grupo equivocado. Este capítulo te prepara para nombrar el grupo al que llegan tus datos, y para rechazar la oración que lo cambia por un grupo que tus datos nunca tocaron.

11.2 El concepto

La investigación observacional descriptiva significa que observas y registras lo que hay sin cambiarle la experiencia a nadie, y después lo resumes. Ejemplo: sacas los registros de votación nominal de cada integrante de una legislatura y reportas con qué frecuencia cada quien cruzó las líneas de su partido. Nunca asignas un tratamiento, así que esta ruta puede describir, y con cuidado generalizar, pero no puede por sí sola decir que una cosa causó otra.

Cuatro grupos anidados mantienen honesta una descripción así. Imagina cuatro cajas, cada una más pequeña que la anterior.

  • Población objetivo: todas las personas sobre las que trata tu pregunta. Ejemplo: cada cliente al que un servicio de streaming le cobrará alguna vez. Es la caja más externa, el grupo que desearías poder estudiar.
  • Población accesible: la parte de la población objetivo a la que podrías llegar en principio, dados el tiempo y el costo. Ejemplo: los clientes que de verdad puedes contactar con una encuesta este trimestre.
  • Marco muestral: la lista concreta de la que extraes. Ejemplo: la lista actual de personas suscritas de la que saca tu herramienta de encuestas. Lo que no está en esa lista no puede ser muestreado.
  • Muestra: los clientes que efectivamente encuestas. La caja más interna.

Una afirmación es honesta solo cuando la caja que describe coincide con la caja que nombra. Dos procesos deciden en qué difieren las cajas. La selección es cualquier proceso, distinto del puro azar, que decide quién termina en tus datos. Ejemplo: una encuesta levantada a la salida de un solo comedor selecciona a quienes comen ahí al mediodía. La no respuesta son las unidades que extrajiste y que nunca te dieron datos. Ejemplo: de 500 personas contactadas, 300 responden, y las 200 calladas rara vez son una rebanada al azar. Cuando cualquiera de los dos procesos se relaciona con justo aquello que estás midiendo, tu resumen se aleja de la verdad, y ninguna cantidad extra de datos lo trae de vuelta. El tamaño achica el bamboleo de muestra a muestra. No le hace nada a una inclinación sistemática en a quién llegaste.

11.3 Un ejemplo resuelto

Un servicio de streaming por suscripción mide su tasa de errores de facturación, es decir, la fracción de clientes cuyo cobro mensual sale mal. Ejemplo: 2 cobros equivocados en 100 clientes es una tasa de errores de facturación del 2%. El equipo de analítica saca la lista actual de personas suscritas, envía por correo una encuesta corta a una extracción aleatoria de esa lista y cuenta cuántas reportan un cobro equivocado en el último año. La encuesta reporta 2%, y el titular se escribe solo: «el servicio tiene una tasa de errores de facturación del 2%».

Ahora recorre las cajas. La población objetivo es cada cliente al que el servicio le cobra. El marco muestral es la lista actual de personas suscritas, porque solo quienes están en esa lista reciben la encuesta. Aquí está la trampa: los clientes más golpeados por los errores de facturación, los que fueron cobrados dos veces o cobrados después de cancelar, son también los más propensos a haberse ido con frustración. Se sacaron a sí mismos del marco antes de que nadie los encuestara. Esto es selección por supervivencia, un filtro que conserva justamente a las personas con menos probabilidad de mostrar el problema que estás contando. Quienes siguen suscritos son el extremo satisfecho de la base de clientes, no una rebanada justa de ella.

Así que el 2% es honesto sobre una caja y deshonesto sobre otra. La afirmación autorizada es: «entre los clientes que siguen suscritos, la tasa de errores de facturación es del 2%». El ascenso silencioso, la oración que hay que rechazar, es: «la tasa de errores de facturación del servicio es del 2%». La tasa verdadera entre todas las personas facturadas es casi con certeza más alta, porque los clientes más golpeados ya se habían ido cuando salió la encuesta. Esa brecha entre la caja que mediste y la caja que nombraste es el tema de este capítulo.

11.4 Una simulación con semilla

El ejemplo resuelto sostiene que a quién alcanzas inclina lo que mides, y que una muestra más grande no arregla la inclinación. Puedes verlo suceder. Una semilla (seed) es un punto de partida fijo para el generador de números aleatorios: la misma semilla siempre reproduce las mismas extracciones, así que la figura de abajo es exactamente lo que obtendrás al correr este código en el cuaderno de acompañamiento. El código construye una población de 100.000 personas cuya edad media verdadera se conoce por construcción, extrae diez muestras aleatorias honestas de 500, y luego extrae una muestra por conveniencia del mismo tamaño a través de un canal que alcanza sobre todo a personas más jóvenes.

import numpy as np
import matplotlib.pyplot as plt

SEED = 464
rng = np.random.default_rng(SEED)

poblacion = np.clip(rng.normal(49, 17, size=100_000), 18, 90)
verdad = poblacion.mean()

medias_aleatorias = [rng.choice(poblacion, 500, replace=False).mean()
                     for _ in range(10)]

pesos = np.exp(-(poblacion - 25) ** 2 / (2 * 12 ** 2))  # joven = más probable
conveniencia = rng.choice(poblacion, 500, replace=False,
                          p=pesos / pesos.sum())

fig, ax = plt.subplots(figsize=(7.6, 2.9))
ax.scatter(medias_aleatorias, np.ones(10), s=60, color="#2a78d6", zorder=3)
ax.scatter([conveniencia.mean()], [0], s=60, color="#eb6834", zorder=3)
ax.axvline(verdad, color="#333333", ls="--", lw=1.2)
ax.text(verdad + .5, 1.55, f"media verdadera = {verdad:.1f}",
        color="#333333", fontsize=9)
ax.set_yticks([0, 1], ["Canal por\nconveniencia (n = 500)",
                       "Muestras aleatorias\n(n = 500)"], fontsize=9)
ax.set_xlabel("Edad media de la muestra (años)")
ax.set_ylim(-.7, 1.9)
plt.show()

Gráfico de puntos. Diez medias azules de muestras aleatorias se agrupan entre aproximadamente 47 y 51 alrededor de una línea discontinua en la media verdadera de 49,1. Una única media naranja del canal por conveniencia queda sola cerca de 33.

Diez medias de muestras aleatorias se agrupan alrededor de la edad media verdadera; la única media del canal por conveniencia queda muy por debajo.

Lee la figura como la leería una revisora. Las diez muestras aleatorias nunca coinciden exactamente: sus medias se reparten entre 47 y 51. Pero se agrupan alrededor de la verdad, y ese reparto es incertidumbre honesta y cuantificable. El canal por conveniencia tiene exactamente el mismo tamaño de muestra, y falla la media verdadera por unos dieciséis años. Nada en el punto mismo te avisa; se ve tan seguro como cualquier otro. Solo el procedimiento de muestreo te dice qué clase de punto tienes. En el cuaderno de acompañamiento, mueve el centro del canal (el 25 dentro de pesos) y corre de nuevo: la inclinación sigue al canal, nunca al tamaño de la muestra.

11.5 El laboratorio en Colab

Este capítulo tiene su propio cuaderno de acompañamiento: ábrelo en Colab con la insignia de arriba. El cuaderno reúne los prompts y el código del capítulo y termina con el espacio de trabajo Ahora te toca a ti, para que completes el paso del capítulo en tu proyecto sin salir de Colab. El laboratorio de aula completo detrás de este capítulo es el cuaderno del curso nb05 — Observational descriptive research (investigación observacional descriptiva) (abrir en Colab), parte del curso de acompañamiento presentado en el apéndice Para docentes. Allí tratarás un padrón electoral real como un mundo conocido, extraerás de él muestras aleatorias y un canal por conveniencia, y verás cómo las extracciones aleatorias se agrupan en la verdad mientras el canal por conveniencia falla la edad promedio real por casi doce años. Después correrás una prueba de estrés de no respuesta que muestra una estimación limpia alejándose de la verdad.

11.6 Prompts de IA recomendados

Comprométete primero con tu propia respuesta y solo después delega. Cada prompt de abajo te deja a ti el juicio y le entrega a la IA solo el trabajo de campo. Trabájalos como un bucle de IA (el ciclo prompt → respuesta → interrogación → refinamiento → nueva ejecución) en vez de como un solo tiro: la primera lista de grupos que se caen siempre es la obvia, y la respuesta útil suele llegar en la segunda o tercera pasada, después de que le dijiste a la herramienta qué grupo se le escapó y le pediste que lo intentara de nuevo con eso en mente.

Localizar. Encuentra respaldo metodológico real en vez de confiar en un párrafo.

Act as a research-methods assistant. List real, retrievable references on
survivorship and nonresponse bias in observational studies. For each, give
title, authors, year, and venue, and mark any you are not confident exist.

Después de ejecutarlo, verifica abriendo cada fuente en una base de datos de biblioteca antes de citarla. Contrarresta la fabricación confiada: una cita fluida de un artículo que no existe se ve idéntica a una real hasta que intentas recuperarla.

Listar para verificar. Convierte una preocupación vaga en una lista comprobable de quién se cae.

I am drawing a selection diagram for an observational study. My target
population is [X], my frame is [Y], my sample is [Z]. List each group that
drops out between target and sample, in a table, with whether their absence
pushes my estimate up or down.

Después de ejecutarlo, verifica mapeando cada grupo nombrado a un paso real de tu propio diagrama, y comprobando que el grupo que más temías esté en la lista. Contrarresta la ilusión de exhaustividad: una lista larga y ordenada que omite calladamente al grupo que más importa.

Red team (revisión adversaria). Haz que la IA ataque tu oración de límite en vez de elogiarla.

Here is a boundary sentence I wrote: "[your sentence]". Act as a hostile peer
reviewer. Name every place it over-reaches, under-states the bias, or hides the
direction of the drift. Do not rewrite it for me.

Después de ejecutarlo, verifica contrastando cada objeción con tus propios números e insistiendo si todas las objeciones son suaves. Contrarresta el acuerdo complaciente: una IA que llama «bien equilibrada» a tu advertencia revisó tu ego, no tu evidencia.

ImportantNo delegues

Tres decisiones son solo tuyas. Primera, de qué población trata realmente tu proyecto: la IA no conoce la intención de tu pregunta. Segunda, a qué marco puedes llegar honestamente, y por lo tanto la brecha de cobertura que tienes que declarar. Tercera, la línea de límite en sí: la oración exacta donde tu descripción se detiene y la afirmación poblacional que te niegas a hacer. Puedes pedirle a una IA que ataque esa línea, nunca que la trace por ti.

11.7 Un caso de falla de la IA

Le preguntas a un chatbot: «Mi encuesta a personas suscritas actuales muestra una tasa de errores de facturación del 2% en un panel grande. ¿Puedo reportar la tasa de errores de facturación del servicio como 2%?» Responde con plena seguridad: «Sí. Con una muestra tan grande, tu estimación es precisa y confiable». Esto está mal de dos maneras con nombre propio a la vez. Comete un cambio silencioso de alcance (silent scope change), ascendiendo calladamente «personas suscritas actuales» a «los clientes del servicio», y se apoya en la falacia de que una muestra grande cura una muestra inclinada.

Lo atrapas porque escribiste tu propia respuesta primero, y la tuya nombraba el marco: los clientes que siguen suscritos, no todas las personas a las que el servicio factura, así que el cambio se ve a simple vista. Después compruebas el mecanismo contra los datos. Los clientes con los peores errores de facturación cancelaron antes de que saliera la encuesta, así que la ausencia de datos se relaciona directamente con el resultado que cuentas. Un panel más grande de personas suscritas actuales solo estima con más precisión la tasa de error de las personas suscritas actuales. Nunca alcanza a quienes se fueron.

11.8 Ahora te toca a ti

Llegas con un diseño declarado y diagnosticado. Este es el primero de los capítulos de rutas, así que tu tarea ahora es o bien desarrollar tu diseño sobre esta ruta, o bien usarla para poner a prueba la ruta que elegiste.

  1. Decide en cuál caso estás. Lee las palabras de tu indagación. Si pregunta cuánto, cuántos, con qué frecuencia, sobre un grupo que vas a observar en vez de asignar, esta es tu ruta. Si pregunta por qué o qué pasaría si, no lo es, y entonces corres el ejercicio del paso 5.
  2. Si esta es tu ruta, escribe tus cuatro cajas, una línea cada una: población objetivo, población accesible, marco muestral y muestra. Sé concreto con el marco. Nombra la lista, base de datos o flujo real del que vendrán tus datos.
  3. Dibuja tu diagrama de selección: una flecha de cada caja a la siguiente, con el filtro que quita gente escrito sobre la flecha. Encierra en un círculo el filtro que más temes que tuerza a la vez a quién alcanzas y qué mides. Ese es el que vas a tener que declarar.
  4. Escribe las dos oraciones que definen tu afirmación. La primera es la afirmación poblacional que tu marco de verdad autoriza, enunciada con su incertidumbre. La segunda es el ascenso silencioso que tu diseño prohíbe, escrito completo para que puedas reconocerlo y rechazarlo cuando una persona coautora o una IA te lo devuelva.
  5. Si esta no es tu ruta, corre el ejercicio de clasificación. Escribe tu pregunta como si fuera una pregunta observacional descriptiva, nombra las cuatro cajas que necesitaría y di con precisión qué no podría decirte esa versión. La oración que no puedes escribir aquí es la razón por la que tu ruta elegida tiene que ganarse sus supuestos extra.
  6. Registra el trabajo en tu AI Research Ledger (registro de investigación con IA) y verifica la afirmación clave con un método nombrado de la Guía de Verificación; aquí encaja la simulación, porque la afirmación es sobre cómo se comporta un procedimiento de muestreo y no sobre un número fijo. Una IA revisora puede atacar contigo tu oración de límite; la decisión de sostener la línea o moverla es tuya.