Lógica y Pensamiento Científico

Correlación y causalidad

Bogdan G. Popescu

Tecnologico de Monterrey

Bienvenidos

Objetivos de aprendizaje

Panorama

  1. Decir qué afirma en realidad una afirmación causal — y por qué nunca se observa directamente.
  1. Deducir qué predice cada explicación rival — y nombrar la comparación que permitiría distinguirlas.
  1. Leer un estudio científico con ojo crítico: a quiénes se estudió, qué se midió, comparado con qué y cómo se seleccionó el resultado.

Ruta del día

Hacia dónde vamos hoy

  1. El problema de Hume: por qué la causalidad nunca se observa — y qué afirma en realidad una afirmación causal
  2. Correlación vs. causalidad: los cuatro sospechosos de siempre detrás de cualquier patrón
  3. La Auditoría de Inferencias: poner a prueba cada “por lo tanto” — más cinco patrones que no necesitan causa alguna
  4. Leer un estudio con ojo crítico: quién, qué, comparado con qué, cómo se seleccionó
  5. Los ejercicios

Repaso: las herramientas hasta ahora

Etapa Herramienta
Conocimiento Tipos de conocimiento; qué hace que un conocimiento sea científico
Argumentos Premisas, conclusiones, estructura del argumento
Lógica Validez, solidez, deducción vs. inducción
Modos de falla Falacias, información errónea, persuasión

Hoy pasamos de los argumentos a la evidencia: ¿qué ocurre cuando las premisas son afirmaciones empíricas sobre el mundo?

Uno de esos modos de falla lleva hoy la versión larga: la falsa causa“después” no es “por causa de.” Aprendieron a nombrarla. Hoy: cómo ponerla a prueba.

Parte 1: el problema de Hume

Por qué la causalidad siempre es una inferencia

¿Qué observamos en realidad?

2:00 p.m. — le duele la cabeza. Toma una pastilla.

3:00 p.m. — se siente mejor.

¿Por qué mejoró?

Observado e inferido

  • Observamos que a Sofía le dolía la cabeza.
  • Observamos que tomó una pastilla.
  • Observamos que después se sintió mejor.
  • No observamos que la pastilla cause la mejoría.
  • “La pastilla funcionó” es una inferencia — algo que añadimos.

El punto de Hume: observamos los hechos y el orden en que ocurrieron. El vínculo causal es algo que inferimos — la palabra porque no está en la observación.

Tres historias rivales

Una observación. Más de una historia que la produce.

La observación es idéntica bajo las tres. Por sí sola no discrimina entre ninguna.

Y esto es n = 1. Un solo episodio no puede separar estas historias. La ciencia es el problema de encontrar comparaciones que sí puedan.

La comparación que falta

No podemos correr los dos mundos con la misma Sofía. El efecto causal es una diferencia que nunca podemos observar directamente.

Efecto causal = lo que pasó menos lo que habría pasado si no. Todo lo que sigue trata de encontrar un sustituto creíble para esa segunda línea.

El reto de Hume

“Todos los razonamientos sobre cuestiones de hecho parecen fundarse en la relación de causa y efecto… las causas y los efectos no se descubren por la razón, sino por la experiencia.”

— Hume, Investigación, Sección IV

Tres afirmaciones que nadie ha visto ocurrir:

  • “Las redes sociales causan polarización” — ¿o son las personas ya polarizadas las que buscan los contenidos que les dan la razón?
  • “Las escuelas privadas forman mejores estudiantes” — ¿o admiten a los estudiantes que ya iban adelante?
  • “Fumar causa cáncer” — cierto. Y aun así nadie lo vio ocurrir nunca: esa flecha se ganó por comparación, no por observación directa.

Cada vez vimos un patrón — una conjunción constante, en la frase de Hume. La palabra causa es una inferencia — algo que nosotros añadimos.

Consecuencia: el patrón es real; la historia que contamos sobre él puede no serlo.

Parte 2: Correlación vs. Causalidad

Los cuatro sospechosos de siempre detrás de cada patrón

¿Qué es una correlación?

Dos variables están correlacionadas cuando se mueven juntas:

  • Suben las ventas de helado; suben las muertes por ahogamiento.
  • Los países que consumen más chocolate ganan más premios Nobel.
  • Los estudiantes que toman apuntes a mano sacan mejores calificaciones.

Una correlación es un hecho sobre los datos.

Toda correlación tiene cuatro sospechosos

X está correlacionada con Y. ¿Por qué? Reúnan a los cuatro de siempre antes de buscar más lejos:

  1. X causa Y — la historia a la que solemos brincar
  2. Y causa X — causalidad inversa
  3. Z causa ambas — una variable de confusión (variable oculta)
  4. El azar — coincidencia, sobre todo cuando uno mira suficientes cosas

Sospechoso 2: causalidad inversa

  • “Los empleados más felices son más productivos”. ¿O será que a los empleados productivos los ascienden, les pagan mejor, los elogian — y por eso se vuelven más felices?
  • “La presencia policial está correlacionada con el delito”. ¿La policía causa el delito — o la mandan a donde ya hay delito?

La prueba: apunten la flecha en ambas direcciones y digan cada historia en voz alta.

  • X → Y — ¿esa historia tiene sentido?
  • Y → X — ¿y esa otra también?

Si las dos historias funcionan, la correlación no puede decirles cuál es la verdadera.

Sospechoso 3: variables de confusión

Las ventas de helado y los ahogamientos suben juntos. ¿El helado causa ahogamientos?

El verano causa ambos: el calor impulsa la venta de helado y que la gente se meta a nadar.

La misma forma, en afirmaciones que sí podrían creer:

  • “Los países con más McDonald’s tienen mayor esperanza de vida.” — la riqueza produce ambas cosas.
  • “Quienes ven noticias en la tele votan más.” — la edad produce ambas cosas.
  • “Quienes toman vitaminas viven más.”el tipo de persona que toma vitaminas también hace ejercicio y va al médico.

Prueba: pregúntense “¿qué tercer factor podría producir ambas cosas?”

Sospechoso 4: el azar

Si todos aquí lanzan una moneda cinco veces, a alguien le saldrán cinco águilas. Esa persona no tiene ningún don — simplemente eran suficientes.

Con los datos pasa lo mismo:

  • El consumo de queso en EE. UU. va de la mano con las muertes por enredarse con las sábanas.
  • Las películas de Nicolas Cage por año van de la mano con los ahogamientos en albercas.

Nadie notó estas relaciones. Una computadora rastreó miles de bases de datos e imprimió los pares que por casualidad coincidían.

Chocolate y bodas

Un país, catorce años. Las dos líneas se mueven juntas casi a la perfección.

Nadie cree que el chocolate cause bodas. Entonces, ¿de dónde salió esta gráfica?

Veinte países

Esa gráfica era el País 13. Las mismas dos variables, en los otros diecinueve países, no muestran nada.

Busquen en suficientes lugares y alguno coincidirá. Prueba: “¿cuántos se compararon antes de mostrarme este?”

Parte 3: la Auditoría de Inferencias

Una herramienta para poner a prueba cada “por lo tanto”

El problema con “por lo tanto”

Los argumentos sobre evidencia esconden su paso más débil detrás de palabras inferenciales:

por lo tanto — así — esto muestra — esto prueba — esto descarta — esto es incompatible con — esto confirma

Estas palabras afirman que la evidencia sostiene la conclusión. No lo demuestran.

Ya se detienen en el “por lo tanto”: ¿conclusión? ¿premisas? ¿supuesto no dicho? Con evidencia, esa tercera pregunta tiene una respuesta fija — “y ninguna explicación rival encaja.” La auditoría es ese chequeo, ya crecido.

La Auditoría de Inferencias: cada vez que se topen con una de estas palabras, deténganse y pongan a prueba la lógica. Seis preguntas, una regla.

Encaja con las dos historias

Afirmación: la pastilla le quitó el dolor de cabeza a Sofía.

Evidencia: tomó la pastilla y una hora después ya no le dolía.

  • Historia 1: la pastilla funcionó.
  • Historia 2: el dolor se habría quitado de todos modos.

La evidencia encaja con las dos. Por sí sola no sirve para elegir.

La buena evidencia no solo encaja con una explicación — ayuda a elegir entre explicaciones que compiten. Ese es todo el trabajo de las seis preguntas que siguen.

Las seis preguntas de la auditoría

  1. ¿Cuál es la conclusión? ¿Qué intenta probar, rechazar o explicar quien escribe?
  2. ¿Cuáles son las premisas? ¿Qué hechos o supuestos sirven de evidencia?
  3. ¿Qué predeciría cada hipótesis? Anoten qué nos llevaría a esperar la hipótesis principal y la rival — antes de juzgar.
  4. ¿La evidencia coincide con la hipótesis que se rechaza? Si sí, el argumento no ha refutado nada.
  5. ¿La evidencia discrimina? ¿O el mismo patrón aparecería bajo varias explicaciones?
  6. ¿El patrón podría haber ocurrido de todos modos? Efectos de techo, regresión a la media, selección, cambio de composición, tendencias compartidas.

Ejemplo resuelto: la cafetería

Doce estudiantes se enfermaron después de la comida del martes. Esa misma semana había entrado al menú un platillo nuevo de pollo.

El encargado de la cafetería: “Imposible. Esta cocina lleva veinte años sirviendo comida sin un solo caso de intoxicación. Las enfermedades empezaron apenas este mes. Por lo tanto, el pollo no tiene la culpa.”

Suena como una buena defensa. Apliquen la auditoría.

Ejemplo resuelto: aplicando la auditoría

  1. Conclusión: el nuevo platillo de pollo no tiene la culpa.
  2. Premisas: veinte años sin un solo caso; las enfermedades empezaron este mes.
  3. ¿Qué predeciría la rival? Si el platillo nuevo causó el brote, esperaríamos… ningún caso antes de que apareciera y casos a partir de que apareció.
  4. ¿La evidencia coincide con la hipótesis que se rechaza? Sí — exactamente.

Los veinte años limpios del encargado son justo lo que predice “el platillo nuevo lo causó”. El “por lo tanto” está vacío.

Ejemplo resuelto: la lección

%%{init: {"theme":"base","flowchart":{"useMaxWidth":true,"curve":"basis","nodeSpacing":45,"rankSpacing":75},"themeVariables":{"fontSize":"20px"}}}%%
flowchart LR
  A["<b>Historia 1</b><br/>El platillo nuevo<br/>de pollo lo causó"] --> E
  B["<b>Historia 2</b><br/>Otra cosa nueva<br/>lo causó"] --> E
  E["<b>Lo que vio el encargado</b><br/>20 años limpios,<br/>luego 12 enfermos"]
  style A fill:#f9fafb,stroke:#64748b,stroke-width:1.5px,color:#1e293b
  style B fill:#f9fafb,stroke:#64748b,stroke-width:1.5px,color:#1e293b
  style E fill:#1e293b,stroke:#1e293b,color:#f9fafb
  linkStyle 0,1 stroke:#b44527,stroke-width:2.5px

Las dos historias predicen exactamente lo que vio. Su evidencia no puede elegir entre ellas.

La comparación que sí podría: los que comieron el pollo frente a los que comieron ahí y no.

Nunca preguntó qué predeciría la otra historia — sesgo de confirmación disfrazado de análisis de datos.

Trampa 1: efectos de techo

Mientras más cerca están del máximo, menos espacio queda para mejorar.

Un estudiante saca 50, luego 80, luego 90. El primer salto es de +30. El segundo, de +10.

El error: “el nuevo método de enseñanza dejó de funcionar.”

Mejorar más despacio no es una causa más débil. A veces simplemente queda menos por ganar.

Trampa 2: regresión a la media

Los resultados extremos son en parte reales y en parte suerte — y la suerte no se repite.

Sofía tomó la pastilla cuando el dolor estaba en su peor momento. Los dolores en su peor momento tienden a ceder, se haga lo que se haga.

El error: “la pastilla funcionó.”

Midan cualquier cosa en su extremo y la siguiente medición será menos extrema. Eso se ve exactamente igual que un tratamiento que funciona.

Trampa 3: selección

Quienes terminan en un grupo suelen ser distintos antes de que les pase nada.

Los estudiantes que se sientan en la primera fila sacan mejores calificaciones.

El error: “sentarse adelante sube la calificación.”

Pregunten quién acabó en ese grupo y si ya era distinto de antes. Nadie asignó esos lugares.

Trampa 4: cambio de composición

Un promedio puede moverse porque cambió el grupo, aunque nadie dentro haya cambiado.

El error: “están bajando los estándares.”

Ni un solo estudiante empeoró. El promedio cayó porque entraron diez estudiantes nuevos — antes de leer un promedio que se mueve, pregunten si sigue siendo el mismo grupo.

Trampa 5: tendencias compartidas

Dos cosas que suben con los años van a correlacionar — sean lo que sean.

El uso de smartphones subió de forma sostenida de 2000 a 2025. Los precios de la vivienda también.

El error: “los celulares encarecieron la vivienda.”

Antes de leer una tendencia como un vínculo, pregunten qué más se movía igual en esos mismos años. Casi todo.

El Chequeo Lógico Rápido

Tres preguntas para recordar

Por cada “por lo tanto” de un argumento, pregunten:

  1. ¿Qué se supone que prueba la evidencia?
  2. ¿Qué más podría producir esa misma evidencia?
  3. ¿Qué comparación distinguiría entre esas explicaciones?

Versión corta: ¿cuál es la afirmación? ¿qué más? ¿qué lo decidiría?

Si las dos historias predicen lo que observamos, la evidencia no puede decirnos cuál es la correcta.

Parte 4: leer un estudio con ojo crítico

¿Quién? ¿Qué? ¿Comparado con qué? ¿Cómo se seleccionó?

Un estudio es un argumento

Un estudio científico no es un hecho — es un argumento: premisas (datos, métodos) que sostienen una conclusión (hallazgos).

Así que todo lo que el curso ha enseñado sobre argumentos — más la Auditoría de Inferencias — aplica. Más cuatro preguntas para estudios:

  1. ¿A quiénes se estudió? — ¿podemos generalizar a partir de esta muestra?
  2. ¿Qué se midió en realidad? — ¿la medida captura la cosa?
  3. ¿Comparado con qué? — ¿qué nos dice que el tratamiento hizo la diferencia?
  4. ¿Cómo se seleccionó el resultado? — ¿la prueba planeada, o la que se vio mejor tras muchos intentos?

¿Quién? ¿Qué? ¿Comparado con qué? ¿Cómo se seleccionó?

Pregunta 1: ¿a quiénes se estudió?

  • Tamaño: las muestras pequeñas son ruidosas — el azar las mueve más lejos, en ambas direcciones.
  • Selección: ¿quién acabó en la muestra y quién nunca tuvo oportunidad? Una encuesta en línea sobre regular internet encuesta a… gente que está en internet.
  • Generalización: buena parte de la psicología estudia a universitarios occidentales, educados, industrializados, ricos y democráticos — y concluye sobre la humanidad.

Pregunten: quién está en la muestra, quién falta, y si la conclusión se extiende calladamente más allá de la gente que de verdad se estudió.

Pregunta 2: ¿qué se midió en realidad?

Una medida de algo no es la cosa misma.

  • La “felicidad” como una respuesta en una escala del 1 al 10.
  • El “delito” como el número de detenciones — que también mide cuánto estaba buscando la policía.
  • El “aprendizaje” como la calificación de un examen.

La prueba: si la medida se movió, ¿necesariamente se movió la cosa que de verdad nos importa?

Pregunta 3: ¿comparado con qué?

“El delito bajó 20% después de la política.”

  • ¿Comparado con el año anterior?
  • ¿Comparado con la tendencia que ya venía?
  • ¿Comparado con ciudades parecidas que no adoptaron la política?

Sin una comparación creíble, “después” no es “por causa de.”

¿Experimento u observación?

La comparación tiene que salir de algún lado.

Una moneda no opina sobre quién merece el tratamiento: los dos grupos quedan parecidos incluso en lo que nadie midió.

La aleatorización no es un adorno estadístico. Es lo más cerca de la fila que nunca podemos observar.

Pregunta 4: ¿cómo se seleccionó el resultado?

Veinte equipos de investigación prueban la misma idea. Dieciocho no encuentran nada.

Los dos que sí encontraron algo se publican. Los otros dieciocho van a un cajón.

Ustedes leen la literatura, ven dos resultados positivos y concluyen que el efecto es real. Nadie mintió. Nadie hizo siquiera nada raro.

La pregunta que hay que hacer: ¿cuántos análisis se intentaron antes de que apareciera este? El sesgo no requiere fraude — el filtro entre lo que se hace y lo que se lee simplemente no es neutral.

¿Y el financiamiento? Un conflicto de interés les dice que miren con más cuidado el diseño y el reporte — nunca, por sí solo, que el hallazgo sea falso.

Prueben lo suficiente

Supongan que no hay ningún efecto real.

Alguien prueba veinte resultados. Luego unos cuantos subgrupos. Luego unos cuantos modelos estadísticos.

Tarde o temprano uno se ve impresionante. Cada paso por separado parecía razonable.

El resultado es real en esta base de datos — que no es lo mismo que evidencia sobre el mundo.

Esto tiene nombre: p-hacking — probar muchos análisis y reportar los que salieron bien. Es la explicación por azar de la Parte 2, dentro de un solo estudio.

Los ejercicios

Nombren la rival. Nombren la comparación.

Para cada afirmación, las mismas tres preguntas que van a usar en todo lo demás: ¿qué se supone que prueba? ¿qué más podría producir ese patrón? ¿qué comparación las distinguiría?

  1. “Los estudiantes que van a asesorías sacan mejores calificaciones. Por lo tanto, ir a asesorías mejora las calificaciones.”
  2. “Las escuelas peor evaluadas en 2020 fueron las que más mejoraron para 2024. Por lo tanto, el programa de recuperación funciona.”
  3. “Los estudiantes que usan herramientas de IA sacan calificaciones más bajas. Por lo tanto, la IA daña el aprendizaje.”
  4. “El delito bajó 30% después de que entró la nueva alcaldesa. Esto prueba que sus políticas funcionan.”

Los ejercicios — respuestas

1. “Los estudiantes que van a asesorías sacan mejores calificaciones — por lo tanto las asesorías mejoran las calificaciones.”

  • Sospechoso principal: variable de confusión. La disciplina que te lleva a las asesorías también te lleva a hacer las lecturas.
  • La comparación: inviten al azar a la mitad del grupo. Comparen invitados con no invitados — nunca a quienes asisten con quienes no.

2. “Las escuelas peor evaluadas en 2020 fueron las que más mejoraron para 2024 — por lo tanto el programa de recuperación funciona.”

  • Sospechoso principal: regresión a la media. Quedar en último lugar requiere debilidad real más mala suerte, y la suerte no se repite.
  • La comparación: escuelas igual de mal evaluadas que no recibieron el programa. ¿Repuntaron lo mismo?

3. “Los estudiantes que usan herramientas de IA sacan calificaciones más bajas — por lo tanto la IA daña el aprendizaje.”

  • Aquí hay más de una rival. Selección: quienes ya venían batallando recurren a la herramienta. Causalidad inversa: quedarse atrás causa el uso de IA, no al revés. Medición: una calificación mide lo que premia la evaluación.
  • La comparación: estudiantes parecidos con acceso asignado al azar — o los mismos estudiantes antes y después de una regla que cambió el acceso.

4. “El delito bajó 30% después de que entró la nueva alcaldesa — esto prueba que sus políticas funcionan.”

  • Sospechoso principal: una tendencia compartida, más regresión a la media: la eligieron justo después de un pico.
  • La comparación: los mismos cuatro años en ciudades comparables que no cambiaron de alcalde.

Todas las respuestas tienen la misma forma: nombren a la rival y luego nombren la comparación que las distinguiría.

Hay afirmaciones con varias rivales a la vez. Es normal — la pregunta nunca es cuál falacia es esta, sino si la evidencia puede elegir.

Cierre

  • La causalidad nunca se observa — solo se infiere (Hume). Un efecto causal es una diferencia con un mundo que no llegamos a ver.
  • Toda correlación tiene cuatro sospechosos de siempre — y hay patrones que no necesitan causa alguna. La carga es discriminar, no embonar.
  • La Auditoría de Inferencias: deduzcan qué predice la rival antes de aceptar cualquier “por lo tanto”.
  • Un estudio es un argumento: a quiénes se estudió, qué se midió, comparado con qué, cómo se seleccionó el resultado.

Y la versión para llevarse: ¿cuál es la afirmación? ¿qué más? ¿qué lo decidiría?

Referencias

  • Hume, D. (2007). An enquiry concerning human understanding (P. Millican, Ed.). Oxford University Press. (Obra original publicada en 1748; Sección IV.)