Pearson o Spearman en un TFG: cuál usar y cómo interpretarlo

Pearson o Spearman en un TFG: cuál usar y cómo interpretarlo
Tienes terminada la base de datos de tu TFG.
Quieres estudiar si dos variables están relacionadas.
Por ejemplo:
horas de sueño y ansiedad;
uso de redes sociales y autoestima;
satisfacción laboral y autonomía;
precio percibido e intención de compra;
motivación y rendimiento académico.
Abres SPSS.
Entras en correlaciones.
Y aparecen tres opciones:
Pearson.
Spearman.
Kendall.
Entonces buscas en internet y encuentras una regla aparentemente sencilla:
Si los datos son normales, Pearson.Si no son normales, Spearman.
El problema es que esta regla es demasiado simplificada.
Elegir correctamente entre Pearson y Spearman exige mirar también:
el tipo de variables;
la forma de la relación;
los valores extremos;
si la relación es lineal o únicamente monotónica;
y qué pregunta quieres responder.
Porque dos variables pueden no seguir una distribución perfectamente normal y aun así Pearson resultar útil.
También pueden ser perfectamente normales por separado y existir entre ellas una relación en forma de U para la que Pearson sea completamente engañoso.
La decisión correcta empieza antes de mirar el p-valor.
Empieza mirando:
los datos.
¿Qué es una correlación?
Una correlación cuantifica la relación existente entre dos variables.
Supongamos:
X = horas de estudio.
Y = nota.
Si los estudiantes que estudian más horas tienden a obtener notas mayores:
existe una relación positiva.
Si:
X = estrés.
Y = satisfacción.
y mayores niveles de estrés se relacionan con menor satisfacción:
existe una relación negativa.
Los coeficientes de Pearson y Spearman se expresan entre:
-1 y +1.
Un valor positivo indica que ambas variables tienden a moverse en la misma dirección.
Un valor negativo indica que cuando una aumenta, la otra tiende a disminuir.
Un valor próximo a cero indica poca asociación del tipo concreto que mide el coeficiente.
Y esta última frase es importante.
Porque:
r = 0 no significa necesariamente que no exista ninguna relación entre las variables.
Puede existir una relación:
muy fuerte
pero:
no lineal.
¿Qué es la correlación de Pearson?
La correlación de Pearson mide la intensidad y dirección de una:
relación lineal.
Se representa habitualmente mediante:
r.
NIST define precisamente el coeficiente de correlación como una medida de relación lineal entre dos variables. Una relación lineal positiva perfecta produce r = +1 y una relación lineal negativa perfecta produce r = -1.
La palabra más importante es:
lineal.
¿Qué significa relación lineal?
Una relación es aproximadamente lineal cuando puede representarse razonablemente mediante:
una línea recta.
Ejemplo:
A medida que aumentan las horas de estudio:
la nota tiende a aumentar de forma aproximadamente constante.
No significa que todos los puntos estén:
encima de una línea perfecta.
Los datos reales tendrán dispersión.
Pero una línea recta debería describir razonablemente:
la tendencia general.
NIST recomienda precisamente utilizar diagramas de dispersión para estudiar si dos variables presentan una relación lineal, no lineal o valores extremos.
Ejemplo de relación lineal positiva
Horas de estudio:
1, 2, 3, 4, 5.
Nota aproximada:
4, 5, 6, 7, 8.
A mayor X:
mayor Y.
Y el incremento resulta bastante regular.
Pearson podría representar bien:
esa relación.
Relación lineal negativa
Horas de estrés semanal:
aumentan.
Satisfacción:
disminuye aproximadamente de forma lineal.
Resultado posible:
r = -.58.
Eso indicaría una asociación lineal negativa.
¿Qué es Spearman?
La correlación de Spearman también estudia:
dirección e intensidad de una asociación.
Pero lo hace utilizando:
rangos.
Se representa habitualmente como:
ρ
o:
rₛ.
En lugar de trabajar directamente con la distancia exacta entre los valores originales:
convierte los datos en posiciones ordenadas.
Por ejemplo:
1.º.
2.º.
3.º.
4.º.
Después estudia la relación entre esos rangos.
IBM incluye Spearman entre sus correlaciones bivariadas y señala que puede utilizarse con variables cuantitativas o variables con categorías ordenadas.
La palabra fundamental de Spearman: monotónica
Spearman no exige necesariamente que la relación sea:
lineal.
Pero sí es especialmente útil cuando existe:
una relación monotónica.
¿Qué significa?
Que al aumentar X:
Y tiende siempre a moverse en una única dirección.
Puede:
aumentar.
O:
disminuir.
Pero no:
aumentar primero y disminuir después.
La Universidad de Texas explica Spearman precisamente en estos términos: el coeficiente resulta apropiado para estudiar relaciones monotónicas y puede resultar útil frente a determinadas relaciones no lineales y valores extremos.
Lineal y monotónico no son lo mismo
Toda relación lineal creciente es:
monotónica.
Pero no toda relación monotónica es:
lineal.
Ejemplo:
X:
1, 2, 3, 4, 5.
Y:
1, 2, 4, 8, 16.
Y aumenta siempre cuando aumenta X.
Pero no a un ritmo constante.
La relación tiene:
curvatura.
Es:
monotónica creciente.
Pero no perfectamente lineal.
Spearman puede representar muy bien ese orden creciente porque:
quien tiene mayor X también suele tener mayor Y.
Pearson puede seguir siendo alto en algunos casos, pero está midiendo:
linealidad, no monotonicidad.
La literatura estadística describe precisamente Spearman como una medida de asociación monotónica y Pearson como una medida de asociación lineal.
Un ejemplo donde ambos pueden fallar
Imagina:
X = nivel de estrés.
Y = rendimiento.
Con poco estrés:
rendimiento bajo.
Con estrés moderado:
rendimiento alto.
Con estrés extremo:
rendimiento vuelve a bajar.
Tenemos una forma:
∩
o:
U invertida.
Aquí:
Y primero aumenta
y después disminuye.
No es:
lineal.
Tampoco:
monotónica.
Pearson puede producir:
r ≈ 0.
Spearman también puede producir:
ρ ≈ 0.
¿Significa que estrés y rendimiento no están relacionados?
No.
Existe una relación clara.
Pero ninguno de los dos coeficientes la resume bien.
Por eso el gráfico de dispersión debería mirarse:
antes de elegir la correlación.
Pearson vs Spearman: diferencia fundamental
Puedes recordarlo así:
Pearson | Spearman |
Trabaja con valores originales | Trabaja principalmente con rangos |
Mide relación lineal | Mide relación monotónica |
Especialmente útil con variables cuantitativas | Puede utilizarse con variables cuantitativas u ordinales |
Más sensible a valores extremos | Menos sensible a la magnitud extrema de outliers |
Se representa con r | Se representa con ρ o rₛ |
Esto no significa que Spearman sea:
“Pearson peor”.
Ni:
“Pearson avanzado y Spearman básico.”
Responden a:
preguntas ligeramente diferentes.
¿Qué variables necesito para Pearson?
En términos prácticos, Pearson suele emplearse cuando tienes:
dos variables cuantitativas
y quieres estudiar:
su asociación lineal.
Ejemplos:
Edad.
Salario.
Horas de sueño.
Puntuación total de ansiedad.
Nota media.
Puntuación de autoestima.
Puntuación total de una escala.
IBM recomienda Pearson para variables cuantitativas simétricas y señala como supuesto inferencial clásico la normalidad bivariante.
¿Puedo hacer Pearson con una escala Likert?
Aquí necesitas diferenciar:
un ítem
de:
una puntuación total.
Pregunta individual:
¿Cuál es su satisfacción?
1 = muy baja.
2 = baja.
3 = media.
4 = alta.
5 = muy alta.
Eso es:
una variable ordinal con cinco categorías.
Utilizar Spearman suele resultar más natural.
Pero imagina una escala de:
20 ítems.
Sumas las respuestas.
Obtienes una puntuación:
20-100.
La puntuación total tiene muchos valores posibles y puede tratarse de forma diferente según:
el instrumento;
la distribución;
la tradición metodológica;
la pregunta.
No apliques una misma regla a:
un único ítem ordinal
y:
una escala compuesta.
¿Cuándo utilizar Spearman?
Puede resultar especialmente apropiado cuando:
las variables son ordinales;
existe una relación monotónica pero no lineal;
los valores extremos hacen que Pearson resulte poco representativo;
determinados supuestos del procedimiento de Pearson no resultan razonables.
Pero cuidado con esta frase:
“Si Shapiro-Wilk sale significativo, siempre Spearman.”
No es correcta como regla automática.
El error de Shapiro-Wilk
Imagina:
N = 500.
X e Y presentan:
pequeñas desviaciones de normalidad.
Shapiro-Wilk:
p < .001.
Diagrama de dispersión:
relación perfectamente lineal.
No existen:
outliers importantes.
Cambiar inmediatamente de Pearson a Spearman solo porque:
p < .05
puede ser demasiado mecánico.
La elección debe basarse en:
la naturaleza completa de los datos.
Normalidad univariante no es lo mismo que normalidad bivariante
Otro matiz importante.
Muchos estudiantes hacen:
Shapiro X.
Shapiro Y.
Ambos:
p > .05.
Y concluyen:
“Se cumple el supuesto de Pearson.”
Eso no comprueba directamente:
normalidad bivariante.
Además:
la linealidad
y:
los outliers
pueden ser todavía más relevantes para saber si Pearson representa bien la relación.
Por eso nunca deberías omitir:
el scatterplot.
¿Qué es un scatterplot?
En español:
diagrama de dispersión.
Colocas:
X
en el eje horizontal.
Y
en el vertical.
Cada participante se convierte en:
un punto.
Ejemplo:
Participante 1:
Sueño = 6 horas.
Ansiedad = 20.
Punto:
(6,20).
Participante 2:
Sueño = 8.
Ansiedad = 12.
Punto:
(8,12).
Cuando tienes:
100 participantes,
aparece una nube de puntos.
Esa nube te permite observar:
forma;
dirección;
outliers;
grupos extraños;
heterocedasticidad.
NIST considera el scatterplot una herramienta fundamental precisamente para estudiar relaciones lineales, no lineales y valores extremos.
Antes de calcular cualquier correlación: mira el gráfico
Supongamos:
SPSS:
r = .60.
Parece una asociación bastante importante.
Después miras el gráfico.
Descubres:
99 puntos sin prácticamente relación.
Y un único punto extremo:
muy arriba y muy a la derecha.
Ese único participante está generando:
gran parte de la correlación.
Ahora:
r = .60
ya no significa lo mismo.
Pearson es sensible a los outliers
Esto se debe a que utiliza:
los valores originales
y:
las distancias respecto de las medias.
Un valor extremo puede tener:
muchísimo peso.
IBM advierte expresamente que antes de calcular correlaciones deben revisarse los outliers porque pueden producir resultados engañosos.
¿Spearman soluciona cualquier outlier?
No.
Al trabajar con rangos:
reduce la influencia de la magnitud extrema.
Ejemplo:
Valores:
1, 2, 3, 4, 5.
Si 5 cambia a:
5.000,
su rango sigue siendo:
el mayor.
Por eso Spearman suele ser:
más robusto frente a valores extremos.
Penn State señala precisamente esta ventaja de trabajar con rangos.
Pero esto no significa:
“Tengo un outlier → utilizo Spearman y me olvido.”
Primero debes preguntar:
¿es un error?
¿es un valor real?
¿indica otra población?
¿cambia la forma de la relación?
Spearman no sustituye:
la limpieza y comprensión de los datos.
Error de entrada vs outlier real
Edad:
Probablemente:
error.
Quizá quería escribir:
No soluciones eso usando:
Spearman.
Corrige el error si puedes verificarlo.
Otro:
Ingresos:
300.000 €.
La mayoría:
20.000-50.000 €.
Puede ser:
completamente real.
No lo borres únicamente porque:
reduce tu p-valor.
¿Qué ocurre con variables ordinales?
Ejemplo:
Satisfacción:
1 = muy insatisfecho.
2 = insatisfecho.
3 = neutral.
4 = satisfecho.
5 = muy satisfecho.
La variable contiene:
orden.
Pero no podemos asegurar que la distancia subjetiva entre:
1 y 2
sea exactamente igual que:
4 y 5.
Spearman solo necesita utilizar:
el orden.
Por eso puede resultar especialmente natural para:
variables ordinales.
Spearman y empates
En datos ordinales aparecen frecuentemente:
empates.
Ejemplo:
50 participantes responden:
Todos ocupan:
la misma posición.
Los métodos actuales ajustan los rangos cuando existen empates.
No necesitas convertir manualmente:
cada respuesta
a:
ranking.
SPSS lo hace.
¿Qué significa el signo del coeficiente?
Tanto Pearson como Spearman pueden ser:
positivos
o:
negativos.
Positivo
r = .55.
Cuando X aumenta:
Y tiende a aumentar.
Negativo
r = -.55.
Cuando X aumenta:
Y tiende a disminuir.
El signo no indica:
bueno
o:
malo.
Solo:
dirección.
Ejemplo
Autoestima y ansiedad:
r = -.48.
No significa:
“correlación mala.”
Significa:
a mayores puntuaciones de autoestima tienden a aparecer menores puntuaciones de ansiedad.
¿Qué significa la magnitud?
Supongamos:
r = .10.
r = .30.
r = .50.
r = .80.
Cuanto más se acerca el valor absoluto a:
1,
más fuerte es la asociación lineal medida.
Pero no existe una clasificación universal válida para cualquier área.
Puedes encontrar referencias convencionales aproximadas como:
.10 pequeña;
.30 moderada;
.50 grande.
Pero el contexto importa muchísimo.
Una correlación de .20 puede ser importante
Ejemplo:
factor de riesgo aplicado a:
millones de personas.
Una asociación pequeña puede tener:
relevancia práctica.
Una correlación de .80 puede ser sospechosa
Dos escalas distintas:
r = .97.
Quizá realmente están:
midiendo casi exactamente lo mismo.
O:
una variable se construyó a partir de la otra.
No celebres cualquier correlación alta.
Pregúntate:
qué representa.
No conviertas los puntos de corte en fronteras
r = .29.
No es científicamente diferente de:
r = .30.
No escribas:
.29 = pequeña..30 = moderada.
La estadística no funciona mediante:
saltos mágicos.
Mejor describir:
el valor
y:
compararlo con estudios de tu campo.
¿Qué significa r²?
Para una correlación de Pearson en un contexto bivariado lineal puedes calcular:
r².
Ejemplo:
r = .60.
r² = .36.
Esto puede describirse como aproximadamente:
36 % de variabilidad compartida
dentro de la relación lineal simple.
Pero cuidado:
no significa:
X explica causalmente el 36 % de Y.
Correlación no establece:
dirección causal.
Ejemplo
Sueño y ansiedad:
r = -.50.
r² = .25.
Puedes hablar de:
25 % de varianza compartida en el contexto bivariado.
No:
“Dormir explica el 25 % de la ansiedad.”
Para hacer una afirmación causal necesitarías:
muchísimo más que una correlación.
¿Qué es el p-valor en una correlación?
Habitualmente se contrasta:
H0:
correlación poblacional = 0.
Ejemplo:
r = .42.
p = .002.
Existe evidencia estadística contra:
correlación poblacional igual a cero
bajo el modelo utilizado.
Pero:
p < .05
no significa:
correlación fuerte.
Puedes tener:
r = .08.
p < .001.
Con una muestra:
enorme.
Y puedes tener una correlación considerable no significativa
Ejemplo:
r = .45.
N = 15.
p = .09.
La estimación parece:
moderada.
Pero existe:
mucha incertidumbre.
Por eso resulta útil mirar también:
intervalos de confianza.
Intervalo de confianza de una correlación
Ejemplo:
r = .42.
IC 95 % [.18; .61].
La asociación estimada es:
positiva.
El intervalo te permite observar:
la incertidumbre.
Otro:
r = .42.
IC 95 % [-.08; .72].
Misma estimación puntual.
Pero muchísimo menos precisa.
SPSS permite actualmente solicitar intervalos de confianza tanto para Pearson como para Spearman.
¿Tengo que informar el intervalo?
Es una buena práctica cuando el software y la normativa de tu área lo permiten.
Aporta más información que:
r + p
únicamente.
Ejemplo:
Se observó una correlación positiva entre autonomía y satisfacción, r = .42, IC 95 % [.27; .55], p < .001.
Tenemos:
dirección;
magnitud;
precisión;
significación.
¿Correlación significativa significa causalidad?
No.
Este es probablemente el error más importante.
Encuentras:
r = .50
entre:
uso de redes sociales
y:
ansiedad.
Tres explicaciones posibles:
Mayor uso de redes aumenta ansiedad.
Mayor ansiedad lleva a utilizar más redes.
Una tercera variable influye en ambas.
Por ejemplo:
aislamiento social.
estrés.
edad.
IBM advierte expresamente que una correlación significativa no debe interpretarse automáticamente como relación causa-efecto.
También puede existir causalidad bidireccional
Variable A puede influir en:
B.
B puede influir en:
A.
Una correlación transversal no permite normalmente:
resolver esa dirección.
Por eso escribe:
Se observó una asociación...
No:
X provoca Y.
Pearson puede ser alto aunque la relación no sea causal
Ejemplo clásico:
ventas de helado
y:
ahogamientos.
Ambas aumentan:
en verano.
Existe una tercera variable:
temperatura.
La correlación por sí sola no identifica:
el mecanismo.
¿Pearson o Spearman si las dos variables son normales?
No respondas todavía.
Primero mira:
scatterplot.
Si la relación es:
aproximadamente lineal
y:
no existen outliers problemáticos,
Pearson puede ser apropiado.
Pero si la relación es:
claramente curva aunque monotónica,
Spearman puede representar mejor:
el orden.
La normalidad por sí sola:
no decide.
¿Pearson o Spearman si Shapiro p < .05?
Tampoco puedes responder automáticamente:
Spearman.
Pregunta:
¿qué tamaño tiene la muestra?
¿qué desviación existe?
¿hay outliers?
¿la relación es lineal?
¿las variables son cuantitativas?
No conviertas Shapiro en:
un interruptor.
¿Pearson o Spearman con datos ordinales?
Spearman suele ser:
una opción natural.
Ejemplo:
Nivel de acuerdo:
1-5.
Nivel de satisfacción:
1-5.
Los rangos conservan:
la información ordinal.
¿Pearson o Spearman con dos puntuaciones de escalas?
Depende.
Si son:
puntuaciones cuantitativas;
con suficiente rango;
relación lineal;
sin outliers graves;
y los supuestos inferenciales resultan razonables,
Pearson puede estar bien.
Si las puntuaciones presentan:
asimetría extrema;
outliers;
o la relación es monotónica pero no lineal,
Spearman puede ser más adecuado.
¿Pearson o Spearman con edad y satisfacción 1-5?
Edad:
cuantitativa.
Satisfacción:
ordinal.
Spearman puede ser una opción coherente.
No necesitas que:
las dos variables
sean ordinales.
¿Y Kendall?
IBM también ofrece:
tau-b de Kendall.
Kendall es otra correlación basada en rangos.
Puede resultar especialmente interesante cuando:
hay muestras pequeñas;
muchos empates;
variables ordinales;
o dependiendo de la tradición del área.
No existe una regla:
Spearman siempre es mejor que Kendall.
Pero para muchos TFG:
Pearson y Spearman serán las dos opciones principales.
One-tailed o two-tailed
SPSS permite seleccionar:
una cola
o:
dos colas.
IBM recomienda dos colas cuando la dirección de la asociación no está establecida previamente; una prueba unilateral solo debería utilizarse si existe una hipótesis direccional justificada de antemano.
No selecciones:
una cola
porque:
“así el p sale más pequeño.”
La decisión debe realizarse:
antes de observar el resultado.
Ejemplo
Hipótesis:
Existe una relación entre autoestima y rendimiento.
No especifica dirección.
Dos colas.
Otro:
Una mayor autoestima se relacionará específicamente con un mayor rendimiento.
Existe dirección previa.
Una cola podría considerarse si:
la teoría;
el protocolo;
y:
la metodología
lo justifican.
Pero en muchos TFG es prudente utilizar:
bilateral.
¿Tengo que realizar muchas correlaciones?
Cuidado.
Tienes:
30 variables.
Correlacionas:
todas con todas.
Eso produce:
435 parejas.
Con:
α = .05,
algunas pueden aparecer significativas por azar.
No hagas:
pesca de p-valores.
Las correlaciones deben responder a:
objetivos;
hipótesis;
preguntas.
Comparaciones múltiples
Si realizas muchas correlaciones:
aumenta la probabilidad de falsos positivos.
Dependiendo del análisis puedes considerar:
ajustes;
control de FDR;
Bonferroni;
u otras estrategias.
Pero la mejor prevención es:
no ejecutar cientos de pruebas sin hipótesis.
Correlación parcial
Supongamos:
quieres estudiar relación entre:
horas de sueño
y:
ansiedad.
Pero ambas están relacionadas con:
edad.
Una correlación parcial puede estudiar:
la asociación entre sueño y ansiedad
controlando estadísticamente:
edad.
SPSS ofrece:
correlaciones parciales
como procedimiento independiente.
Pero recuerda:
controlar estadísticamente
no equivale a:
control experimental.
Correlación parcial no resuelve toda la confusión
Puedes controlar:
edad.
Pero quizá existen:
estrés laboral;
enfermedad;
cafeína;
actividad física
no medidas.
Por eso:
correlación parcial
tampoco demuestra causalidad.
¿Cómo hacer Pearson y Spearman en SPSS?
Ruta habitual:
Analizar → Correlacionar → Bivariadas.
IBM documenta exactamente este procedimiento para calcular Pearson, Spearman y Kendall.
Seleccionas:
las variables.
Después eliges:
Pearson.
Spearman.
O ambos si tienes una razón metodológica para comparar.
¿Debo marcar Pearson y Spearman a la vez?
No únicamente para escoger:
el que tenga menor p.
Eso sería incorrecto.
Puedes calcular ambos con una finalidad:
diagnóstica;
comparativa;
de sensibilidad,
pero la decisión principal debe responder:
a la naturaleza de los datos.
Ejemplo problemático
Pearson:
p = .07.
Spearman:
p = .03.
Entonces escribes:
Utilizamos Spearman porque fue significativo.
No.
Debes decidir qué coeficiente corresponde:
antes de escoger el resultado que te interesa.
SPSS: primera cosa que debes mirar
Antes de Correlaciones:
crea:
diagrama de dispersión.
Especialmente para Pearson.
Pregunta:
¿veo aproximadamente una línea?
¿hay forma de U?
¿existen grupos?
¿hay un valor extremo?
¿la nube tiene sentido?
SPSS: tabla de correlaciones
Puede mostrar algo como:
Sueño | Ansiedad | |
Sueño | 1 | -.46** |
Ansiedad | -.46** | 1 |
Sig.:
< .001.
N:
Interpretación:
r = -.46.
p < .001.
N = 180.
No copies toda la matriz si solo necesitas una correlación
Puedes escribir:
Se observó una correlación negativa entre horas de sueño y ansiedad, r = -.46, p < .001.
Si tienes:
cinco variables,
una matriz puede resultar:
útil.
Matriz de correlaciones
Ejemplo:
Variable | 1 | 2 | 3 | 4 |
1. Ansiedad | — | |||
2. Autoestima | -.42** | — | ||
3. Estrés | .58** | -.31** | — | |
4. Sueño | -.36** | .22* | -.40** | — |
p < .05. ** p < .01.
No necesitas mostrar:
la mitad superior
porque repite:
exactamente los mismos coeficientes.
Pero no escondas N si cambia por missing
Si existen:
datos perdidos,
cada pareja puede tener:
un N diferente
cuando utilizas eliminación pairwise.
Comprueba:
el número real de observaciones.
Cómo redactar Pearson en metodología
Ejemplo:
La asociación entre las variables cuantitativas se analizó mediante el coeficiente de correlación de Pearson. Previamente se examinó la forma de las relaciones mediante diagramas de dispersión y se revisó la presencia de valores extremos.
Si corresponde:
También se consideraron los supuestos inferenciales necesarios para el contraste.
Cómo redactar Spearman
La relación entre las variables ordinales se evaluó mediante el coeficiente rho de Spearman.
Otro:
Debido a la presencia de una relación monotónica no lineal y a la influencia de valores extremos sobre el coeficiente de Pearson, se utilizó la correlación de Spearman.
Eso explica:
por qué.
Cómo redactar el resultado de Pearson
Se observó una correlación positiva entre autonomía y satisfacción laboral, r = .48, IC 95 % [.35; .59], p < .001.
Después:
De este modo, mayores niveles de autonomía se asociaron con mayores puntuaciones de satisfacción en la muestra analizada.
No:
la autonomía provocó satisfacción.
Resultado de Spearman
Se observó una asociación monotónica negativa entre nivel de estrés y calidad del sueño, ρ = -.39, p = .002.
Si la variable es ordinal:
Las puntuaciones más altas de estrés tendieron a corresponder con categorías inferiores de calidad del sueño.
¿Es correcto escribir “correlación fuerte”?
Puede serlo si:
defines o justificas el criterio.
Pero muchas veces es mejor:
dar el coeficiente
y:
describirlo con prudencia.
Ejemplo:
Se observó una asociación positiva de magnitud moderada, r = .38.
No exageres:
r = .38
como:
“relación extremadamente fuerte.”
Un ejemplo completo de Pearson
TFG:
Relación entre horas de sueño y ansiedad en universitarios.
Variables:
Sueño:
horas por noche.
Ansiedad:
puntuación total 0-40.
N:
Scatterplot:
relación aproximadamente lineal negativa.
Sin outliers extremos importantes.
Resultado:
r = -.44.
IC 95 % [-.54; -.32].
p < .001.
Redacción:
Se observó una correlación lineal negativa entre las horas de sueño y la ansiedad, r = -.44, IC 95 % [-.54; -.32], p < .001. Los participantes que informaron de un mayor número de horas de sueño tendieron a presentar puntuaciones inferiores de ansiedad.
Perfecto.
Ejemplo completo de Spearman
TFG:
Relación entre satisfacción académica y percepción de apoyo docente.
Ambas variables:
escala ordinal 1-5.
Resultado:
ρ = .52.
p < .001.
Redacción:
Se observó una asociación monotónica positiva entre la satisfacción académica y la valoración del apoyo docente, ρ = .52, p < .001. Las categorías superiores de apoyo docente tendieron a asociarse con mayores niveles de satisfacción.
Ejemplo donde Spearman puede detectar mejor una relación
X:
experiencia profesional.
Y:
salario.
Al principio:
el salario aumenta rápidamente.
Después:
sigue aumentando,
pero cada vez menos.
La relación es:
monotónica.
No perfectamente lineal.
Spearman puede reflejar muy bien:
que mayor experiencia suele implicar mayor salario,
aunque la pendiente cambie.
Ejemplo donde ninguno sirve bien
Edad:
18 → satisfacción 5.
30 → satisfacción 7.
45 → satisfacción 9.
60 → satisfacción 7.
75 → satisfacción 5.
Tenemos:
una curva.
Pearson:
puede ser cercano a 0.
Spearman:
también.
Pero existe una clara relación:
no monotónica.
Necesitas otro modelo.
Error frecuente 1: Pearson si normal, Spearman si no
Demasiado simplificado.
Error frecuente 2: no hacer scatterplot
Puedes pasar por alto:
curvas
y:
outliers.
Error frecuente 3: correlacionar variables nominales
Sexo:
A/B.
Provincia.
Tipo de contrato.
No son automáticamente variables para Pearson o Spearman.
Error frecuente 4: categorizar una variable cuantitativa sin necesidad
Pierdes información.
Error frecuente 5: correlacionar 30 variables entre sí sin hipótesis
Aumenta falsos positivos.
Error frecuente 6: usar Spearman únicamente porque Pearson no fue significativo
Incorrecto.
Error frecuente 7: interpretar p como fuerza
p = .001
no significa:
relación fuerte.
Error frecuente 8: interpretar r como causalidad
Correlación no demuestra causa.
Error frecuente 9: ignorar el signo
-.60
y:
+.60
tienen magnitud similar pero:
dirección opuesta.
Error frecuente 10: decir que r = 0 significa ausencia de cualquier relación
Puede existir:
una relación no lineal.
Error frecuente 11: eliminar un outlier solo para aumentar r
No manipules los datos.
Error frecuente 12: utilizar una cola después de ver la dirección
Debe decidirse:
antes.
Error frecuente 13: interpretar r² causalmente
Varianza compartida no equivale a:
porcentaje causado.
Error frecuente 14: omitir el N
La precisión depende muchísimo del tamaño muestral.
Error frecuente 15: informar p = .000
Escribe:
p < .001.
¿Cómo decidir entre Pearson y Spearman?
Puedes utilizar este razonamiento:
Primero: identifica el tipo de variables.
Si ambas son cuantitativas:
Pearson puede ser candidato.
Si trabajas con variables ordinales:
Spearman puede ser más natural.
Segundo: crea un scatterplot.
Si la relación es aproximadamente lineal:
Pearson puede representarla bien.
Si es monotónica pero claramente curva:
Spearman puede ser más adecuado.
Si cambia de dirección:
ninguno resume bien la relación.
Tercero: revisa outliers.
Un valor extremo puede cambiar enormemente Pearson.
Cuarto: revisa las condiciones inferenciales.
No decidas mediante una única prueba automática.
Quinto: elige antes de mirar cuál produce el p más pequeño.
Esta última regla evita bastantes malas prácticas.
Checklist antes de calcular una correlación
Sé qué tipo de variables estoy relacionando.
Mi análisis responde a un objetivo previamente definido.
He creado un diagrama de dispersión.
He revisado si la relación es lineal.
Si uso Spearman, he comprobado que existe al menos una tendencia monotónica.
He revisado valores extremos.
No he eliminado casos únicamente para mejorar la correlación.
He comprobado los datos perdidos.
Sé cuál es el N utilizado.
He decidido Pearson o Spearman por criterios metodológicos.
No he elegido el coeficiente después de comparar p-valores.
Sé interpretar el signo.
Sé interpretar la magnitud con contexto.
No confundiré significación estadística y fuerza.
No concluiré causalidad.
Informaré el coeficiente y el p-valor.
Añadiré intervalo de confianza cuando resulte apropiado.
Si realizo muchas correlaciones, consideraré el problema de comparaciones múltiples.
Preguntas frecuentes
¿Qué diferencia hay entre Pearson y Spearman?
Pearson mide principalmente la asociación lineal entre variables cuantitativas. Spearman trabaja con los rangos y mide una asociación monotónica, que puede ser lineal o no lineal.
¿Cuándo utilizo Pearson?
Cuando trabajas con variables cuantitativas y resulta razonable representar su relación mediante una asociación lineal bajo las condiciones del análisis.
¿Cuándo utilizo Spearman?
Especialmente con variables ordinales, relaciones monotónicas no lineales o determinadas situaciones donde Pearson resulta poco apropiado.
¿Si Shapiro-Wilk da p < .05 tengo que usar Spearman?
No automáticamente. Debes considerar la forma de la relación, tipo de variables, muestra, outliers y supuestos relevantes.
¿Pearson exige que cada variable sea perfectamente normal?
No debería plantearse de esa forma simplificada. Para la inferencia clásica se habla de normalidad bivariante, y también son esenciales la linealidad y la ausencia de valores extremos problemáticos.
¿Spearman necesita normalidad?
No depende de la misma suposición de normalidad que Pearson porque trabaja con rangos.
¿Spearman sirve para relaciones curvas?
Sí cuando la relación sigue siendo monotónica: una variable tiende siempre a aumentar o siempre a disminuir al aumentar la otra.
¿Y si la relación tiene forma de U?
Ni Pearson ni Spearman la resumirán adecuadamente mediante un único coeficiente de asociación lineal/monotónica.
¿Qué significa r = .50?
Indica una asociación lineal positiva de magnitud .50. Su importancia debe interpretarse dentro del contexto de investigación.
¿Qué significa r = -.50?
Una asociación lineal negativa de la misma magnitud absoluta.
¿Qué significa r = 0?
Ausencia de asociación lineal. No demuestra que no exista ninguna relación no lineal.
¿Una correlación significativa demuestra causalidad?
No. Una correlación no determina dirección causal ni elimina posibles variables de confusión.
¿Pearson es más potente que Spearman?
En condiciones donde el modelo de Pearson resulta apropiado puede aprovechar la información métrica completa de los datos. Esto no significa que sea universalmente “mejor”; si la relación es monotónica no lineal o existen otras características problemáticas, Spearman puede representar mejor la asociación.
¿Spearman elimina el problema de los outliers?
Reduce mucho la influencia de su magnitud al trabajar con rangos, pero sigue siendo necesario revisar los valores extremos y comprobar si son errores o casos reales.
¿Puedo calcular ambos?
Sí con fines diagnósticos o de sensibilidad, pero no deberías escoger posteriormente el que produzca el p-valor más favorable.
¿Qué significa rho?
Es el símbolo utilizado habitualmente para representar el coeficiente de Spearman.
¿Puedo hacer Pearson y Spearman en SPSS?
Sí. SPSS los incluye en:
Analizar → Correlacionar → Bivariadas.
¿SPSS calcula intervalos de confianza?
Las versiones actuales permiten solicitar intervalos de confianza para Pearson y Spearman.
¿Una correlación de .30 es siempre moderada?
No existe una frontera universal. Las referencias convencionales deben adaptarse al área de estudio y a la literatura disponible.
¿Qué debo escribir en resultados?
Indica el tipo de correlación, coeficiente, dirección, p-valor y, cuando corresponda, intervalo de confianza y tamaño muestral.
Ejemplo final: decidir correctamente
Imagina este TFG:
Relación entre uso diario de redes sociales y ansiedad académica.
Tienes:
Uso de redes:
horas diarias.
Ansiedad:
puntuación total de una escala.
N:
Primero haces:
scatterplot.
Observas:
una tendencia creciente aproximadamente lineal.
No existen:
outliers graves.
Las puntuaciones tienen:
suficiente rango.
La evaluación de los supuestos no muestra problemas que hagan inadecuada una correlación lineal.
Entonces decides:
Pearson.
Resultado:
r = .41.
IC 95 % [.30; .51].
p < .001.
Puedes escribir:
Se observó una correlación lineal positiva entre las horas diarias de uso de redes sociales y la puntuación de ansiedad académica, r = .41, IC 95 % [.30; .51], p < .001. En la muestra analizada, un mayor tiempo de uso de redes sociales tendió a asociarse con mayores niveles de ansiedad.
Ahora cambia el escenario.
Mismo estudio.
El scatterplot muestra:
una tendencia ascendente clara,
pero:
muy curva.
Existen además algunos valores extremos de horas de uso.
El orden general sigue siendo:
más uso → mayor ansiedad.
Decides utilizar:
Spearman.
Resultado:
ρ = .47.
p < .001.
Redacción:
Se observó una asociación monotónica positiva entre el uso diario de redes sociales y la ansiedad académica, ρ = .47, p < .001. Los participantes con mayores niveles de uso tendieron a ocupar también posiciones superiores en las puntuaciones de ansiedad.
Ahora un tercer escenario.
El gráfico muestra:
ansiedad baja para uso muy reducido;
ansiedad alta para uso moderado;
ansiedad nuevamente baja para uso extremo.
La relación cambia:
de dirección.
Pearson:
r ≈ 0.
Spearman:
ρ ≈ 0.
No concluyas:
“No existe relación.”
La conclusión correcta sería:
ninguno de esos dos coeficientes representa bien la forma observada.
Necesitas estudiar:
otro modelo.
La regla más importante
No decidas:
Pearson o Spearman
mirando únicamente:
Shapiro-Wilk.
Ni mirando:
qué opción produce p < .05.
Antes de pulsar ningún botón:
mira tus variables.
Después:
mira el gráfico.
Pregunta:
¿son cuantitativas u ordinales?
¿la relación es lineal?
¿es monotónica?
¿cambia de dirección?
¿hay outliers?
¿existen datos extraños?
Solo entonces:
elige el coeficiente.
Porque Pearson y Spearman no son simplemente:
la versión paramétrica y no paramétrica de la misma cosa.
Pearson pregunta principalmente:
¿hasta qué punto estas variables siguen juntas una relación lineal?
Spearman pregunta principalmente:
¿hasta qué punto sus posiciones mantienen una relación creciente o decreciente consistente?
Entender esa diferencia te permite hacer algo mucho más importante que escoger correctamente una casilla de SPSS:
interpretar de verdad la relación que existe en tus datos.





Comentarios