ANOVA en un TFG: cómo hacerla e interpretarla en SPSS

ANOVA en un TFG: cómo hacerla e interpretarla en SPSS
Tienes tres grupos.
Quieres comparar sus medias.
Por ejemplo:
satisfacción de estudiantes:
presenciales;
híbridos;
online.
O niveles de estrés entre:
primer curso;
segundo;
tercero;
cuarto.
O intención de compra después de mostrar:
anuncio A;
anuncio B;
anuncio C.
Entonces aparece una de las pruebas más conocidas de SPSS:
ANOVA.
La ejecutas.
SPSS devuelve:
F = 6,84.
p = .002.
Y parece que el análisis ha terminado.
Pero no.
Una ANOVA significativa te dice que existen diferencias entre las medias del conjunto de grupos.
No te dice automáticamente:
qué grupos son diferentes.
Tampoco te dice:
qué magnitud tienen esas diferencias.
Y antes de interpretar F necesitas comprobar cuestiones como:
independencia;
distribución de los errores;
homogeneidad de varianzas;
presencia de valores extremos;
tamaño y equilibrio de los grupos.
Si Levene resulta significativo quizá tengas que considerar:
ANOVA de Welch.
Si la ANOVA global resulta significativa necesitarás, en muchos diseños:
comparaciones post hoc.
Y la elección entre:
Tukey
y:
Games-Howell
no debería hacerse al azar.
Vamos paso a paso.
¿Qué es una ANOVA?
ANOVA significa:
Analysis of Variance
o:
análisis de la varianza.
Aunque su objetivo habitual consiste en comparar:
medias.
Esto puede parecer extraño.
Si quiero comparar medias:
¿por qué se llama análisis de varianza?
Porque la prueba estudia la relación entre dos fuentes de variabilidad:
Variabilidad existente entre las medias de los grupos.
Variabilidad existente dentro de cada grupo.
Si los grupos tienen medias realmente parecidas:
la variabilidad entre grupos debería ser relativamente pequeña respecto de la variabilidad interna.
Si las medias difieren mucho:
la variabilidad entre grupos aumenta.
La ANOVA resume esta comparación mediante:
el estadístico F.
NIST describe precisamente la ANOVA de un factor mediante la comparación de la variabilidad entre niveles con la variabilidad residual existente dentro de ellos.
Ejemplo sencillo
Quieres comparar satisfacción académica.
Presencial
M = 6,2.
Híbrida
M = 7,1.
Online
M = 7,4.
Las medias parecen diferentes.
Pero también necesitamos conocer:
cuánto varían las respuestas dentro de cada grupo.
Imagina que las puntuaciones de todos los participantes son extremadamente dispersas.
Una diferencia de:
1 punto
entre medias quizá no sea tan clara.
Ahora imagina que dentro de cada grupo prácticamente todos responden muy parecido.
Esa misma diferencia de:
1 punto
puede resultar mucho más evidente.
La ANOVA combina precisamente:
diferencia entre grupos
con:
variabilidad dentro de los grupos.
¿Cuándo se utiliza una ANOVA de un factor?
En su forma más básica necesitas:
Una variable dependiente cuantitativa
Ejemplos:
puntuación de ansiedad;
satisfacción;
nota;
salario;
tiempo;
puntuación total de una escala.
Una variable independiente categórica
Con diferentes grupos.
Ejemplos:
Modalidad:
presencial;
híbrida;
online.
Curso:
primero;
segundo;
tercero;
cuarto.
Tratamiento:
A;
B;
C.
Cuando existe:
una variable categórica independiente
hablamos de:
ANOVA de un factor.
¿Tiene que haber tres grupos?
La ANOVA puede trabajar técnicamente con dos grupos.
Pero si únicamente tienes:
dos grupos independientes,
una t de Student suele proporcionar una forma más directa de plantear la comparación.
La ANOVA adquiere especial utilidad cuando tienes:
tres o más medias.
Ejemplo:
Grupo A.
Grupo B.
Grupo C.
Grupo D.
¿Por qué no hacer varias t de Student?
Imagina tres grupos:
A.
B.
C.
Puedes realizar:
A vs B.
A vs C.
B vs C.
Tres pruebas.
Con cuatro grupos:
A-B.
A-C.
A-D.
B-C.
B-D.
C-D.
Ya tienes:
seis comparaciones.
Cuantas más pruebas realices utilizando repetidamente α = .05:
mayor será la probabilidad de obtener al menos algún resultado significativo por azar.
La ANOVA comienza con una prueba:
global.
Pregunta:
¿Existe evidencia de que no todas las medias poblacionales sean iguales?
Después, cuando corresponde, realizamos comparaciones controladas.
Hipótesis de la ANOVA
Supongamos tres grupos.
Hipótesis nula
H₀:
μ₁ = μ₂ = μ₃.
Todas las medias poblacionales son iguales.
Hipótesis alternativa
No todas las medias son iguales.
Importante:
la alternativa no dice:
todas son diferentes entre sí.
Basta con que exista:
al menos alguna diferencia.
Ejemplo
Medias:
Grupo A = 5.
Grupo B = 5.
Grupo C = 8.
La hipótesis nula es falsa.
Pero:
A y B
son prácticamente iguales.
Por eso un ANOVA significativo no significa:
todos los grupos difieren de todos los demás.
¿Qué significa F?
El estadístico F representa, de manera simplificada, una relación entre:
variabilidad entre grupos
y:
variabilidad dentro de los grupos.
Si:
F ≈ 1,
ambas fuentes de variabilidad tienen magnitudes relativamente parecidas.
Si:
F aumenta,
existe más variabilidad entre las medias en relación con el ruido interno.
Pero:
un valor de F no se interpreta aislado.
Necesitas:
grados de libertad;
p-valor;
tamaño del efecto;
medias;
comparaciones posteriores.
Ejemplo
F(2,147) = 7,82.
p < .001.
El:
2
representa los grados de libertad asociados al factor.
El:
147
los grados relacionados con el error.
No necesitas memorizar cómo SPSS calcula cada suma de cuadrados para interpretar un TFG correctamente.
Pero debes saber qué estás informando.
¿Cómo se calculan los grados de libertad?
En una ANOVA sencilla con:
k grupos
y:
N participantes,
de forma general:
Entre grupos
k - 1.
Dentro de grupos
N - k.
Ejemplo:
3 grupos.
N = 150.
Entre:
3 - 1 = 2.
Dentro:
150 - 3 = 147.
Resultado:
F(2,147).
¿Qué significa p < .05?
Supongamos:
F(2,147) = 7,82.
p < .001.
Con α = .05:
rechazamos la hipótesis de igualdad global de medias.
Puedes escribir:
Se observaron diferencias estadísticamente significativas entre las medias de los grupos.
Pero todavía no sabes:
entre cuáles.
¿Qué significa p > .05?
Ejemplo:
F(2,147) = 1,28.
p = .281.
No encontramos evidencia suficiente para rechazar:
la igualdad global de medias.
No escribas:
Los tres grupos son idénticos.
No has demostrado:
igualdad perfecta.
Solo:
no has encontrado evidencia suficiente de diferencias globales con ese diseño y muestra.
Antes de ANOVA: mira los descriptivos
Nunca empieces leyendo:
p.
Primero mira:
N;
media;
desviación estándar;
intervalos;
mínimo;
máximo.
SPSS puede proporcionar todos estos descriptivos para cada grupo.
Ejemplo:
Grupo | n | M | DE |
Presencial | 50 | 6,20 | 1,10 |
Híbrido | 52 | 7,05 | 0,95 |
Online | 48 | 7,42 | 1,02 |
Antes de realizar ningún post hoc ya observas:
Presencial parece tener:
menor satisfacción.
Los gráficos ayudan
Puedes utilizar:
boxplots;
gráficos de medias con intervalos;
distribución por grupos.
Un boxplot puede mostrar rápidamente:
diferencias centrales;
dispersión;
asimetría;
valores extremos.
No interpretes únicamente:
una tabla.
Supuestos de una ANOVA
Los principales son:
Independencia de observaciones.
Distribución aproximadamente normal de los errores dentro de los grupos.
Homogeneidad de varianzas.
NIST y Penn State presentan precisamente independencia, normalidad y varianza común como los supuestos centrales de la ANOVA de un factor.
1. Independencia
Cada participante debería aportar una observación independiente dentro del diseño.
Ejemplo:
Grupo presencial:
50 estudiantes.
Grupo híbrido:
50 estudiantes.
Grupo online:
50 estudiantes diferentes.
Perfecto.
Problema: misma persona en varios grupos
Imagina:
mides a las mismas 50 personas:
antes;
durante;
después.
No son:
tres grupos independientes.
Son:
las mismas personas en tres momentos.
Aquí necesitas considerar:
ANOVA de medidas repetidas
u otro modelo apropiado.
No una ANOVA independiente de un factor.
Otro problema
Seleccionas:
100 alumnos.
Pero provienen de:
5 aulas.
Los alumnos dentro de una misma aula pueden compartir:
profesor;
entorno;
dinámica.
Dependiendo del objetivo, puede existir una estructura de:
datos agrupados.
Una ANOVA sencilla quizá no refleje toda esa dependencia.
La independencia se decide principalmente por el diseño
No existe un botón en SPSS que arregle:
observaciones no independientes.
Debes saber:
cómo fueron recogidos los datos.
2. Normalidad
Aquí vuelve a aparecer uno de los errores clásicos.
No significa necesariamente:
La variable dependiente debe ser perfectamente normal en toda la muestra.
En una ANOVA interesa la distribución de:
los errores dentro de cada grupo
bajo el modelo.
En diseños sencillos puedes revisar:
la variable dentro de cada grupo;
residuos;
Q-Q plots;
outliers.
No mezcles todos los grupos para comprobar normalidad
Ejemplo:
Grupo A:
media 2.
Grupo B:
media 5.
Grupo C:
media 8.
Cada grupo puede presentar:
una distribución aproximadamente normal.
Pero si los juntas:
la distribución total puede parecer:
extraña o multimodal.
Eso no significa automáticamente que:
el supuesto del modelo esté mal.
Revisa los datos:
por grupos
o los residuos correspondientes.
¿Tengo que usar Shapiro-Wilk?
Puede aportar información.
Pero no tomes una decisión únicamente con:
p.
Ejemplo:
N = 500.
Shapiro:
p < .001.
Los Q-Q plots muestran:
desviaciones muy pequeñas.
Los grupos están:
equilibrados.
No existen outliers graves.
Una ANOVA puede ser bastante robusta frente a determinadas desviaciones moderadas.
IBM señala que la ANOVA de un factor es relativamente robusta frente a desviaciones de normalidad, especialmente cuando los datos son razonablemente simétricos.
Penn State también señala que las desviaciones moderadas de normalidad y homogeneidad pueden ser menos problemáticas cuando las muestras son suficientemente grandes y equilibradas.
Muestra pequeña: mayor cuidado
Si tienes:
n = 8 por grupo,
la situación cambia.
Una distribución:
muy asimétrica
o:
outliers
pueden tener una influencia mucho mayor.
No escribas:
Shapiro p > .05, por tanto normalidad perfecta.
Con muestras pequeñas:
las pruebas de normalidad pueden tener poca capacidad para detectar problemas.
Combina:
estadísticos
y:
gráficos.
3. Homogeneidad de varianzas
La ANOVA clásica presupone:
varianzas similares entre los grupos.
Ejemplo:
Presencial:
DE = 1,0.
Híbrido:
DE = 1,1.
Online:
DE = 0,9.
Muy parecidas.
Otro:
Presencial:
DE = 0,5.
Híbrido:
DE = 1,0.
Online:
DE = 4,8.
Ahora existe:
una diferencia enorme.
Aquí aparece:
la prueba de Levene.
¿Qué es Levene?
Levene contrasta la hipótesis:
H₀:
las varianzas poblacionales son iguales.
Si:
p > .05,
no tenemos evidencia suficiente para rechazar:
homogeneidad.
Si:
p < .05,
existe evidencia de:
varianzas diferentes.
SPSS incluye Levene específicamente para evaluar el supuesto de homogeneidad en ANOVA.
Ejemplo
Levene:
F = 1,12.
p = .329.
No existe evidencia significativa de:
heterogeneidad.
Otro:
Levene:
F = 8,34.
p < .001.
Existe una señal clara de:
varianzas desiguales.
¿Qué hago si Levene es significativo?
Este es un punto fundamental.
Muchos estudiantes hacen:
Levene p < .05.
↓
Kruskal-Wallis.
No es necesariamente la primera decisión correcta.
Puedes considerar:
ANOVA de Welch.
Welch está diseñada para comparar medias cuando no puedes asumir:
igualdad de varianzas.
ANOVA de Welch
Es una versión robusta de la comparación de medias que ajusta el estadístico y los grados de libertad cuando las varianzas son diferentes.
SPSS incluye pruebas robustas de igualdad de medias dentro del procedimiento de ANOVA de un factor.
Puede resultar especialmente útil cuando tienes:
varianzas desiguales;
tamaños de grupo diferentes.
Ejemplo
Levene:
p < .001.
ANOVA clásica:
F(2,147) = 5,90.
p = .003.
Welch:
F(2,87.4) = 7,11.
p = .001.
En esta situación puedes basar la interpretación principal en:
Welch.
¿Welch es “no paramétrica”?
No.
Sigue siendo un procedimiento para comparar:
medias.
No es equivalente a:
Kruskal-Wallis.
Es una alternativa robusta dentro de la familia de pruebas paramétricas.
¿Qué es Brown-Forsythe?
SPSS también puede proporcionar:
Brown-Forsythe
como prueba robusta de igualdad de medias.
Es otra alternativa cuando existen:
problemas de homogeneidad.
En muchos TFG:
Welch será la opción más conocida.
No necesitas informar:
ANOVA clásica + Welch + Brown-Forsythe
sin una razón.
¿Cuándo usar Kruskal-Wallis?
Puede resultar apropiada cuando tienes:
varios grupos independientes
y un análisis basado en rangos resulta más adecuado.
Por ejemplo:
variable ordinal;
distribución muy problemática;
outliers extremos;
condiciones que hacen poco razonable la ANOVA.
Pero no utilices:
Kruskal-Wallis
automáticamente porque:
Levene p < .05.
Welch puede ser una solución mucho más directa para:
heterogeneidad de varianzas.
ANOVA no significativa: ¿hago post hoc?
En general:
si tu ANOVA global no muestra evidencia de diferencias
y no tenías comparaciones planificadas a priori,
no tiene sentido empezar a probar:
todos los pares
hasta encontrar un:
p < .05.
Eso sería:
buscar significación.
ANOVA significativa: empieza la segunda parte
Supongamos:
F(2,147) = 8,10.
p < .001.
Ahora sabemos:
al menos alguna media difiere.
Pero no sabemos:
cuál.
Necesitamos:
comparaciones post hoc
o:
contrastes planificados.
¿Qué es una prueba post hoc?
Post hoc significa:
posterior.
Permite comparar:
pares de grupos
controlando de distintas formas el problema de realizar:
múltiples comparaciones.
Ejemplo:
A vs B.
A vs C.
B vs C.
SPSS incluye una amplia variedad de procedimientos post hoc.
Tukey
Una de las opciones más conocidas.
Tukey HSD realiza:
comparaciones por pares
controlando el error global para el conjunto de comparaciones.
Es especialmente habitual cuando:
quieres comparar todos los grupos;
puedes asumir varianzas iguales.
IBM incluye Tukey entre los post hoc para situaciones donde se asume igualdad de varianzas.
Ejemplo
ANOVA:
p < .001.
Tukey:
Presencial vs Híbrido:
p = .012.
Presencial vs Online:
p < .001.
Híbrido vs Online:
p = .640.
Interpretación:
Presencial presenta:
menor satisfacción que:
Híbrido
y:
Online.
Pero Híbrido y Online:
no muestran diferencias significativas.
Esta es la verdadera interpretación
No:
Los tres grupos son diferentes.
Porque:
Híbrido y Online
no lo son.
Bonferroni
Otra alternativa.
Realiza comparaciones por pares ajustando:
el nivel de significación
para controlar el error familiar.
Es más conservadora en determinados contextos.
Puede resultar útil cuando:
tienes un número limitado de comparaciones.
¿Tukey o Bonferroni?
No existe una opción universal.
Tukey resulta especialmente natural para:
todas las comparaciones por pares.
Bonferroni puede utilizarse:
para un conjunto de comparaciones específicas.
Lo importante es:
no ejecutar diez métodos y quedarse con:
el que produzca más significación.
Games-Howell
Muy importante cuando:
las varianzas no son iguales.
IBM clasifica Games-Howell entre los procedimientos post hoc que no presuponen igualdad de varianzas.
Por tanto:
Levene significativo
Welch
Games-Howell
puede constituir una combinación muy razonable.
Regla práctica
Varianzas razonablemente homogéneas
ANOVA clásica.
Post hoc:
Tukey
cuando corresponde.
Varianzas claramente heterogéneas
Welch.
Post hoc:
Games-Howell.
No conviertas esto en:
una ley mecánica.
Pero es una guía muy útil.
Tamhane T2
Otra prueba que no asume:
igualdad de varianzas.
IBM la describe como:
una comparación conservadora apropiada cuando las varianzas son diferentes.
En muchos TFG encontrarás:
Games-Howell
con mayor frecuencia.
Dunnett
Puede ser muy útil cuando no quieres comparar:
todos contra todos.
Ejemplo:
tienes:
un grupo control
y:
tres tratamientos.
Solo te interesa:
Tratamiento A vs Control.
Tratamiento B vs Control.
Tratamiento C vs Control.
No necesitas:
A vs B;
A vs C;
B vs C.
Dunnett está diseñado precisamente para comparar varios grupos con:
un control.
Contrastes planificados
No todas las comparaciones tienen que ser:
post hoc.
Si antes de ver los resultados ya tenías una hipótesis concreta:
puedes plantear:
contrastes a priori.
Ejemplo:
Hipótesis:
La modalidad online diferirá del promedio de presencial e híbrida.
Esto puede representarse mediante:
un contraste planificado.
SPSS permite especificar contrastes dentro de ANOVA de un factor.
No confundas post hoc y contraste a priori
A priori
Definido:
antes de examinar resultados.
Deriva de:
hipótesis.
Post hoc
Explora:
qué grupos difieren
después del contraste global.
Esta distinción mejora mucho:
la metodología.
¿Qué significa la diferencia de medias en un post hoc?
Ejemplo:
Presencial - Online = -1,22.
Significa:
la media de Presencial es:
1,22 puntos menor.
Si:
IC 95 % [-1,80; -.64]
y:
p < .001,
la diferencia está bastante clara.
No informes únicamente:
p.
La:
diferencia de medias
también tiene una interpretación sustantiva.
El intervalo de confianza del post hoc
Aporta:
magnitud
e:
incertidumbre.
Ejemplo:
Diferencia:
0,70.
IC:
[0,05; 1,35].
Existe bastante incertidumbre.
Otro:
0,70.
IC:
[0,62; 0,78].
Estimación:
mucho más precisa.
Tamaño del efecto en ANOVA
Una ANOVA significativa no te dice:
qué importancia tienen las diferencias.
Aquí aparecen medidas como:
eta cuadrado
η².
eta cuadrado parcial
η²p.
omega cuadrado
ω².
SPSS permite actualmente solicitar estimaciones de tamaño del efecto dentro de ANOVA de un factor.
¿Qué es eta cuadrado?
De manera sencilla:
indica qué proporción de la variabilidad total está asociada con:
el factor
en un diseño de un factor.
Ejemplo:
η² = .10.
Aproximadamente:
10 % de la variabilidad observada
está asociada a las diferencias entre grupos dentro del modelo.
Pero no escribas:
“El grupo causa el 10 %.”
Una ANOVA observacional no demuestra:
causalidad.
Eta cuadrado puede estar sesgada al alza
Especialmente con:
muestras pequeñas.
Por eso puede utilizarse:
omega cuadrado
como una estimación menos sesgada del tamaño del efecto poblacional.
No necesitas calcular:
η²;
η²p;
ω²
todos a la vez.
Utiliza:
la medida apropiada
y explica:
cuál estás informando.
¿Eta cuadrado y eta cuadrado parcial son iguales?
No siempre.
En una ANOVA de un único factor sencilla pueden estar estrechamente relacionados.
En diseños con:
varios factores;
covariables;
medidas repetidas,
pueden tener interpretaciones diferentes.
No utilices:
η²
y:
η²p
como si fueran símbolos intercambiables.
Puntos de corte del tamaño del efecto
Puedes encontrar referencias como:
.01 pequeño.
.06 medio.
.14 grande.
Para eta cuadrado.
Son:
referencias convencionales.
No fronteras universales.
Un η² de:
.059
no es científicamente diferente de:
.060.
La interpretación debe tener en cuenta:
tu área de investigación.
Ejemplo
ANOVA:
F(2,147) = 10,50.
p < .001.
η² = .13.
Puedes escribir:
Se observaron diferencias estadísticamente significativas entre los grupos, F(2,147) = 10,50, p < .001, η² = .13.
Después:
post hoc.
Significativo no significa grande
N = 5.000.
F enorme.
p < .001.
η² = .004.
Existe:
diferencia estadística.
Pero el factor se relaciona con:
muy poca variabilidad.
No describas:
diferencias muy importantes.
Mira:
tamaño del efecto.
No significativo con efecto aparentemente considerable
N pequeño.
η² = .08.
p = .09.
No puedes afirmar:
Existe una diferencia significativa.
Pero tampoco ignores:
la magnitud estimada.
Necesitas mencionar:
la incertidumbre.
Valores extremos
Una ANOVA basada en medias puede resultar sensible a:
outliers.
Ejemplo:
Grupo A:
5, 5, 6, 5, 100.
Ese:
100
puede mover:
media;
varianza;
F.
Antes del análisis revisa:
boxplots.
No elimines outliers para conseguir significación
Pregunta:
¿es un error?
Ejemplo:
Edad = 280.
Probablemente sí.
¿Es un dato real extremo?
Ejemplo:
ingresos muy altos.
Puede ser:
real.
No lo elimines únicamente porque:
Levene deja de ser significativo
o:
ANOVA pasa a p < .05.
Grupos desequilibrados
Ejemplo:
Grupo A:
n = 100.
Grupo B:
n = 95.
Grupo C:
n = 8.
Esto puede generar:
problemas de precisión.
Especialmente si:
el grupo pequeño
tiene una varianza muy diferente.
Una ANOVA clásica es más robusta cuando:
los tamaños son relativamente equilibrados.
Penn State señala precisamente que la robustez aumenta cuando los grupos tienen tamaños similares.
Grupo pequeño no significa automáticamente eliminarlo
Quizá esa categoría es:
muy importante.
Pero debes:
interpretar con cautela.
Valorar:
Welch.
Considerar:
intervalos.
Reconocer:
la limitación.
¿Puedo unir grupos pequeños?
Solo si existe:
una justificación conceptual.
Ejemplo:
Curso:
5.º y 6.º
pueden agruparse como:
cursos avanzados
si el diseño lo justifica.
No agrupes:
A y C
únicamente porque:
así Levene deja de ser significativo.
ANOVA de un factor vs ANOVA factorial
Hasta ahora hablamos de:
un factor.
Ejemplo:
Modalidad.
Pero podrías tener:
dos factores.
Ejemplo:
Modalidad:
presencial / online.
Sexo:
grupo A / grupo B.
Entonces aparece:
ANOVA factorial.
Permite estudiar:
efecto principal de modalidad;
efecto principal del segundo factor;
interacción.
No es exactamente la misma pregunta.
¿Qué es una interacción?
Supongamos:
la modalidad online mejora mucho la satisfacción en:
un grupo.
Pero no tiene ningún efecto en:
otro.
Entonces la relación de modalidad con satisfacción depende de:
otra variable.
Eso es:
interacción.
Un ANOVA de un factor no puede estudiar:
esa interacción.
No hagas varias ANOVA separadas si tu pregunta es una interacción
Ejemplo:
ANOVA en hombres.
ANOVA en mujeres.
Y después:
“una fue significativa y otra no.”
Eso no demuestra:
que el efecto sea diferente entre sexos.
Necesitas probar:
la interacción
directamente.
ANOVA de medidas repetidas
Otra variante.
Mismas personas:
pretest.
postest.
seguimiento.
Eso no es:
ANOVA de grupos independientes.
Necesitas un modelo que tenga en cuenta:
la relación entre las medidas.
La ANOVA de medidas repetidas introduce supuestos adicionales como:
esfericidad.
No mezcles ambas técnicas.
ANOVA mixta
Puede combinar:
un factor entre sujetos
y:
otro intra-sujetos.
Ejemplo:
Tratamiento:
A/B.
Tiempo:
pre/post.
Permite analizar:
si los grupos evolucionan de manera diferente.
Es mucho más compleja que:
ANOVA de un factor.
Este artículo se centra en:
ANOVA de un factor entre grupos independientes.
¿Cómo hacer una ANOVA en SPSS?
Ruta:
Analizar → Comparar medias → ANOVA de un factor.
IBM documenta exactamente este procedimiento.
Paso 1. Variable dependiente
Introduce:
SATISFACCION.
Variable cuantitativa.
Paso 2. Factor
Introduce:
MODALIDAD.
Categorías:
1 = Presencial.
2 = Híbrida.
3 = Online.
Paso 3. Opciones
Solicita:
descriptivos;
homogeneidad de varianzas;
pruebas robustas;
tamaño del efecto cuando esté disponible.
Paso 4. Post hoc
Si esperas:
varianzas iguales,
puedes solicitar:
Tukey.
Si existen:
varianzas diferentes,
Games-Howell.
Puedes solicitar ambos inicialmente para tenerlos disponibles, pero tu interpretación debe seguir:
el diagnóstico adecuado.
Paso 5. Ejecutar
SPSS generará:
descriptivos;
Levene;
ANOVA;
Welch/Brown-Forsythe cuando se soliciten;
tamaños del efecto;
comparaciones múltiples.
Primera tabla: descriptivos
Ejemplo:
Modalidad | n | M | DE |
Presencial | 50 | 6,20 | 1,15 |
Híbrida | 52 | 7,05 | .92 |
Online | 48 | 7,40 | 1,01 |
Antes de mirar:
p,
ya tenemos:
una idea clara.
Segunda tabla: Levene
Ejemplo:
Levene:
p = .218.
No existe evidencia significativa de:
varianzas diferentes.
Podemos considerar:
ANOVA clásica
y:
Tukey.
Tercera tabla: ANOVA
Ejemplo:
F(2,147) = 17,21.
p < .001.
Conclusión global:
al menos dos medias:
difieren.
Cuarta tabla: post hoc Tukey
Presencial vs Híbrida:
Diferencia = -.85.
p = .001.
Presencial vs Online:
Diferencia = -1.20.
p < .001.
Híbrida vs Online:
Diferencia = -.35.
p = .210.
Conclusión:
Presencial presenta menor satisfacción que:
Híbrida
y:
Online.
Híbrida y Online:
no muestran diferencias significativas.
Este sería un resultado completo
Se observaron diferencias en satisfacción según modalidad, F(2,147) = 17,21, p < .001. Las comparaciones post hoc de Tukey mostraron que los estudiantes presenciales presentaron una satisfacción inferior tanto a los estudiantes híbridos como a los online, mientras que no se observaron diferencias significativas entre los grupos híbrido y online.
Después añade:
tamaño del efecto.
Ejemplo con Levene significativo
Descriptivos:
A:
M = 5,2.
DE = .50.
B:
M = 6,1.
DE = 1,80.
C:
M = 7,0.
DE = 3,20.
Levene:
p < .001.
No ignores:
la heterogeneidad.
Solicitas:
Welch.
Welch:
F(2,72.5) = 8,91.
p < .001.
Post hoc:
Games-Howell.
Cómo redactarlo
La prueba de Levene indicó heterogeneidad de varianzas, p < .001, por lo que la comparación global se realizó mediante la ANOVA de Welch. Se observaron diferencias estadísticamente significativas entre los grupos, F(2,72.5) = 8,91, p < .001. Las comparaciones Games-Howell mostraron...
Eso demuestra:
criterio metodológico.
Tukey vs Games-Howell
Recuerda:
Tukey
Varianzas iguales razonables.
Games-Howell
No presupone igualdad de varianzas.
IBM distingue exactamente ambos grupos de procedimientos en sus opciones post hoc.
No hagas Tukey y Games-Howell y elijas el que da significativo
Ejemplo:
Tukey:
p = .061.
Games-Howell:
p = .038.
Entonces decides:
Games-Howell.
¿Por qué?
Si las varianzas eran:
homogéneas,
no deberías escoger:
la prueba por su resultado.
La decisión se basa en:
las condiciones del análisis.
¿Y si Levene p = .049?
No conviertas:
.049
y:
.051
en dos universos completamente distintos.
Revisa:
tamaños de grupos;
desviaciones;
gráficos;
robustez.
Welch es una alternativa muy razonable incluso cuando quieres mayor protección ante heterogeneidad.
La estadística no funciona mediante:
fronteras mágicas.
ANOVA robusta
Welch suele comportarse muy bien cuando existen:
varianzas diferentes.
Por eso algunos analistas la prefieren incluso como opción general cuando:
no existe una razón para asumir homogeneidad estricta.
En un TFG:
lo importante es explicar:
qué utilizaste
y:
por qué.
Kruskal-Wallis no compara exactamente medias
Este punto merece atención.
Muchos estudiantes escriben:
“Como no hay normalidad, utilicé Kruskal-Wallis para comparar medias.”
Kruskal-Wallis trabaja:
con rangos.
Su interpretación no es idéntica a:
comparar medias mediante ANOVA.
Dependiendo de la forma de las distribuciones puede interpretarse como:
diferencias de distribución
y, bajo ciertas condiciones, diferencias de localización.
No llames automáticamente:
“ANOVA no paramétrica de medias.”
Post hoc después de Kruskal-Wallis
Si Kruskal-Wallis resulta significativo:
también necesitas estudiar:
qué grupos difieren.
Pueden utilizarse:
comparaciones de Dunn
con correcciones por múltiples pruebas,
dependiendo del software y metodología.
No termines:
Kruskal p < .05.
¿Qué pasa con solo dos grupos?
ANOVA con:
2 grupos
producirá una conclusión equivalente a la t de Student correspondiente bajo los mismos supuestos.
De hecho:
F = t²
en ese caso.
Pero si solo existen dos grupos:
la t suele ser más intuitiva.
¿Qué pasa con cinco grupos?
Perfectamente válido.
La ANOVA global sigue respondiendo:
si existen diferencias en alguna media.
Pero el número de comparaciones por pares crece.
Cinco grupos:
10 pares.
Por eso el control de:
múltiples comparaciones
resulta todavía más importante.
La importancia del tamaño muestral
ANOVA depende:
del tamaño de muestra.
Con N enorme:
diferencias muy pequeñas pueden ser:
significativas.
Con N reducido:
diferencias relevantes pueden no alcanzar:
p < .05.
Por eso necesitas:
tamaño del efecto
y:
intervalos.
Planificar la muestra
Si ANOVA es:
tu análisis principal,
puedes utilizar:
G*Power
para realizar un análisis a priori.
Necesitarás:
número de grupos;
efecto esperado f;
alfa;
potencia.
No decidas el tamaño:
“30 por grupo porque es lo habitual.”
Tamaño del efecto f
Para la planificación mediante G*Power puede utilizarse:
Cohen's f.
Es otra medida de tamaño del efecto asociada a:
ANOVA.
No es:
d de Cohen.
No confundas:
d
con:
f.
Ejemplo de TFG de Psicología
Pregunta:
¿Existen diferencias en ansiedad según modalidad de estudio?
Grupos:
Presencial.
Híbrida.
Online.
Resultado:
Levene:
p = .45.
ANOVA:
F(2,207) = 6,42.
p = .002.
η² = .058.
Tukey:
Presencial vs Online:
p = .001.
Presencial vs Híbrida:
p = .17.
Híbrida vs Online:
p = .23.
Interpretación:
la diferencia global se debe principalmente a:
Presencial vs Online.
No:
a todos los grupos.
Ejemplo de Educación
Objetivo:
comparar motivación según:
1.º.
2.º.
3.º.
4.º.
ANOVA:
p < .001.
Post hoc:
1.º presenta menor motivación que:
3.º y 4.º.
No existe diferencia entre:
3.º y 4.º.
Redacción:
especifica:
exactamente ese patrón.
Ejemplo de ADE
Satisfacción laboral según:
presencial;
híbrido;
remoto.
Levene:
p = .002.
Utilizas:
Welch.
Games-Howell:
Híbrido > Presencial.
Remoto no difiere de:
ninguno de los dos.
No escribas:
“La modalidad híbrida es la mejor.”
Escribe:
los resultados observados.
Ejemplo de Marketing
Intención de compra después de:
Campaña A.
Campaña B.
Campaña C.
Resultado:
ANOVA significativa.
Tukey:
B > A.
B > C.
A = C.
Ahora puedes concluir:
Campaña B obtuvo una puntuación media de intención superior a:
A y C
dentro de la muestra.
Si el diseño fue experimental aleatorizado:
las inferencias causales pueden ser más defendibles que en una encuesta observacional.
ANOVA observacional no demuestra causalidad
Ejemplo:
comparar satisfacción según:
presencial;
híbrido;
remoto.
Los participantes no fueron asignados aleatoriamente.
Quizá los trabajadores remotos:
tienen puestos diferentes;
más autonomía;
mejor salario.
ANOVA encuentra:
diferencias.
No demuestra que:
la modalidad las cause.
No escribas “efecto” causal sin diseño apropiado
La terminología estadística habla de:
efecto del factor.
Pero en un estudio observacional es más prudente redactar:
Se observaron diferencias según modalidad.
No:
La modalidad produjo un aumento.
¿Qué hago si ANOVA no es significativa pero Tukey sí?
En procedimientos clásicos puede aparecer alguna combinación extraña dependiendo de:
ajustes;
métodos;
redondeos.
No utilices post hoc indiscriminadamente para:
rescatar significación.
Si tus comparaciones eran:
hipótesis específicas planificadas,
deberías plantearlas como:
contrastes a priori.
No como:
búsqueda posterior.
¿Qué pasa si las medias son iguales pero las distribuciones diferentes?
ANOVA se centra en:
medias.
Puedes tener:
misma media
pero:
distribuciones completamente distintas.
Ejemplo:
Grupo A:
todos alrededor de 5.
Grupo B:
mitad 1 y mitad 9.
Misma media:
Pero grupos:
muy diferentes.
Por eso debes:
mirar los datos
y no limitarte:
a F.
Error frecuente 1
Utilizar varias t de Student para tres o más grupos.
Aumenta el problema de:
múltiples comparaciones.
Error 2
Interpretar ANOVA significativa como:
todos los grupos son diferentes.
Incorrecto.
Error 3
No realizar post hoc cuando son necesarios.
Sabes que existe diferencia:
pero no dónde.
Error 4
Usar Tukey con varianzas claramente heterogéneas sin valorar alternativas.
Games-Howell puede ser más apropiada.
Error 5
Saltar directamente a Kruskal-Wallis por Levene.
Welch está específicamente diseñada para:
heterogeneidad.
Error 6
Interpretar Levene p > .05 como prueba de igualdad perfecta.
Solo indica:
ausencia de evidencia suficiente contra el supuesto.
Error 7
Comprobar normalidad juntando grupos con medias muy diferentes.
Revisa:
grupos/residuos.
Error 8
Usar Shapiro-Wilk como interruptor automático.
Revisa:
gráficos;
outliers;
N;
robustez.
Error 9
Ignorar independencia.
No se corrige con:
un p-valor.
Error 10
Utilizar ANOVA independiente para pre-post.
Son:
medidas relacionadas.
Error 11
Informar solo p.
Incluye:
F;
grados de libertad;
tamaño del efecto;
medias.
Error 12
Decir “p = .000”.
Escribe:
p < .001.
Error 13
Interpretar F como tamaño del efecto.
No lo es.
Error 14
No informar eta u otra medida de magnitud.
Significación no basta.
Error 15
Llamar causal a una diferencia observacional.
El diseño importa.
Error 16
Eliminar outliers para conseguir significación.
Nunca.
Error 17
Agrupar categorías después de ver resultados.
Necesitas:
justificación conceptual.
Error 18
Ejecutar cinco post hoc y quedarse con el más favorable.
La elección depende:
del método.
Error 19
Pegar directamente todas las tablas de SPSS.
Resume:
la información importante.
Error 20
No mirar las medias.
Una ANOVA significativa sin descriptivos es:
difícil de interpretar.
Cómo redactar una ANOVA en metodología
Ejemplo:
Las diferencias en satisfacción laboral entre las modalidades presencial, híbrida y remota se analizaron mediante una ANOVA de un factor. Previamente se examinó la independencia de las observaciones, la distribución de los datos por grupo y la homogeneidad de varianzas mediante la prueba de Levene. Cuando se cumplió razonablemente el supuesto de igualdad de varianzas se utilizaron comparaciones post hoc de Tukey. Se estimó también el tamaño del efecto correspondiente.
Si utilizaste Welch:
Ante la existencia de heterogeneidad de varianzas, la comparación global se realizó mediante la ANOVA de Welch y las comparaciones posteriores mediante Games-Howell.
Muy claro.
Cómo redactar una ANOVA en resultados
Ejemplo:
Se observaron diferencias estadísticamente significativas en satisfacción laboral según modalidad de trabajo, F(2,177) = 9,42, p < .001, η² = .096. Las comparaciones post hoc de Tukey mostraron una mayor satisfacción entre los trabajadores híbridos (M = 7,32; DE = 1,01) que entre los presenciales (M = 6,41; DE = 1,14; p < .001). No se observaron diferencias significativas entre las modalidades híbrida y remota (p = .438).
Esto ofrece:
F;
gl;
p;
efecto;
medias;
post hoc.
Ejemplo con Welch
La prueba de Levene indicó heterogeneidad de varianzas, p = .003. Por este motivo se utilizó la ANOVA de Welch, que mostró diferencias estadísticamente significativas entre los grupos, F(2,91.6) = 6,84, p = .002. Las comparaciones Games-Howell indicaron que...
Eso demuestra:
que entendiste por qué cambiaste el procedimiento.
Tabla limpia para resultados
Grupo | n | M | DE |
Presencial | 60 | 6,41 | 1,14 |
Híbrido | 61 | 7,32 | 1,01 |
Remoto | 59 | 7,10 | 1,38 |
Debajo puedes indicar:
F(2,177) = 9,42.
p < .001.
η² = .096.
Después explicar:
post hoc.
No necesitas pegar:
la tabla gris de SPSS.
Checklist antes de ejecutar ANOVA
Tengo una variable dependiente cuantitativa.
Tengo un factor categórico.
Los grupos son independientes.
Sé si realmente tengo un diseño entre sujetos.
He revisado el N de cada grupo.
He mirado las medias.
He revisado desviaciones estándar.
He utilizado gráficos.
He comprobado valores extremos.
He valorado normalidad por grupos/residuos.
No estoy decidiendo todo únicamente con Shapiro.
He comprobado homogeneidad mediante Levene.
Si existe heterogeneidad, he considerado Welch.
Sé qué post hoc corresponde.
No escogeré el post hoc según qué p sea menor.
Informaré F y grados de libertad.
Informaré el p-valor correctamente.
Informaré una medida de tamaño del efecto.
Si la prueba global es significativa, identificaré qué grupos difieren.
No interpretaré diferencias observacionales como causalidad.
La ANOVA responde directamente a uno de mis objetivos.
Preguntas frecuentes
¿Qué es una ANOVA?
Es un procedimiento estadístico utilizado para comparar medias entre varios niveles de un factor mediante la comparación de variabilidad entre grupos y variabilidad residual.
¿Cuándo utilizo una ANOVA en un TFG?
Cuando quieres comparar una variable cuantitativa entre varios grupos independientes y las condiciones del modelo resultan razonables.
¿ANOVA es solo para tres grupos?
No. Puede utilizarse con dos, tres o más, aunque con únicamente dos grupos suele resultar más directa una t de Student.
¿Qué significa F?
Es una razón entre fuentes de variabilidad asociadas al factor y al error dentro del modelo.
¿Qué significa p < .05 en ANOVA?
Indica evidencia de que no todas las medias poblacionales son iguales bajo el modelo utilizado.
¿Me dice qué grupos son diferentes?
No. Una prueba global significativa no identifica por sí sola los pares responsables.
¿Qué es un post hoc?
Es un procedimiento de comparaciones posteriores destinado a identificar qué grupos difieren controlando el problema de múltiples comparaciones.
¿Cuándo uso Tukey?
Es especialmente habitual para comparar todos los pares cuando resulta razonable asumir igualdad de varianzas.
¿Cuándo uso Games-Howell?
Es una opción diseñada para comparaciones por pares cuando no se asume igualdad de varianzas.
¿Qué es Levene?
Es una prueba utilizada para valorar la homogeneidad de las varianzas entre grupos.
¿Qué significa Levene p < .05?
Aporta evidencia de que las varianzas no son iguales, por lo que puede ser conveniente utilizar métodos robustos como Welch y post hoc adecuados a heterogeneidad.
¿Qué es Welch?
Es una versión robusta de la comparación de medias especialmente útil cuando las varianzas no son iguales.
¿Si Levene es significativo tengo que usar Kruskal-Wallis?
No automáticamente. Welch permite seguir comparando medias sin asumir igualdad de varianzas.
¿Qué es Kruskal-Wallis?
Es un procedimiento basado en rangos para comparar varios grupos independientes cuando ese enfoque resulta más adecuado a los datos.
¿ANOVA necesita normalidad perfecta?
No. La ANOVA puede ser relativamente robusta frente a determinadas desviaciones, especialmente con muestras suficientemente grandes y grupos equilibrados.
¿Dónde compruebo normalidad?
En diseños sencillos puede ser útil examinar distribuciones por grupo y residuos, utilizando gráficos y otras herramientas de diagnóstico.
¿Qué es eta cuadrado?
Es una medida del tamaño del efecto asociada con la proporción de variabilidad vinculada al factor dentro del modelo.
¿Qué diferencia hay entre significación y tamaño del efecto?
El p-valor informa sobre evidencia estadística frente a la hipótesis nula. El tamaño del efecto informa sobre la magnitud de las diferencias.
¿Una ANOVA significativa demuestra causalidad?
No. La causalidad depende principalmente del diseño de la investigación.
¿Puedo utilizar ANOVA para las mismas personas antes y después?
No debes aplicar automáticamente una ANOVA de grupos independientes. Para mediciones repetidas existen procedimientos específicos.
¿Cómo hago ANOVA en SPSS?
Ruta habitual:
Analizar → Comparar medias → ANOVA de un factor.
¿SPSS calcula Tukey y Games-Howell?
Sí. Ambos aparecen entre las pruebas post hoc disponibles.
¿Tengo que copiar todo el output de SPSS?
No. Presenta descriptivos, resultado global, tamaño del efecto y comparaciones relevantes de forma clara.
Ejemplo final completo
Imagina este TFG:
Satisfacción académica según modalidad de enseñanza.
Tienes:
180 estudiantes.
Presencial
n = 60.
M = 6,20.
DE = 1,18.
Híbrida
n = 60.
M = 7,28.
DE = .95.
Online
n = 60.
M = 7,05.
DE = 1,04.
Tu pregunta es:
¿Existen diferencias en satisfacción académica según modalidad?
Primero:
revisas boxplots.
No aparecen:
outliers graves.
Después:
normalidad por grupos.
No observas:
desviaciones especialmente problemáticas.
Levene:
p = .314.
No existe evidencia significativa contra:
homogeneidad de varianzas.
Realizas:
ANOVA clásica.
Resultado:
F(2,177) = 18,32.
p < .001.
η² = .172.
Existe una diferencia global.
Ahora:
Tukey.
Presencial vs Híbrida
Diferencia:
-1,08.
p < .001.
Presencial vs Online
Diferencia:
-.85.
p < .001.
Híbrida vs Online
Diferencia:
.23.
p = .492.
Puedes redactar:
Se observaron diferencias estadísticamente significativas en la satisfacción académica según la modalidad de enseñanza, F(2,177) = 18,32, p < .001, η² = .172. Las comparaciones post hoc de Tukey mostraron que los estudiantes de modalidad presencial presentaron una satisfacción inferior a los estudiantes de modalidad híbrida (p < .001) y online (p < .001). No se observaron diferencias estadísticamente significativas entre los grupos híbrido y online (p = .492).
Ahora sabemos exactamente:
qué significa el ANOVA.
No:
“Hay diferencias entre los tres grupos.”
Porque eso sería incorrecto.
Los resultados indican:
Presencial ≠ Híbrido.
Presencial ≠ Online.
Híbrido ≈ Online dentro de la evidencia obtenida.
La regla más importante
Cuando SPSS te muestre:
ANOVA: p < .05
no cierres el programa.
Acabas de responder únicamente:
“¿existe alguna diferencia?”
Todavía necesitas responder:
¿entre qué grupos?
¿cuánto difieren?
¿se cumple razonablemente la homogeneidad?
¿necesito Welch?
¿Tukey o Games-Howell?
¿qué tamaño tiene el efecto?
¿qué muestran realmente las medias?
Porque hacer una ANOVA consiste en:
pulsar unos pocos botones.
Interpretarla correctamente consiste en entender que:
el resultado global es solo el principio del análisis.





Comentarios