top of page
Buscar

ANOVA en un TFG: cómo hacerla e interpretarla en SPSS

Foto del escritor: Tu TFG Aprobado
Tu TFG Aprobado
hace 1 día
22 min de lectura

ANOVA en un TFG: cómo hacerla e interpretarla en SPSS

Tienes tres grupos.

Quieres comparar sus medias.

Por ejemplo:

satisfacción de estudiantes:

  • presenciales;

  • híbridos;

  • online.

O niveles de estrés entre:

  • primer curso;

  • segundo;

  • tercero;

  • cuarto.

O intención de compra después de mostrar:

  • anuncio A;

  • anuncio B;

  • anuncio C.

Entonces aparece una de las pruebas más conocidas de SPSS:

ANOVA.

La ejecutas.

SPSS devuelve:

F = 6,84.

p = .002.

Y parece que el análisis ha terminado.

Pero no.

Una ANOVA significativa te dice que existen diferencias entre las medias del conjunto de grupos.

No te dice automáticamente:

qué grupos son diferentes.

Tampoco te dice:

qué magnitud tienen esas diferencias.

Y antes de interpretar F necesitas comprobar cuestiones como:

  • independencia;

  • distribución de los errores;

  • homogeneidad de varianzas;

  • presencia de valores extremos;

  • tamaño y equilibrio de los grupos.

Si Levene resulta significativo quizá tengas que considerar:

ANOVA de Welch.

Si la ANOVA global resulta significativa necesitarás, en muchos diseños:

comparaciones post hoc.

Y la elección entre:

Tukey

y:

Games-Howell

no debería hacerse al azar.

Vamos paso a paso.

¿Qué es una ANOVA?

ANOVA significa:

Analysis of Variance

o:

análisis de la varianza.

Aunque su objetivo habitual consiste en comparar:

medias.

Esto puede parecer extraño.

Si quiero comparar medias:

¿por qué se llama análisis de varianza?

Porque la prueba estudia la relación entre dos fuentes de variabilidad:

  1. Variabilidad existente entre las medias de los grupos.

  2. Variabilidad existente dentro de cada grupo.

Si los grupos tienen medias realmente parecidas:

la variabilidad entre grupos debería ser relativamente pequeña respecto de la variabilidad interna.

Si las medias difieren mucho:

la variabilidad entre grupos aumenta.

La ANOVA resume esta comparación mediante:

el estadístico F.

NIST describe precisamente la ANOVA de un factor mediante la comparación de la variabilidad entre niveles con la variabilidad residual existente dentro de ellos.

Ejemplo sencillo

Quieres comparar satisfacción académica.

Presencial

M = 6,2.

Híbrida

M = 7,1.

Online

M = 7,4.

Las medias parecen diferentes.

Pero también necesitamos conocer:

cuánto varían las respuestas dentro de cada grupo.

Imagina que las puntuaciones de todos los participantes son extremadamente dispersas.

Una diferencia de:

1 punto

entre medias quizá no sea tan clara.

Ahora imagina que dentro de cada grupo prácticamente todos responden muy parecido.

Esa misma diferencia de:

1 punto

puede resultar mucho más evidente.

La ANOVA combina precisamente:

diferencia entre grupos

con:

variabilidad dentro de los grupos.

¿Cuándo se utiliza una ANOVA de un factor?

En su forma más básica necesitas:

Una variable dependiente cuantitativa

Ejemplos:

  • puntuación de ansiedad;

  • satisfacción;

  • nota;

  • salario;

  • tiempo;

  • puntuación total de una escala.

Una variable independiente categórica

Con diferentes grupos.

Ejemplos:

Modalidad:

  • presencial;

  • híbrida;

  • online.

Curso:

  • primero;

  • segundo;

  • tercero;

  • cuarto.

Tratamiento:

  • A;

  • B;

  • C.

Cuando existe:

una variable categórica independiente

hablamos de:

ANOVA de un factor.

¿Tiene que haber tres grupos?

La ANOVA puede trabajar técnicamente con dos grupos.

Pero si únicamente tienes:

dos grupos independientes,

una t de Student suele proporcionar una forma más directa de plantear la comparación.

La ANOVA adquiere especial utilidad cuando tienes:

tres o más medias.

Ejemplo:

Grupo A.

Grupo B.

Grupo C.

Grupo D.

¿Por qué no hacer varias t de Student?

Imagina tres grupos:

A.

B.

C.

Puedes realizar:

A vs B.

A vs C.

B vs C.

Tres pruebas.

Con cuatro grupos:

A-B.

A-C.

A-D.

B-C.

B-D.

C-D.

Ya tienes:

seis comparaciones.

Cuantas más pruebas realices utilizando repetidamente α = .05:

mayor será la probabilidad de obtener al menos algún resultado significativo por azar.

La ANOVA comienza con una prueba:

global.

Pregunta:

¿Existe evidencia de que no todas las medias poblacionales sean iguales?

Después, cuando corresponde, realizamos comparaciones controladas.

Hipótesis de la ANOVA

Supongamos tres grupos.

Hipótesis nula

H₀:

μ₁ = μ₂ = μ₃.

Todas las medias poblacionales son iguales.

Hipótesis alternativa

No todas las medias son iguales.

Importante:

la alternativa no dice:

todas son diferentes entre sí.

Basta con que exista:

al menos alguna diferencia.

Ejemplo

Medias:

Grupo A = 5.

Grupo B = 5.

Grupo C = 8.

La hipótesis nula es falsa.

Pero:

A y B

son prácticamente iguales.

Por eso un ANOVA significativo no significa:

todos los grupos difieren de todos los demás.

¿Qué significa F?

El estadístico F representa, de manera simplificada, una relación entre:

variabilidad entre grupos

y:

variabilidad dentro de los grupos.

Si:

F ≈ 1,

ambas fuentes de variabilidad tienen magnitudes relativamente parecidas.

Si:

F aumenta,

existe más variabilidad entre las medias en relación con el ruido interno.

Pero:

un valor de F no se interpreta aislado.

Necesitas:

  • grados de libertad;

  • p-valor;

  • tamaño del efecto;

  • medias;

  • comparaciones posteriores.

Ejemplo

F(2,147) = 7,82.

p < .001.

El:

2

representa los grados de libertad asociados al factor.

El:

147

los grados relacionados con el error.

No necesitas memorizar cómo SPSS calcula cada suma de cuadrados para interpretar un TFG correctamente.

Pero debes saber qué estás informando.

¿Cómo se calculan los grados de libertad?

En una ANOVA sencilla con:

k grupos

y:

N participantes,

de forma general:

Entre grupos

k - 1.

Dentro de grupos

N - k.

Ejemplo:

3 grupos.

N = 150.

Entre:

3 - 1 = 2.

Dentro:

150 - 3 = 147.

Resultado:

F(2,147).

¿Qué significa p < .05?

Supongamos:

F(2,147) = 7,82.

p < .001.

Con α = .05:

rechazamos la hipótesis de igualdad global de medias.

Puedes escribir:

Se observaron diferencias estadísticamente significativas entre las medias de los grupos.

Pero todavía no sabes:

entre cuáles.

¿Qué significa p > .05?

Ejemplo:

F(2,147) = 1,28.

p = .281.

No encontramos evidencia suficiente para rechazar:

la igualdad global de medias.

No escribas:

Los tres grupos son idénticos.

No has demostrado:

igualdad perfecta.

Solo:

no has encontrado evidencia suficiente de diferencias globales con ese diseño y muestra.

Antes de ANOVA: mira los descriptivos

Nunca empieces leyendo:

p.

Primero mira:

  • N;

  • media;

  • desviación estándar;

  • intervalos;

  • mínimo;

  • máximo.

SPSS puede proporcionar todos estos descriptivos para cada grupo.

Ejemplo:

Grupo

n

M

DE

Presencial

50

6,20

1,10

Híbrido

52

7,05

0,95

Online

48

7,42

1,02

Antes de realizar ningún post hoc ya observas:

Presencial parece tener:

menor satisfacción.

Los gráficos ayudan

Puedes utilizar:

  • boxplots;

  • gráficos de medias con intervalos;

  • distribución por grupos.

Un boxplot puede mostrar rápidamente:

  • diferencias centrales;

  • dispersión;

  • asimetría;

  • valores extremos.

No interpretes únicamente:

una tabla.

Supuestos de una ANOVA

Los principales son:

  1. Independencia de observaciones.

  2. Distribución aproximadamente normal de los errores dentro de los grupos.

  3. Homogeneidad de varianzas.

NIST y Penn State presentan precisamente independencia, normalidad y varianza común como los supuestos centrales de la ANOVA de un factor.

1. Independencia

Cada participante debería aportar una observación independiente dentro del diseño.

Ejemplo:

Grupo presencial:

50 estudiantes.

Grupo híbrido:

50 estudiantes.

Grupo online:

50 estudiantes diferentes.

Perfecto.

Problema: misma persona en varios grupos

Imagina:

mides a las mismas 50 personas:

antes;

durante;

después.

No son:

tres grupos independientes.

Son:

las mismas personas en tres momentos.

Aquí necesitas considerar:

ANOVA de medidas repetidas

u otro modelo apropiado.

No una ANOVA independiente de un factor.

Otro problema

Seleccionas:

100 alumnos.

Pero provienen de:

5 aulas.

Los alumnos dentro de una misma aula pueden compartir:

profesor;

entorno;

dinámica.

Dependiendo del objetivo, puede existir una estructura de:

datos agrupados.

Una ANOVA sencilla quizá no refleje toda esa dependencia.

La independencia se decide principalmente por el diseño

No existe un botón en SPSS que arregle:

observaciones no independientes.

Debes saber:

cómo fueron recogidos los datos.

2. Normalidad

Aquí vuelve a aparecer uno de los errores clásicos.

No significa necesariamente:

La variable dependiente debe ser perfectamente normal en toda la muestra.

En una ANOVA interesa la distribución de:

los errores dentro de cada grupo

bajo el modelo.

En diseños sencillos puedes revisar:

la variable dentro de cada grupo;

residuos;

Q-Q plots;

outliers.

No mezcles todos los grupos para comprobar normalidad

Ejemplo:

Grupo A:

media 2.

Grupo B:

media 5.

Grupo C:

media 8.

Cada grupo puede presentar:

una distribución aproximadamente normal.

Pero si los juntas:

la distribución total puede parecer:

extraña o multimodal.

Eso no significa automáticamente que:

el supuesto del modelo esté mal.

Revisa los datos:

por grupos

o los residuos correspondientes.

¿Tengo que usar Shapiro-Wilk?

Puede aportar información.

Pero no tomes una decisión únicamente con:

p.

Ejemplo:

N = 500.

Shapiro:

p < .001.

Los Q-Q plots muestran:

desviaciones muy pequeñas.

Los grupos están:

equilibrados.

No existen outliers graves.

Una ANOVA puede ser bastante robusta frente a determinadas desviaciones moderadas.

IBM señala que la ANOVA de un factor es relativamente robusta frente a desviaciones de normalidad, especialmente cuando los datos son razonablemente simétricos.

Penn State también señala que las desviaciones moderadas de normalidad y homogeneidad pueden ser menos problemáticas cuando las muestras son suficientemente grandes y equilibradas.

Muestra pequeña: mayor cuidado

Si tienes:

n = 8 por grupo,

la situación cambia.

Una distribución:

muy asimétrica

o:

outliers

pueden tener una influencia mucho mayor.

No escribas:

Shapiro p > .05, por tanto normalidad perfecta.

Con muestras pequeñas:

las pruebas de normalidad pueden tener poca capacidad para detectar problemas.

Combina:

estadísticos

y:

gráficos.

3. Homogeneidad de varianzas

La ANOVA clásica presupone:

varianzas similares entre los grupos.

Ejemplo:

Presencial:

DE = 1,0.

Híbrido:

DE = 1,1.

Online:

DE = 0,9.

Muy parecidas.

Otro:

Presencial:

DE = 0,5.

Híbrido:

DE = 1,0.

Online:

DE = 4,8.

Ahora existe:

una diferencia enorme.

Aquí aparece:

la prueba de Levene.

¿Qué es Levene?

Levene contrasta la hipótesis:

H₀:

las varianzas poblacionales son iguales.

Si:

p > .05,

no tenemos evidencia suficiente para rechazar:

homogeneidad.

Si:

p < .05,

existe evidencia de:

varianzas diferentes.

SPSS incluye Levene específicamente para evaluar el supuesto de homogeneidad en ANOVA.

Ejemplo

Levene:

F = 1,12.

p = .329.

No existe evidencia significativa de:

heterogeneidad.

Otro:

Levene:

F = 8,34.

p < .001.

Existe una señal clara de:

varianzas desiguales.

¿Qué hago si Levene es significativo?

Este es un punto fundamental.

Muchos estudiantes hacen:

Levene p < .05.

Kruskal-Wallis.

No es necesariamente la primera decisión correcta.

Puedes considerar:

ANOVA de Welch.

Welch está diseñada para comparar medias cuando no puedes asumir:

igualdad de varianzas.

ANOVA de Welch

Es una versión robusta de la comparación de medias que ajusta el estadístico y los grados de libertad cuando las varianzas son diferentes.

SPSS incluye pruebas robustas de igualdad de medias dentro del procedimiento de ANOVA de un factor.

Puede resultar especialmente útil cuando tienes:

  • varianzas desiguales;

  • tamaños de grupo diferentes.

Ejemplo

Levene:

p < .001.

ANOVA clásica:

F(2,147) = 5,90.

p = .003.

Welch:

F(2,87.4) = 7,11.

p = .001.

En esta situación puedes basar la interpretación principal en:

Welch.

¿Welch es “no paramétrica”?

No.

Sigue siendo un procedimiento para comparar:

medias.

No es equivalente a:

Kruskal-Wallis.

Es una alternativa robusta dentro de la familia de pruebas paramétricas.

¿Qué es Brown-Forsythe?

SPSS también puede proporcionar:

Brown-Forsythe

como prueba robusta de igualdad de medias.

Es otra alternativa cuando existen:

problemas de homogeneidad.

En muchos TFG:

Welch será la opción más conocida.

No necesitas informar:

ANOVA clásica + Welch + Brown-Forsythe

sin una razón.

¿Cuándo usar Kruskal-Wallis?

Puede resultar apropiada cuando tienes:

varios grupos independientes

y un análisis basado en rangos resulta más adecuado.

Por ejemplo:

  • variable ordinal;

  • distribución muy problemática;

  • outliers extremos;

  • condiciones que hacen poco razonable la ANOVA.

Pero no utilices:

Kruskal-Wallis

automáticamente porque:

Levene p < .05.

Welch puede ser una solución mucho más directa para:

heterogeneidad de varianzas.

ANOVA no significativa: ¿hago post hoc?

En general:

si tu ANOVA global no muestra evidencia de diferencias

y no tenías comparaciones planificadas a priori,

no tiene sentido empezar a probar:

todos los pares

hasta encontrar un:

p < .05.

Eso sería:

buscar significación.

ANOVA significativa: empieza la segunda parte

Supongamos:

F(2,147) = 8,10.

p < .001.

Ahora sabemos:

al menos alguna media difiere.

Pero no sabemos:

cuál.

Necesitamos:

comparaciones post hoc

o:

contrastes planificados.

¿Qué es una prueba post hoc?

Post hoc significa:

posterior.

Permite comparar:

pares de grupos

controlando de distintas formas el problema de realizar:

múltiples comparaciones.

Ejemplo:

A vs B.

A vs C.

B vs C.

SPSS incluye una amplia variedad de procedimientos post hoc.

Tukey

Una de las opciones más conocidas.

Tukey HSD realiza:

comparaciones por pares

controlando el error global para el conjunto de comparaciones.

Es especialmente habitual cuando:

  • quieres comparar todos los grupos;

  • puedes asumir varianzas iguales.

IBM incluye Tukey entre los post hoc para situaciones donde se asume igualdad de varianzas.

Ejemplo

ANOVA:

p < .001.

Tukey:

Presencial vs Híbrido:

p = .012.

Presencial vs Online:

p < .001.

Híbrido vs Online:

p = .640.

Interpretación:

Presencial presenta:

menor satisfacción que:

Híbrido

y:

Online.

Pero Híbrido y Online:

no muestran diferencias significativas.

Esta es la verdadera interpretación

No:

Los tres grupos son diferentes.

Porque:

Híbrido y Online

no lo son.

Bonferroni

Otra alternativa.

Realiza comparaciones por pares ajustando:

el nivel de significación

para controlar el error familiar.

Es más conservadora en determinados contextos.

Puede resultar útil cuando:

tienes un número limitado de comparaciones.

¿Tukey o Bonferroni?

No existe una opción universal.

Tukey resulta especialmente natural para:

todas las comparaciones por pares.

Bonferroni puede utilizarse:

para un conjunto de comparaciones específicas.

Lo importante es:

no ejecutar diez métodos y quedarse con:

el que produzca más significación.

Games-Howell

Muy importante cuando:

las varianzas no son iguales.

IBM clasifica Games-Howell entre los procedimientos post hoc que no presuponen igualdad de varianzas.

Por tanto:

Levene significativo


Welch


Games-Howell

puede constituir una combinación muy razonable.

Regla práctica

Varianzas razonablemente homogéneas

ANOVA clásica.

Post hoc:

Tukey

cuando corresponde.

Varianzas claramente heterogéneas

Welch.

Post hoc:

Games-Howell.

No conviertas esto en:

una ley mecánica.

Pero es una guía muy útil.

Tamhane T2

Otra prueba que no asume:

igualdad de varianzas.

IBM la describe como:

una comparación conservadora apropiada cuando las varianzas son diferentes.

En muchos TFG encontrarás:

Games-Howell

con mayor frecuencia.

Dunnett

Puede ser muy útil cuando no quieres comparar:

todos contra todos.

Ejemplo:

tienes:

un grupo control

y:

tres tratamientos.

Solo te interesa:

Tratamiento A vs Control.

Tratamiento B vs Control.

Tratamiento C vs Control.

No necesitas:

A vs B;

A vs C;

B vs C.

Dunnett está diseñado precisamente para comparar varios grupos con:

un control.

Contrastes planificados

No todas las comparaciones tienen que ser:

post hoc.

Si antes de ver los resultados ya tenías una hipótesis concreta:

puedes plantear:

contrastes a priori.

Ejemplo:

Hipótesis:

La modalidad online diferirá del promedio de presencial e híbrida.

Esto puede representarse mediante:

un contraste planificado.

SPSS permite especificar contrastes dentro de ANOVA de un factor.

No confundas post hoc y contraste a priori

A priori

Definido:

antes de examinar resultados.

Deriva de:

hipótesis.

Post hoc

Explora:

qué grupos difieren

después del contraste global.

Esta distinción mejora mucho:

la metodología.

¿Qué significa la diferencia de medias en un post hoc?

Ejemplo:

Presencial - Online = -1,22.

Significa:

la media de Presencial es:

1,22 puntos menor.

Si:

IC 95 % [-1,80; -.64]

y:

p < .001,

la diferencia está bastante clara.

No informes únicamente:

p.

La:

diferencia de medias

también tiene una interpretación sustantiva.

El intervalo de confianza del post hoc

Aporta:

magnitud

e:

incertidumbre.

Ejemplo:

Diferencia:

0,70.

IC:

[0,05; 1,35].

Existe bastante incertidumbre.

Otro:

0,70.

IC:

[0,62; 0,78].

Estimación:

mucho más precisa.

Tamaño del efecto en ANOVA

Una ANOVA significativa no te dice:

qué importancia tienen las diferencias.

Aquí aparecen medidas como:

eta cuadrado

η².

eta cuadrado parcial

η²p.

omega cuadrado

ω².

SPSS permite actualmente solicitar estimaciones de tamaño del efecto dentro de ANOVA de un factor.

¿Qué es eta cuadrado?

De manera sencilla:

indica qué proporción de la variabilidad total está asociada con:

el factor

en un diseño de un factor.

Ejemplo:

η² = .10.

Aproximadamente:

10 % de la variabilidad observada

está asociada a las diferencias entre grupos dentro del modelo.

Pero no escribas:

“El grupo causa el 10 %.”

Una ANOVA observacional no demuestra:

causalidad.

Eta cuadrado puede estar sesgada al alza

Especialmente con:

muestras pequeñas.

Por eso puede utilizarse:

omega cuadrado

como una estimación menos sesgada del tamaño del efecto poblacional.

No necesitas calcular:

η²;

η²p;

ω²

todos a la vez.

Utiliza:

la medida apropiada

y explica:

cuál estás informando.

¿Eta cuadrado y eta cuadrado parcial son iguales?

No siempre.

En una ANOVA de un único factor sencilla pueden estar estrechamente relacionados.

En diseños con:

varios factores;

covariables;

medidas repetidas,

pueden tener interpretaciones diferentes.

No utilices:

η²

y:

η²p

como si fueran símbolos intercambiables.

Puntos de corte del tamaño del efecto

Puedes encontrar referencias como:

.01 pequeño.

.06 medio.

.14 grande.

Para eta cuadrado.

Son:

referencias convencionales.

No fronteras universales.

Un η² de:

.059

no es científicamente diferente de:

.060.

La interpretación debe tener en cuenta:

tu área de investigación.

Ejemplo

ANOVA:

F(2,147) = 10,50.

p < .001.

η² = .13.

Puedes escribir:

Se observaron diferencias estadísticamente significativas entre los grupos, F(2,147) = 10,50, p < .001, η² = .13.

Después:

post hoc.

Significativo no significa grande

N = 5.000.

F enorme.

p < .001.

η² = .004.

Existe:

diferencia estadística.

Pero el factor se relaciona con:

muy poca variabilidad.

No describas:

diferencias muy importantes.

Mira:

tamaño del efecto.

No significativo con efecto aparentemente considerable

N pequeño.

η² = .08.

p = .09.

No puedes afirmar:

Existe una diferencia significativa.

Pero tampoco ignores:

la magnitud estimada.

Necesitas mencionar:

la incertidumbre.

Valores extremos

Una ANOVA basada en medias puede resultar sensible a:

outliers.

Ejemplo:

Grupo A:

5, 5, 6, 5, 100.

Ese:

100

puede mover:

media;

varianza;

F.

Antes del análisis revisa:

boxplots.

No elimines outliers para conseguir significación

Pregunta:

¿es un error?

Ejemplo:

Edad = 280.

Probablemente sí.

¿Es un dato real extremo?

Ejemplo:

ingresos muy altos.

Puede ser:

real.

No lo elimines únicamente porque:

Levene deja de ser significativo

o:

ANOVA pasa a p < .05.

Grupos desequilibrados

Ejemplo:

Grupo A:

n = 100.

Grupo B:

n = 95.

Grupo C:

n = 8.

Esto puede generar:

problemas de precisión.

Especialmente si:

el grupo pequeño

tiene una varianza muy diferente.

Una ANOVA clásica es más robusta cuando:

los tamaños son relativamente equilibrados.

Penn State señala precisamente que la robustez aumenta cuando los grupos tienen tamaños similares.

Grupo pequeño no significa automáticamente eliminarlo

Quizá esa categoría es:

muy importante.

Pero debes:

interpretar con cautela.

Valorar:

Welch.

Considerar:

intervalos.

Reconocer:

la limitación.

¿Puedo unir grupos pequeños?

Solo si existe:

una justificación conceptual.

Ejemplo:

Curso:

5.º y 6.º

pueden agruparse como:

cursos avanzados

si el diseño lo justifica.

No agrupes:

A y C

únicamente porque:

así Levene deja de ser significativo.

ANOVA de un factor vs ANOVA factorial

Hasta ahora hablamos de:

un factor.

Ejemplo:

Modalidad.

Pero podrías tener:

dos factores.

Ejemplo:

Modalidad:

presencial / online.

Sexo:

grupo A / grupo B.

Entonces aparece:

ANOVA factorial.

Permite estudiar:

  • efecto principal de modalidad;

  • efecto principal del segundo factor;

  • interacción.

No es exactamente la misma pregunta.

¿Qué es una interacción?

Supongamos:

la modalidad online mejora mucho la satisfacción en:

un grupo.

Pero no tiene ningún efecto en:

otro.

Entonces la relación de modalidad con satisfacción depende de:

otra variable.

Eso es:

interacción.

Un ANOVA de un factor no puede estudiar:

esa interacción.

No hagas varias ANOVA separadas si tu pregunta es una interacción

Ejemplo:

ANOVA en hombres.

ANOVA en mujeres.

Y después:

“una fue significativa y otra no.”

Eso no demuestra:

que el efecto sea diferente entre sexos.

Necesitas probar:

la interacción

directamente.

ANOVA de medidas repetidas

Otra variante.

Mismas personas:

pretest.

postest.

seguimiento.

Eso no es:

ANOVA de grupos independientes.

Necesitas un modelo que tenga en cuenta:

la relación entre las medidas.

La ANOVA de medidas repetidas introduce supuestos adicionales como:

esfericidad.

No mezcles ambas técnicas.

ANOVA mixta

Puede combinar:

un factor entre sujetos

y:

otro intra-sujetos.

Ejemplo:

Tratamiento:

A/B.

Tiempo:

pre/post.

Permite analizar:

si los grupos evolucionan de manera diferente.

Es mucho más compleja que:

ANOVA de un factor.

Este artículo se centra en:

ANOVA de un factor entre grupos independientes.

¿Cómo hacer una ANOVA en SPSS?

Ruta:

Analizar → Comparar medias → ANOVA de un factor.

IBM documenta exactamente este procedimiento.

Paso 1. Variable dependiente

Introduce:

SATISFACCION.

Variable cuantitativa.

Paso 2. Factor

Introduce:

MODALIDAD.

Categorías:

1 = Presencial.

2 = Híbrida.

3 = Online.

Paso 3. Opciones

Solicita:

  • descriptivos;

  • homogeneidad de varianzas;

  • pruebas robustas;

  • tamaño del efecto cuando esté disponible.

Paso 4. Post hoc

Si esperas:

varianzas iguales,

puedes solicitar:

Tukey.

Si existen:

varianzas diferentes,

Games-Howell.

Puedes solicitar ambos inicialmente para tenerlos disponibles, pero tu interpretación debe seguir:

el diagnóstico adecuado.

Paso 5. Ejecutar

SPSS generará:

descriptivos;

Levene;

ANOVA;

Welch/Brown-Forsythe cuando se soliciten;

tamaños del efecto;

comparaciones múltiples.

Primera tabla: descriptivos

Ejemplo:

Modalidad

n

M

DE

Presencial

50

6,20

1,15

Híbrida

52

7,05

.92

Online

48

7,40

1,01

Antes de mirar:

p,

ya tenemos:

una idea clara.

Segunda tabla: Levene

Ejemplo:

Levene:

p = .218.

No existe evidencia significativa de:

varianzas diferentes.

Podemos considerar:

ANOVA clásica

y:

Tukey.

Tercera tabla: ANOVA

Ejemplo:

F(2,147) = 17,21.

p < .001.

Conclusión global:

al menos dos medias:

difieren.

Cuarta tabla: post hoc Tukey

Presencial vs Híbrida:

Diferencia = -.85.

p = .001.

Presencial vs Online:

Diferencia = -1.20.

p < .001.

Híbrida vs Online:

Diferencia = -.35.

p = .210.

Conclusión:

Presencial presenta menor satisfacción que:

Híbrida

y:

Online.

Híbrida y Online:

no muestran diferencias significativas.

Este sería un resultado completo

Se observaron diferencias en satisfacción según modalidad, F(2,147) = 17,21, p < .001. Las comparaciones post hoc de Tukey mostraron que los estudiantes presenciales presentaron una satisfacción inferior tanto a los estudiantes híbridos como a los online, mientras que no se observaron diferencias significativas entre los grupos híbrido y online.

Después añade:

tamaño del efecto.

Ejemplo con Levene significativo

Descriptivos:

A:

M = 5,2.

DE = .50.

B:

M = 6,1.

DE = 1,80.

C:

M = 7,0.

DE = 3,20.

Levene:

p < .001.

No ignores:

la heterogeneidad.

Solicitas:

Welch.

Welch:

F(2,72.5) = 8,91.

p < .001.

Post hoc:

Games-Howell.

Cómo redactarlo

La prueba de Levene indicó heterogeneidad de varianzas, p < .001, por lo que la comparación global se realizó mediante la ANOVA de Welch. Se observaron diferencias estadísticamente significativas entre los grupos, F(2,72.5) = 8,91, p < .001. Las comparaciones Games-Howell mostraron...

Eso demuestra:

criterio metodológico.

Tukey vs Games-Howell

Recuerda:

Tukey

Varianzas iguales razonables.

Games-Howell

No presupone igualdad de varianzas.

IBM distingue exactamente ambos grupos de procedimientos en sus opciones post hoc.

No hagas Tukey y Games-Howell y elijas el que da significativo

Ejemplo:

Tukey:

p = .061.

Games-Howell:

p = .038.

Entonces decides:

Games-Howell.

¿Por qué?

Si las varianzas eran:

homogéneas,

no deberías escoger:

la prueba por su resultado.

La decisión se basa en:

las condiciones del análisis.

¿Y si Levene p = .049?

No conviertas:

.049

y:

.051

en dos universos completamente distintos.

Revisa:

  • tamaños de grupos;

  • desviaciones;

  • gráficos;

  • robustez.

Welch es una alternativa muy razonable incluso cuando quieres mayor protección ante heterogeneidad.

La estadística no funciona mediante:

fronteras mágicas.

ANOVA robusta

Welch suele comportarse muy bien cuando existen:

varianzas diferentes.

Por eso algunos analistas la prefieren incluso como opción general cuando:

no existe una razón para asumir homogeneidad estricta.

En un TFG:

lo importante es explicar:

qué utilizaste

y:

por qué.

Kruskal-Wallis no compara exactamente medias

Este punto merece atención.

Muchos estudiantes escriben:

“Como no hay normalidad, utilicé Kruskal-Wallis para comparar medias.”

Kruskal-Wallis trabaja:

con rangos.

Su interpretación no es idéntica a:

comparar medias mediante ANOVA.

Dependiendo de la forma de las distribuciones puede interpretarse como:

diferencias de distribución

y, bajo ciertas condiciones, diferencias de localización.

No llames automáticamente:

“ANOVA no paramétrica de medias.”

Post hoc después de Kruskal-Wallis

Si Kruskal-Wallis resulta significativo:

también necesitas estudiar:

qué grupos difieren.

Pueden utilizarse:

comparaciones de Dunn

con correcciones por múltiples pruebas,

dependiendo del software y metodología.

No termines:

Kruskal p < .05.

¿Qué pasa con solo dos grupos?

ANOVA con:

2 grupos

producirá una conclusión equivalente a la t de Student correspondiente bajo los mismos supuestos.

De hecho:

F = t²

en ese caso.

Pero si solo existen dos grupos:

la t suele ser más intuitiva.

¿Qué pasa con cinco grupos?

Perfectamente válido.

La ANOVA global sigue respondiendo:

si existen diferencias en alguna media.

Pero el número de comparaciones por pares crece.

Cinco grupos:

10 pares.

Por eso el control de:

múltiples comparaciones

resulta todavía más importante.

La importancia del tamaño muestral

ANOVA depende:

del tamaño de muestra.

Con N enorme:

diferencias muy pequeñas pueden ser:

significativas.

Con N reducido:

diferencias relevantes pueden no alcanzar:

p < .05.

Por eso necesitas:

tamaño del efecto

y:

intervalos.

Planificar la muestra

Si ANOVA es:

tu análisis principal,

puedes utilizar:

G*Power

para realizar un análisis a priori.

Necesitarás:

  • número de grupos;

  • efecto esperado f;

  • alfa;

  • potencia.

No decidas el tamaño:

“30 por grupo porque es lo habitual.”

Tamaño del efecto f

Para la planificación mediante G*Power puede utilizarse:

Cohen's f.

Es otra medida de tamaño del efecto asociada a:

ANOVA.

No es:

d de Cohen.

No confundas:

d

con:

f.

Ejemplo de TFG de Psicología

Pregunta:

¿Existen diferencias en ansiedad según modalidad de estudio?

Grupos:

Presencial.

Híbrida.

Online.

Resultado:

Levene:

p = .45.

ANOVA:

F(2,207) = 6,42.

p = .002.

η² = .058.

Tukey:

Presencial vs Online:

p = .001.

Presencial vs Híbrida:

p = .17.

Híbrida vs Online:

p = .23.

Interpretación:

la diferencia global se debe principalmente a:

Presencial vs Online.

No:

a todos los grupos.

Ejemplo de Educación

Objetivo:

comparar motivación según:

1.º.

2.º.

3.º.

4.º.

ANOVA:

p < .001.

Post hoc:

1.º presenta menor motivación que:

3.º y 4.º.

No existe diferencia entre:

3.º y 4.º.

Redacción:

especifica:

exactamente ese patrón.

Ejemplo de ADE

Satisfacción laboral según:

presencial;

híbrido;

remoto.

Levene:

p = .002.

Utilizas:

Welch.

Games-Howell:

Híbrido > Presencial.

Remoto no difiere de:

ninguno de los dos.

No escribas:

“La modalidad híbrida es la mejor.”

Escribe:

los resultados observados.

Ejemplo de Marketing

Intención de compra después de:

Campaña A.

Campaña B.

Campaña C.

Resultado:

ANOVA significativa.

Tukey:

B > A.

B > C.

A = C.

Ahora puedes concluir:

Campaña B obtuvo una puntuación media de intención superior a:

A y C

dentro de la muestra.

Si el diseño fue experimental aleatorizado:

las inferencias causales pueden ser más defendibles que en una encuesta observacional.

ANOVA observacional no demuestra causalidad

Ejemplo:

comparar satisfacción según:

presencial;

híbrido;

remoto.

Los participantes no fueron asignados aleatoriamente.

Quizá los trabajadores remotos:

tienen puestos diferentes;

más autonomía;

mejor salario.

ANOVA encuentra:

diferencias.

No demuestra que:

la modalidad las cause.

No escribas “efecto” causal sin diseño apropiado

La terminología estadística habla de:

efecto del factor.

Pero en un estudio observacional es más prudente redactar:

Se observaron diferencias según modalidad.

No:

La modalidad produjo un aumento.

¿Qué hago si ANOVA no es significativa pero Tukey sí?

En procedimientos clásicos puede aparecer alguna combinación extraña dependiendo de:

ajustes;

métodos;

redondeos.

No utilices post hoc indiscriminadamente para:

rescatar significación.

Si tus comparaciones eran:

hipótesis específicas planificadas,

deberías plantearlas como:

contrastes a priori.

No como:

búsqueda posterior.

¿Qué pasa si las medias son iguales pero las distribuciones diferentes?

ANOVA se centra en:

medias.

Puedes tener:

misma media

pero:

distribuciones completamente distintas.

Ejemplo:

Grupo A:

todos alrededor de 5.

Grupo B:

mitad 1 y mitad 9.

Misma media:


Pero grupos:

muy diferentes.

Por eso debes:

mirar los datos

y no limitarte:

a F.

Error frecuente 1

Utilizar varias t de Student para tres o más grupos.

Aumenta el problema de:

múltiples comparaciones.

Error 2

Interpretar ANOVA significativa como:

todos los grupos son diferentes.

Incorrecto.

Error 3

No realizar post hoc cuando son necesarios.

Sabes que existe diferencia:

pero no dónde.

Error 4

Usar Tukey con varianzas claramente heterogéneas sin valorar alternativas.

Games-Howell puede ser más apropiada.

Error 5

Saltar directamente a Kruskal-Wallis por Levene.

Welch está específicamente diseñada para:

heterogeneidad.

Error 6

Interpretar Levene p > .05 como prueba de igualdad perfecta.

Solo indica:

ausencia de evidencia suficiente contra el supuesto.

Error 7

Comprobar normalidad juntando grupos con medias muy diferentes.

Revisa:

grupos/residuos.

Error 8

Usar Shapiro-Wilk como interruptor automático.

Revisa:

gráficos;

outliers;

N;

robustez.

Error 9

Ignorar independencia.

No se corrige con:

un p-valor.

Error 10

Utilizar ANOVA independiente para pre-post.

Son:

medidas relacionadas.

Error 11

Informar solo p.

Incluye:

F;

grados de libertad;

tamaño del efecto;

medias.

Error 12

Decir “p = .000”.

Escribe:

p < .001.

Error 13

Interpretar F como tamaño del efecto.

No lo es.

Error 14

No informar eta u otra medida de magnitud.

Significación no basta.

Error 15

Llamar causal a una diferencia observacional.

El diseño importa.

Error 16

Eliminar outliers para conseguir significación.

Nunca.

Error 17

Agrupar categorías después de ver resultados.

Necesitas:

justificación conceptual.

Error 18

Ejecutar cinco post hoc y quedarse con el más favorable.

La elección depende:

del método.

Error 19

Pegar directamente todas las tablas de SPSS.

Resume:

la información importante.

Error 20

No mirar las medias.

Una ANOVA significativa sin descriptivos es:

difícil de interpretar.

Cómo redactar una ANOVA en metodología

Ejemplo:

Las diferencias en satisfacción laboral entre las modalidades presencial, híbrida y remota se analizaron mediante una ANOVA de un factor. Previamente se examinó la independencia de las observaciones, la distribución de los datos por grupo y la homogeneidad de varianzas mediante la prueba de Levene. Cuando se cumplió razonablemente el supuesto de igualdad de varianzas se utilizaron comparaciones post hoc de Tukey. Se estimó también el tamaño del efecto correspondiente.

Si utilizaste Welch:

Ante la existencia de heterogeneidad de varianzas, la comparación global se realizó mediante la ANOVA de Welch y las comparaciones posteriores mediante Games-Howell.

Muy claro.

Cómo redactar una ANOVA en resultados

Ejemplo:

Se observaron diferencias estadísticamente significativas en satisfacción laboral según modalidad de trabajo, F(2,177) = 9,42, p < .001, η² = .096. Las comparaciones post hoc de Tukey mostraron una mayor satisfacción entre los trabajadores híbridos (M = 7,32; DE = 1,01) que entre los presenciales (M = 6,41; DE = 1,14; p < .001). No se observaron diferencias significativas entre las modalidades híbrida y remota (p = .438).

Esto ofrece:

  • F;

  • gl;

  • p;

  • efecto;

  • medias;

  • post hoc.

Ejemplo con Welch

La prueba de Levene indicó heterogeneidad de varianzas, p = .003. Por este motivo se utilizó la ANOVA de Welch, que mostró diferencias estadísticamente significativas entre los grupos, F(2,91.6) = 6,84, p = .002. Las comparaciones Games-Howell indicaron que...

Eso demuestra:

que entendiste por qué cambiaste el procedimiento.

Tabla limpia para resultados

Grupo

n

M

DE

Presencial

60

6,41

1,14

Híbrido

61

7,32

1,01

Remoto

59

7,10

1,38

Debajo puedes indicar:

F(2,177) = 9,42.

p < .001.

η² = .096.

Después explicar:

post hoc.

No necesitas pegar:

la tabla gris de SPSS.

Checklist antes de ejecutar ANOVA

  • Tengo una variable dependiente cuantitativa.

  • Tengo un factor categórico.

  • Los grupos son independientes.

  • Sé si realmente tengo un diseño entre sujetos.

  • He revisado el N de cada grupo.

  • He mirado las medias.

  • He revisado desviaciones estándar.

  • He utilizado gráficos.

  • He comprobado valores extremos.

  • He valorado normalidad por grupos/residuos.

  • No estoy decidiendo todo únicamente con Shapiro.

  • He comprobado homogeneidad mediante Levene.

  • Si existe heterogeneidad, he considerado Welch.

  • Sé qué post hoc corresponde.

  • No escogeré el post hoc según qué p sea menor.

  • Informaré F y grados de libertad.

  • Informaré el p-valor correctamente.

  • Informaré una medida de tamaño del efecto.

  • Si la prueba global es significativa, identificaré qué grupos difieren.

  • No interpretaré diferencias observacionales como causalidad.

  • La ANOVA responde directamente a uno de mis objetivos.

Preguntas frecuentes

¿Qué es una ANOVA?

Es un procedimiento estadístico utilizado para comparar medias entre varios niveles de un factor mediante la comparación de variabilidad entre grupos y variabilidad residual.

¿Cuándo utilizo una ANOVA en un TFG?

Cuando quieres comparar una variable cuantitativa entre varios grupos independientes y las condiciones del modelo resultan razonables.

¿ANOVA es solo para tres grupos?

No. Puede utilizarse con dos, tres o más, aunque con únicamente dos grupos suele resultar más directa una t de Student.

¿Qué significa F?

Es una razón entre fuentes de variabilidad asociadas al factor y al error dentro del modelo.

¿Qué significa p < .05 en ANOVA?

Indica evidencia de que no todas las medias poblacionales son iguales bajo el modelo utilizado.

¿Me dice qué grupos son diferentes?

No. Una prueba global significativa no identifica por sí sola los pares responsables.

¿Qué es un post hoc?

Es un procedimiento de comparaciones posteriores destinado a identificar qué grupos difieren controlando el problema de múltiples comparaciones.

¿Cuándo uso Tukey?

Es especialmente habitual para comparar todos los pares cuando resulta razonable asumir igualdad de varianzas.

¿Cuándo uso Games-Howell?

Es una opción diseñada para comparaciones por pares cuando no se asume igualdad de varianzas.

¿Qué es Levene?

Es una prueba utilizada para valorar la homogeneidad de las varianzas entre grupos.

¿Qué significa Levene p < .05?

Aporta evidencia de que las varianzas no son iguales, por lo que puede ser conveniente utilizar métodos robustos como Welch y post hoc adecuados a heterogeneidad.

¿Qué es Welch?

Es una versión robusta de la comparación de medias especialmente útil cuando las varianzas no son iguales.

¿Si Levene es significativo tengo que usar Kruskal-Wallis?

No automáticamente. Welch permite seguir comparando medias sin asumir igualdad de varianzas.

¿Qué es Kruskal-Wallis?

Es un procedimiento basado en rangos para comparar varios grupos independientes cuando ese enfoque resulta más adecuado a los datos.

¿ANOVA necesita normalidad perfecta?

No. La ANOVA puede ser relativamente robusta frente a determinadas desviaciones, especialmente con muestras suficientemente grandes y grupos equilibrados.

¿Dónde compruebo normalidad?

En diseños sencillos puede ser útil examinar distribuciones por grupo y residuos, utilizando gráficos y otras herramientas de diagnóstico.

¿Qué es eta cuadrado?

Es una medida del tamaño del efecto asociada con la proporción de variabilidad vinculada al factor dentro del modelo.

¿Qué diferencia hay entre significación y tamaño del efecto?

El p-valor informa sobre evidencia estadística frente a la hipótesis nula. El tamaño del efecto informa sobre la magnitud de las diferencias.

¿Una ANOVA significativa demuestra causalidad?

No. La causalidad depende principalmente del diseño de la investigación.

¿Puedo utilizar ANOVA para las mismas personas antes y después?

No debes aplicar automáticamente una ANOVA de grupos independientes. Para mediciones repetidas existen procedimientos específicos.

¿Cómo hago ANOVA en SPSS?

Ruta habitual:

Analizar → Comparar medias → ANOVA de un factor.

¿SPSS calcula Tukey y Games-Howell?

Sí. Ambos aparecen entre las pruebas post hoc disponibles.

¿Tengo que copiar todo el output de SPSS?

No. Presenta descriptivos, resultado global, tamaño del efecto y comparaciones relevantes de forma clara.

Ejemplo final completo

Imagina este TFG:

Satisfacción académica según modalidad de enseñanza.

Tienes:

180 estudiantes.

Presencial

n = 60.

M = 6,20.

DE = 1,18.

Híbrida

n = 60.

M = 7,28.

DE = .95.

Online

n = 60.

M = 7,05.

DE = 1,04.

Tu pregunta es:

¿Existen diferencias en satisfacción académica según modalidad?

Primero:

revisas boxplots.

No aparecen:

outliers graves.

Después:

normalidad por grupos.

No observas:

desviaciones especialmente problemáticas.

Levene:

p = .314.

No existe evidencia significativa contra:

homogeneidad de varianzas.

Realizas:

ANOVA clásica.

Resultado:

F(2,177) = 18,32.

p < .001.

η² = .172.

Existe una diferencia global.

Ahora:

Tukey.

Presencial vs Híbrida

Diferencia:

-1,08.

p < .001.

Presencial vs Online

Diferencia:

-.85.

p < .001.

Híbrida vs Online

Diferencia:

.23.

p = .492.

Puedes redactar:

Se observaron diferencias estadísticamente significativas en la satisfacción académica según la modalidad de enseñanza, F(2,177) = 18,32, p < .001, η² = .172. Las comparaciones post hoc de Tukey mostraron que los estudiantes de modalidad presencial presentaron una satisfacción inferior a los estudiantes de modalidad híbrida (p < .001) y online (p < .001). No se observaron diferencias estadísticamente significativas entre los grupos híbrido y online (p = .492).

Ahora sabemos exactamente:

qué significa el ANOVA.

No:

“Hay diferencias entre los tres grupos.”

Porque eso sería incorrecto.

Los resultados indican:

Presencial ≠ Híbrido.

Presencial ≠ Online.

Híbrido ≈ Online dentro de la evidencia obtenida.

La regla más importante

Cuando SPSS te muestre:

ANOVA: p < .05

no cierres el programa.

Acabas de responder únicamente:

“¿existe alguna diferencia?”

Todavía necesitas responder:

¿entre qué grupos?

¿cuánto difieren?

¿se cumple razonablemente la homogeneidad?

¿necesito Welch?

¿Tukey o Games-Howell?

¿qué tamaño tiene el efecto?

¿qué muestran realmente las medias?

Porque hacer una ANOVA consiste en:

pulsar unos pocos botones.

Interpretarla correctamente consiste en entender que:

el resultado global es solo el principio del análisis.


ANOVA en un TFG: cómo hacerla e interpretarla en SPSS

 
 
 

Comentarios


bottom of page