Regresión lineal en un TFG: cómo hacerla e interpretarla en SPSS

Regresión lineal en un TFG: cómo hacerla e interpretarla en SPSS
Tienes terminada la encuesta de tu TFG.
Has analizado:
medias;
correlaciones;
diferencias entre grupos.
Y ahora tu objetivo dice algo parecido a:
Analizar qué variables predicen la satisfacción laboral de los trabajadores.
O:
Estudiar en qué medida el estrés, las horas de sueño y el apoyo social se relacionan conjuntamente con la ansiedad.
Entonces aparece:
regresión lineal.
Abres SPSS.
Introduces las variables.
Pulsas aceptar.
Y aparecen varias tablas:
Resumen del modelo.
ANOVA.
Coeficientes.
R cuadrado.
Beta.
t.
Sig.
Tolerancia.
VIF.
Después:
gráficos de residuos.
Y posiblemente la duda más frecuente:
¿qué tengo que interpretar realmente?
Porque una regresión no se resume en:
“R² = .42 y p < .05.”
Hay que responder varias preguntas diferentes:
¿Tiene sentido aplicar una regresión lineal a estos datos?
¿El modelo global aporta información?
¿Cuánta variabilidad de la variable dependiente explica?
¿Qué predictores están asociados con el resultado manteniendo constantes los demás?
¿En qué dirección?
¿Con qué magnitud?
¿Se cumplen razonablemente los supuestos?
¿Existen valores extremos o casos demasiado influyentes?
¿Los predictores están excesivamente relacionados entre sí?
SPSS puede calcular todo esto.
Pero no puede decidir por ti:
qué significa dentro de tu TFG.
IBM incluye dentro del procedimiento de regresión lineal R, R², R² ajustado, ANOVA, coeficientes B y beta, intervalos de confianza, VIF, tolerancia, residuos, Durbin-Watson y diagnósticos de casos.
Vamos paso a paso.
¿Qué es una regresión lineal?
La regresión lineal permite estudiar cómo se relaciona una variable resultado cuantitativa con una o varias variables predictoras.
Por ejemplo:
Quieres estudiar:
satisfacción laboral.
Variable dependiente:
Puntuación de satisfacción.
Predictores:
autonomía;
salario;
estrés;
antigüedad;
horas de teletrabajo.
La regresión permite estudiar la relación de cada predictor con la satisfacción:
teniendo en cuenta simultáneamente los demás predictores incluidos en el modelo.
Esto es una diferencia importante respecto de una simple correlación.
Correlación y regresión no son lo mismo
Supongamos que obtienes:
r = -.45
entre:
estrés
y:
satisfacción laboral.
Eso indica una asociación negativa.
A mayor estrés:
menor satisfacción,
aproximadamente.
Pero quizá estrés también está relacionado con:
horas trabajadas.
Y las horas trabajadas también se relacionan con:
satisfacción.
Una regresión múltiple puede incluir ambas:
estrés;
horas de trabajo.
Así puedes estudiar qué relación mantiene cada variable con satisfacción:
una vez consideradas las demás variables del modelo.
Regresión lineal simple
Utiliza:
un predictor.
Ejemplo:
X:
Horas de estudio.
Y:
Nota.
Modelo:
Nota = b₀ + b₁(Horas de estudio)
Donde:
b₀:
intercepto.
b₁:
coeficiente asociado a horas de estudio.
Ejemplo
Modelo estimado:
Nota = 4,20 + 0,35 × Horas.
Interpretación aproximada:
por cada hora adicional de estudio, la nota esperada aumenta:
0,35 puntos,
según el modelo.
Pero esta interpretación solo tiene sentido:
dentro del rango estudiado
y:
si el modelo es razonable.
No significa que estudiar:
100 horas
te proporcione automáticamente:
39 puntos.
La regresión lineal no debe extrapolarse sin criterio.
Regresión lineal múltiple
Utiliza:
varios predictores.
Ejemplo:
Satisfacción =
b₀
b₁ Autonomía
b₂ Estrés
b₃ Salario
b₄ Antigüedad.
Ahora cada coeficiente representa la relación de su predictor con satisfacción:
manteniendo constantes los demás predictores del modelo.
Esta frase es fundamental.
Ejemplo
Resultados:
Autonomía:
B = 0,42.
Estrés:
B = -0,31.
Salario:
B = 0,00004.
Antigüedad:
B = 0,02.
Interpretación:
manteniendo constantes las demás variables, un aumento de una unidad en autonomía se asocia con:
0,42 unidades más de satisfacción.
Un aumento de una unidad en estrés se asocia con:
0,31 unidades menos.
Pero debes conocer:
la escala de cada variable.
Una unidad de salario puede ser:
1 euro.
Una unidad de autonomía:
un punto en una escala 1-5.
No puedes comparar directamente los B únicamente por su tamaño.
¿Cuándo utilizar regresión lineal?
Puede tener sentido cuando tu variable dependiente es:
cuantitativa
y quieres estudiar su relación con:
una
o varias variables predictoras.
Ejemplos:
Psicología
Predecir puntuación de ansiedad a partir de:
estrés;
autoestima;
apoyo social.
Educación
Predecir rendimiento académico a partir de:
horas de estudio;
motivación;
asistencia.
ADE
Analizar satisfacción laboral mediante:
salario;
autonomía;
teletrabajo;
estrés.
Marketing
Analizar intención de compra mediante:
confianza;
calidad percibida;
precio percibido.
Turismo
Analizar satisfacción turística mediante:
calidad;
precio;
servicio;
experiencia digital.
¿Cuándo NO utilizar regresión lineal?
Si tu variable dependiente es:
Sí / No
por ejemplo:
abandona:
sí/no,
la regresión lineal clásica normalmente no es la opción adecuada.
Podrías considerar:
regresión logística.
Si el resultado es:
una categoría con tres opciones,
necesitarás otro tipo de modelo.
La regresión lineal está pensada para una variable resultado cuantitativa dentro del modelo correspondiente.
¿Qué significa “predecir”?
Cuidado con esta palabra.
En estadística se utiliza:
predictor
aunque el estudio sea transversal.
Pero eso no significa automáticamente:
causalidad temporal.
Ejemplo:
Encuestas hoy simultáneamente:
estrés
y:
satisfacción.
Encuentras que estrés predice estadísticamente satisfacción dentro del modelo.
No puedes concluir automáticamente:
El estrés causa una reducción futura de la satisfacción.
La regresión puede modelar asociaciones.
La causalidad necesita:
un diseño que la justifique.
Variable dependiente e independientes
En regresión encontrarás:
Variable dependiente
El resultado que quieres modelizar.
Ejemplo:
satisfacción laboral.
Variables independientes o predictoras
Variables utilizadas para explicar/modelizar el resultado.
Ejemplo:
autonomía;
estrés;
salario.
No confundas:
“variable independiente”
con:
“variable que necesariamente causa.”
El nombre estadístico no demuestra causalidad.
¿Las variables predictoras tienen que ser cuantitativas?
No todas.
Puedes incluir variables categóricas si las codificas de forma adecuada mediante:
variables dummy
u otros contrastes.
IBM señala expresamente que las variables categóricas deben recodificarse mediante variables binarias dummy u otros tipos de contraste para incorporarlas al modelo lineal.
Ejemplo de variable dummy
Modalidad laboral:
Presencial.
Híbrida.
Supongamos:
Presencial = 0.
Híbrida = 1.
Resultado:
B = 0,40.
Interpretación:
manteniendo constantes los demás predictores, el grupo híbrido presenta una puntuación esperada:
0,40 puntos superior
al grupo presencial,
que funciona como:
categoría de referencia.
¿Y si tengo tres categorías?
Modalidad:
Presencial.
Híbrida.
Remota.
No debes codificar simplemente:
1, 2, 3
y tratarlo como si la distancia:
Presencial → Híbrida
fuera exactamente la misma que:
Híbrida → Remota.
Puedes crear:
variables dummy.
Por ejemplo:
Referencia:
Presencial.
Dummy 1:
Híbrida sí/no.
Dummy 2:
Remota sí/no.
Los coeficientes compararán cada categoría con:
Presencial.
Antes de hacer una regresión: revisa la pregunta de investigación
No empieces por:
“Quiero utilizar regresión porque queda más avanzada.”
Empieza por:
¿qué quiero saber?
Ejemplo:
Objetivo:
Describir satisfacción laboral.
No necesitas regresión.
Otro:
Analizar qué variables se relacionan con la satisfacción laboral y cuál es su contribución conjunta dentro de un modelo.
Ahora sí puede tener:
sentido.
Paso 1. Define la variable dependiente
Tiene que estar clara.
Ejemplo:
Satisfacción laboral total.
No:
20 ítems independientes
si realmente tu análisis utiliza:
una puntuación global validada.
Define:
cómo se calcula.
Paso 2. Selecciona predictores con justificación
No introduzcas todas las columnas de Excel.
Tienes:
35 variables.
¿Metes las 35?
No.
Los predictores deberían proceder de:
teoría;
hipótesis;
literatura;
objetivos.
No:
“Las probé todas y dejé las significativas.”
Eso aumenta el riesgo de:
resultados inestables;
sobreajuste;
interpretaciones engañosas.
Ejemplo coherente
Marco teórico propone que satisfacción está relacionada con:
autonomía;
estrés;
apoyo;
salario.
Esos cuatro predictores forman:
un modelo razonado.
Ejemplo incoherente
Incluyes:
edad;
sexo;
color favorito;
número de hermanos;
Instagram;
Netflix;
altura;
curso;
horóscopo.
Porque estaban:
en la encuesta.
Una regresión no mejora por:
tener más variables.
Regresión simple vs múltiple
Simple
Un predictor.
Múltiple
Varios predictores.
No confundas:
regresión múltiple
con:
varias regresiones simples.
Si realizas:
estrés → satisfacción.
Autonomía → satisfacción.
Salario → satisfacción.
por separado,
no estás controlando los predictores simultáneamente.
Una regresión múltiple:
los incorpora juntos.
La ecuación del modelo múltiple
Puede escribirse:
Ŷ = b₀ + b₁X₁ + b₂X₂ + ... + bₖXₖ
Donde:
Ŷ:
valor esperado/predicho de Y.
b₀:
intercepto.
b₁, b₂...:
coeficientes.
X:
predictores.
No necesitas llenar el TFG de fórmulas.
Pero conocer la estructura ayuda a interpretar:
los coeficientes.
¿Qué es R?
SPSS presenta:
R.
En regresión múltiple representa la correlación entre:
los valores observados
y:
los valores predichos por el modelo.
Su interpretación suele quedar eclipsada por:
R².
Y, para la mayoría de TFG:
R² y R² ajustado serán más informativos.
¿Qué es R cuadrado?
R² indica qué proporción de la variabilidad observada en la variable dependiente queda explicada por el conjunto de predictores dentro del modelo lineal.
Ejemplo:
R² = .40.
Interpretación:
aproximadamente el:
40 %
de la variabilidad de Y en la muestra/modelo está asociada al conjunto de predictores incluidos.
IBM incluye R² entre las principales estadísticas de ajuste del modelo.
Ejemplo
Dependiente:
satisfacción.
Predictores:
autonomía;
estrés;
apoyo social.
R² = .47.
Puedes escribir:
El modelo explicó aproximadamente el 47 % de la variabilidad observada en la satisfacción laboral.
No escribas:
Estas variables causan el 47 % de la satisfacción.
R² no demuestra:
causalidad.
Tampoco significa que el modelo sea “47 % correcto”
Otro error frecuente.
R² = .47
no significa:
47 % de predicciones correctas.
Ese lenguaje corresponde a:
otra lógica.
Significa:
proporción de variabilidad explicada dentro del modelo.
¿R² alto siempre es bueno?
Depende.
En Ciencias Sociales:
R² = .30
puede ser muy interesante.
En determinados fenómenos físicos:
podría resultar bajo.
No existe una frontera universal:
.50 = buen modelo.
La interpretación depende de:
fenómeno;
disciplina;
objetivo;
investigación anterior.
R² siempre aumenta al añadir predictores
O como mínimo:
no disminuye.
Introduces una variable nueva.
Aunque aporte muy poco:
R² puede subir ligeramente.
Por eso existe:
R² ajustado.
¿Qué es R² ajustado?
El R² ajustado introduce una corrección relacionada con:
el número de predictores
y:
el tamaño de la muestra.
Penaliza, en cierto sentido, añadir variables que no mejoran suficientemente el modelo.
IBM presenta R² ajustado junto con R² dentro de los estadísticos de ajuste.
Ejemplo
R²:
.52.
R² ajustado:
.49.
La diferencia es:
pequeña.
Otro:
R²:
.52.
R² ajustado:
.34.
Aquí deberías preguntarte:
si tienes demasiados predictores
respecto a la información disponible
o:
un modelo poco estable.
¿Cuál informo?
Normalmente puedes informar:
ambos.
Por ejemplo:
El modelo explicó el 42 % de la variabilidad de satisfacción, R² = .42, con un R² ajustado de .40.
Muy claro.
¿Qué es el error estándar de la estimación?
También aparece en:
Resumen del modelo.
Representa aproximadamente la dispersión de los residuos alrededor de los valores predichos.
Está expresado:
en unidades de la variable dependiente.
Ejemplo:
si Y es una nota 0-10
y:
error estándar = 0,80,
las predicciones presentan aproximadamente esa escala de error residual.
No suele ser el primer resultado que un estudiante interpreta.
Pero aporta información sobre:
precisión predictiva del modelo.
La tabla ANOVA de la regresión
Después SPSS muestra:
ANOVA.
Muchos estudiantes piensan:
“Pero yo estoy haciendo regresión, no ANOVA.”
Es normal.
La tabla ANOVA evalúa el ajuste global del modelo mediante:
F.
Pregunta:
¿el conjunto de predictores mejora la explicación del resultado respecto de un modelo sin esos predictores?
Ejemplo
F(4, 195) = 22,41.
p < .001.
Puedes escribir:
El modelo de regresión resultó estadísticamente significativo, F(4,195) = 22,41, p < .001.
Eso significa que:
el conjunto de predictores aporta información estadísticamente detectable sobre Y.
No significa que:
todos los predictores sean significativos individualmente.
Modelo significativo con predictores no significativos
Perfectamente posible.
Ejemplo:
Modelo global:
p < .001.
Predictores:
Autonomía:
p < .001.
Estrés:
p = .004.
Edad:
p = .44.
Antigüedad:
p = .61.
El modelo global es significativo porque:
el conjunto aporta información.
Pero:
edad y antigüedad
no presentan evidencia suficiente de una contribución individual distinta de cero dentro de ese modelo.
Tampoco significa que un predictor no significativo “no sirva para nada”
Puede existir:
incertidumbre;
multicolinealidad;
muestra pequeña;
efecto pequeño;
papel como variable de control;
relación conjunta.
No elimines predictores automáticamente:
solo por p > .05,
especialmente si estaban incluidos:
por razones teóricas.
La tabla más importante: Coeficientes
Aquí aparecen normalmente:
B
Error estándar
Beta
t
Sig.
Y si las solicitas:
intervalos de confianza
Tolerancia
VIF.
Esta tabla permite interpretar:
cada predictor.
¿Qué es B?
B es el:
coeficiente no estandarizado.
Indica cuánto cambia la variable dependiente esperada cuando el predictor aumenta:
una unidad,
manteniendo constantes los demás predictores.
Ejemplo
Dependiente:
Satisfacción 1-10.
Predictor:
Autonomía 1-5.
B = 0,72.
Interpretación:
Manteniendo constantes los demás predictores, cada aumento de un punto en autonomía se asoció con un incremento esperado de 0,72 puntos en satisfacción.
Esto tiene una interpretación:
directa en las unidades originales.
B negativo
Ejemplo:
Estrés:
B = -0,45.
Interpretación:
Cada punto adicional de estrés se asoció con una disminución esperada de 0,45 puntos en satisfacción, manteniendo constantes los demás predictores.
El signo indica:
dirección.
B = 0
Representaría:
ausencia de asociación lineal parcial en esa escala y modelo.
El contraste t estudia precisamente si existe evidencia contra:
B = 0.
¿Qué es el error estándar de B?
Mide la incertidumbre de:
la estimación del coeficiente.
B = .50
con:
EE = .05
es una estimación mucho más precisa que:
B = .50
con:
EE = .40.
Por eso conviene utilizar también:
intervalos de confianza.
Intervalo de confianza del coeficiente
Ejemplo:
B = .42.
IC 95 % [.18; .66].
El intervalo no incluye:
Existe una estimación positiva relativamente clara bajo el modelo.
Otro:
B = .42.
IC 95 % [-.20; 1.04].
Ahora existe:
mucha incertidumbre.
Los datos son compatibles incluso con:
una asociación ligeramente negativa.
¿Qué es Beta?
β es el:
coeficiente estandarizado.
Expresa el cambio esperado en Y en unidades de desviación estándar asociado a un cambio de una desviación estándar en X:
manteniendo constantes los demás predictores.
Permite comparar más fácilmente predictores que están:
en escalas diferentes.
Ejemplo
Autonomía:
β = .43.
Estrés:
β = -.31.
Antigüedad:
β = .07.
Dentro de ese modelo:
autonomía presenta la asociación estandarizada más grande en valor absoluto.
Pero cuidado.
No escribas automáticamente:
Autonomía es la variable más importante del mundo real.
Beta depende de:
modelo;
variables incluidas;
variabilidad muestral;
correlaciones entre predictores;
escala conceptual.
Es una comparación:
dentro del modelo.
B y beta responden a preguntas distintas
B
¿Qué ocurre en las unidades reales?
Ejemplo:
euros.
años.
puntos.
β
¿Qué magnitud estandarizada presenta la relación parcial?
Puede facilitar:
comparaciones internas.
No elijas uno y olvides siempre el otro.
¿Qué es t?
Cada coeficiente tiene:
un estadístico t.
Contrasta si:
el coeficiente correspondiente difiere de:
Ejemplo:
B = .40.
EE = .10.
t ≈ 4.
Un valor mayor en términos absolutos suele corresponder a:
evidencia más fuerte contra B = 0,
pero la interpretación final utiliza:
p
e:
intervalo.
¿Qué significa Sig.?
Es el:
p-valor.
Ejemplo:
p = .003.
Con:
α = .05,
existe evidencia estadística de que el coeficiente es diferente de:
Pero recuerda:
significativo no significa importante.
Mira también:
B;
β;
IC;
contexto.
El intercepto
SPSS muestra:
Constante.
Ejemplo:
B = 2,40.
Representa el valor esperado de Y cuando:
todos los predictores son 0.
A veces tiene:
interpretación útil.
Otras veces no.
Ejemplo:
edad = 0;
salario = 0;
autonomía = 0
pueden estar fuera del rango real de la muestra.
No dediques media página a interpretar el intercepto si:
carece de sentido sustantivo.
¿Qué es una predicción?
Con los coeficientes puedes calcular:
un valor esperado.
Ejemplo:
Satisfacción =
2
+ 0,6 Autonomía
0,3 Estrés.
Persona:
Autonomía = 4.
Estrés = 2.
Predicción:
2 + 0,6(4) - 0,3(2)
=
3,8.
Eso es:
una estimación del modelo.
No significa que esa persona necesariamente tenga:
exactamente 3,8.
Existe:
error residual.
Un modelo no explica todos los casos perfectamente
La distancia entre:
valor observado
y:
valor predicho
se llama:
residuo.
Penn State y NIST utilizan precisamente el análisis de residuos para comprobar si los supuestos del modelo lineal son razonables.
¿Qué es un residuo?
Ejemplo:
Predicción:
Y = 7.
Valor real:
Y = 8,2.
Residuo:
8,2 - 7
=
1,2.
Otra persona:
Predicción:
Real:
5,5.
Residuo:
-0,5.
Un buen modelo lineal debería presentar residuos que no muestren:
patrones sistemáticos problemáticos.
Supuestos de la regresión lineal
Aquí aparecen varios.
Los clásicos pueden resumirse en:
linealidad;
independencia de errores;
varianza aproximadamente constante;
normalidad de los errores para determinadas inferencias.
En regresión múltiple también debes prestar atención a:
multicolinealidad;
observaciones influyentes.
Penn State resume los cuatro supuestos clásicos mediante LINE: Linearity, Independence, Normality y Equal variance.
1. Linealidad
El modelo supone una relación:
lineal
entre los predictores y la respuesta en la forma especificada.
Ejemplo:
X aumenta.
Y tiende a aumentar:
aproximadamente siguiendo una línea.
Problema:
si la verdadera relación es:
forma de U,
una línea puede describirla muy mal.
Ejemplo
Estrés:
muy bajo → productividad moderada.
Estrés:
medio → productividad alta.
Estrés:
muy alto → productividad baja.
Relación:
curva.
Una regresión lineal simple puede encontrar:
B ≈ 0.
¿Significa que:
no existe relación?
No.
Puede existir una relación:
no lineal.
Cómo comprobar linealidad
Utiliza:
diagramas de dispersión;
gráficos parciales;
residuos vs valores predichos.
Penn State recomienda estudiar gráficamente la relación y los residuos para valorar este supuesto.
2. Independencia de los errores
Las observaciones no deberían generar errores sistemáticamente relacionados entre sí.
Ejemplo:
encuestas a:
200 estudiantes independientes.
Puede ser razonable.
Pero si tienes:
medidas repetidas de las mismas personas
tratadas como:
200 observaciones independientes,
puedes tener un problema.
Datos temporales
En una serie mensual:
enero;
febrero;
marzo;
abril,
los errores pueden estar correlacionados temporalmente.
Aquí aparece con frecuencia:
Durbin-Watson.
¿Qué es Durbin-Watson?
Es un estadístico utilizado para estudiar:
autocorrelación serial de los residuos.
SPSS puede calcularlo dentro de las opciones de regresión.
Su rango va aproximadamente de:
0 a 4.
Un valor cercano a:
2
suele corresponder a poca autocorrelación de primer orden.
Valores muy alejados pueden indicar:
posibles problemas.
Pero evita aplicar:
fronteras universales
como:
1,5-2,5 = perfecto siempre.
La interpretación depende:
del diseño
y:
del contexto.
¿Necesito Durbin-Watson en una encuesta transversal?
Puede informarse.
Pero la independencia también debe justificarse mediante:
cómo fueron recogidos los datos.
Un estadístico no arregla:
un diseño donde la misma persona aparece varias veces sin modelizar esa dependencia.
3. Homocedasticidad
Significa que la dispersión de los errores es:
aproximadamente constante
a lo largo de los valores predichos.
Nombre contrario:
heterocedasticidad.
Ejemplo de buen patrón
Gráfico:
residuos vs predichos.
Los puntos forman:
una nube aproximadamente uniforme.
Ejemplo problemático
Forma de:
embudo.
Al principio:
poca dispersión.
Al final:
mucha dispersión.
Eso puede indicar:
heterocedasticidad.
Penn State recomienda examinar precisamente el gráfico de residuos frente a valores ajustados para estudiar igualdad de varianzas.
¿Por qué importa?
La heterocedasticidad puede afectar especialmente:
errores estándar;
intervalos;
contrastes.
El coeficiente B puede seguir siendo interpretable bajo determinadas condiciones, pero la inferencia clásica puede resultar problemática.
Existen métodos como:
errores estándar robustos.
Pero no los apliques sin comprenderlos.
4. Normalidad de los residuos
Este punto conecta con Shapiro-Wilk.
La regresión clásica no exige que:
cada predictor
sea normal.
Ni necesariamente que:
Y
sea una campana perfecta.
Para determinadas inferencias interesa la distribución de:
los errores/residuos.
Penn State y NIST recomiendan utilizar gráficos de probabilidad normal y otras inspecciones de residuos.
Error muy frecuente
Variable:
salario.
Shapiro:
p < .001.
Conclusión:
No puedo hacer regresión porque salario no es normal.
No necesariamente.
Necesitas revisar:
qué variable es;
cómo entra en el modelo;
y:
los residuos resultantes.
Cómo revisar normalidad de residuos
Puedes utilizar:
histograma;
Q-Q / P-P plot;
inspección de outliers.
No dependas únicamente de:
Shapiro-Wilk.
Con muestras grandes puede resultar:
muy sensible.
5. Multicolinealidad
Este es uno de los conceptos más importantes en regresión múltiple.
Ocurre cuando varios predictores están:
muy relacionados entre sí.
Ejemplo extremo:
Peso en kg.
Peso en libras.
Ambos predictores contienen:
prácticamente la misma información.
La regresión tiene dificultad para decidir:
qué parte corresponde a cada uno.
Penn State describe precisamente la multicolinealidad como un problema donde predictores fuertemente relacionados dificultan estimar sus contribuciones individuales.
Otro ejemplo
Predictores:
Satisfacción global.
Satisfacción total.
Bienestar laboral global.
Si las tres variables prácticamente miden:
lo mismo,
puedes tener:
multicolinealidad.
¿Qué ocurre cuando existe multicolinealidad?
Puede provocar:
coeficientes inestables;
errores estándar grandes;
signos inesperados;
predictores no significativos aunque exista relación bivariada;
cambios fuertes cuando añades/quitas variables.
El modelo puede incluso:
predecir relativamente bien
mientras resulta difícil interpretar:
cada coeficiente individual.
¿Qué es tolerancia?
SPSS puede calcular:
Tolerance.
Se relaciona con cuánto de la variabilidad de un predictor no está explicado por:
los demás predictores.
Valores muy bajos:
pueden indicar problemas de colinealidad.
¿Qué es VIF?
Variance Inflation Factor.
Está relacionado inversamente con la tolerancia.
Cuanto mayor es:
mayor inflación de la varianza del coeficiente debido a:
multicolinealidad.
IBM ofrece VIF y tolerancia directamente dentro de los diagnósticos de regresión.
¿Qué VIF es demasiado alto?
Encontrarás:
Incluso umbrales más estrictos.
No existe una frontera universal aplicable sin contexto.
Puedes utilizar:
VIF > 5
como señal de alerta relativamente conservadora en determinados trabajos,
mientras que:
10
aparece como referencia clásica para problemas graves.
Pero no escribas:
VIF 4,99 = perfecto; 5,01 = modelo inválido.
Interpreta:
el patrón global.
Ejemplo
Autonomía:
VIF = 1.6.
Estrés:
1.8.
Apoyo:
1.4.
Salario:
1.2.
No parece existir un problema fuerte.
Otro:
Satisfacción A:
VIF = 12.4.
Satisfacción B:
VIF = 11.9.
Aquí sí deberías investigar:
la redundancia.
¿Eliminar automáticamente el predictor con VIF alto?
No siempre.
Primero pregunta:
¿son variables conceptualmente duplicadas?
¿estoy incluyendo un total y sus propias subescalas al mismo tiempo?
¿existe un error de diseño?
¿puedo combinar variables?
No elimines:
la variable teóricamente central
solo porque:
el VIF es alto,
sin revisar la causa.
6. Valores atípicos
Un caso puede presentar:
un valor extremo.
Ejemplo:
Ingresos:
la mayoría:
20.000-50.000.
Una persona:
2.000.000.
Ese punto puede influir mucho en:
la pendiente.
Pero valor extremo no significa:
error.
Podría ser:
real.
Residuo estandarizado
SPSS puede ayudarte a identificar casos que presentan:
residuos inusualmente grandes.
Pero no existe una única regla universal.
Valores en torno a:
±3
pueden utilizarse como señal para:
revisar casos.
No:
eliminarlos automáticamente.
Influencia no es lo mismo que outlier
Un caso puede ser:
extremo
pero:
no cambiar mucho el modelo.
Otro puede tener:
una combinación de predictores muy inusual
y:
alterar fuertemente los coeficientes.
Por eso existen medidas como:
Cook's Distance
y:
leverage.
Distancia de Cook
Ayuda a detectar observaciones que ejercen:
una influencia importante sobre el modelo estimado.
SPSS puede guardar/calcular:
Cook;
Mahalanobis;
leverage
y otros diagnósticos.
No elimines automáticamente:
Cook > X
sin inspeccionar el caso.
Usa estas medidas para:
identificar qué observaciones necesitan revisión.
¿Qué es leverage?
Refleja hasta qué punto una observación presenta:
valores de predictores inusuales respecto del resto.
Un caso puede tener:
alta influencia
cuando combina:
leverage elevado
con:
un residuo importante.
Datos erróneos vs casos reales
Caso:
Edad = 233.
Probablemente:
error.
Caso:
Edad = 78
cuando la mayoría tiene 20-30.
Quizá:
real.
No puedes borrar a la persona de 78 únicamente porque:
cambia tu regresión.
Si cumple criterios:
forma parte de:
la población estudiada.
¿Qué significa “Enter” en SPSS?
Método:
Introducir / Enter.
Todos los predictores seleccionados entran:
simultáneamente.
Es una opción muy razonable cuando las variables fueron elegidas:
por teoría.
Métodos stepwise
SPSS ofrece:
Stepwise.
Forward.
Backward.
Estos métodos seleccionan variables según:
criterios estadísticos automáticos.
Parecen atractivos.
Pero tienen riesgos:
inestabilidad;
sobreajuste;
p-valores optimistas;
selección dependiente de una muestra concreta;
eliminación de variables teóricamente importantes.
No utilices stepwise únicamente porque:
“SPSS selecciona las mejores variables.”
SPSS no sabe:
tu teoría.
Regresión jerárquica
Otra opción.
Introduces predictores en:
bloques.
Por ejemplo:
Bloque 1
Variables de control:
edad;
sexo;
antigüedad.
Bloque 2
Variables principales:
autonomía;
estrés.
Puedes estudiar:
cuánto aumenta R²
cuando añades el segundo bloque.
SPSS puede mostrar:
R² Change.
Ejemplo
Modelo 1:
edad + sexo.
R² = .08.
Modelo 2:
edad + sexo + autonomía + estrés.
R² = .41.
Cambio:
ΔR² = .33.
Esto indica que el segundo bloque aporta:
33 puntos porcentuales adicionales de variabilidad explicada,
aproximadamente,
dentro del modelo.
No confundas regresión jerárquica con regresión multinivel
Son conceptos diferentes.
Jerárquica por bloques
Introduces predictores en pasos definidos.
Multinivel
Modela datos agrupados:
alumnos dentro de clases;
trabajadores dentro de empresas;
pacientes dentro de hospitales.
No son lo mismo.
¿Cuántos predictores puedo incluir?
No existe una cifra universal.
Depende de:
muestra;
efecto;
colinealidad;
precisión;
objetivo.
No utilices:
20 predictores
con:
N = 40
sin una justificación estadística muy sólida.
Cada predictor consume:
información.
Puedes planificar la muestra con potencia
Si la regresión es:
tu análisis principal,
puedes calcular una muestra a priori basada en:
número de predictores;
efecto esperado;
alfa;
potencia.
No utilices únicamente reglas como:
“10 participantes por predictor.”
Pueden servir como referencias históricas en algunos contextos, pero la planificación debería corresponder:
al análisis real.
Regresión y variables de control
Imagina:
quieres estudiar:
efecto estadístico de autonomía sobre satisfacción.
Sabes que:
edad
puede estar relacionada.
Incluyes:
edad
como control.
Entonces B de autonomía representa:
su relación con satisfacción
manteniendo:
edad constante
y los demás predictores constantes.
“Controlar” estadísticamente no es controlar experimentalmente
Muy importante.
Incluir edad en una regresión:
no convierte tu estudio observacional en:
experimento.
Solo ajusta:
matemáticamente
por la variable incorporada
dentro del modelo.
Todavía puede existir:
confusión residual;
variables no medidas;
sesgo;
causalidad inversa.
Mediación y moderación no son regresión múltiple normal sin más
Pueden implementarse mediante regresiones.
Pero responden a preguntas específicas.
Moderación
Pregunta:
¿cambia la relación X-Y dependiendo de Z?
Incluye:
interacción.
Mediación
Pregunta:
¿parte de la relación X-Y puede describirse mediante una variable intermedia M dentro de un modelo causal/estadístico específico?
No realices:
una mediación
solo porque tienes:
tres variables correlacionadas.
Necesita:
planteamiento teórico.
Interacciones
Ejemplo:
Autonomía → satisfacción.
Quizá la relación depende de:
teletrabajo.
Entonces puedes introducir:
Autonomía × Teletrabajo.
Si la interacción es significativa:
el efecto estimado de autonomía cambia según:
modalidad.
Pero la interpretación se vuelve:
más compleja.
No añadas interacciones indiscriminadamente.
Centrar variables
Cuando utilizas:
interacciones
o:
polinomios,
puede resultar útil centrar variables continuas.
Por ejemplo:
Autonomía centrada = autonomía - media.
Esto puede facilitar:
interpretación del intercepto
y reducir ciertas formas de colinealidad asociadas a términos construidos.
No cambia:
la relación sustantiva básica.
Cómo hacer una regresión lineal en SPSS
Ruta habitual:
Analizar → Regresión → Lineal.
IBM documenta esta misma ruta para el procedimiento.
Paso 1. Dependiente
Introduce:
la variable resultado.
Ejemplo:
SAT_TOTAL.
Paso 2. Independientes
Introduce:
AUTONOMIA.
ESTRES.
APOYO.
EDAD.
Paso 3. Método
Por ejemplo:
Enter.
Paso 4. Estadísticos
Puedes solicitar:
estimaciones;
ajuste del modelo;
intervalos de confianza;
cambio en R²;
diagnósticos de colinealidad;
Durbin-Watson.
IBM ofrece todas estas opciones dentro del procedimiento.
Paso 5. Gráficos
Puede resultar útil:
ZPRED
vs.
ZRESID.
Y:
histograma/P-P plot de residuos.
Esto ayuda a valorar:
homocedasticidad;
linealidad;
normalidad residual.
Paso 6. Guardar
Puedes guardar:
valores predichos;
residuos;
residuos estandarizados;
Cook;
leverage;
cuando necesites diagnósticos más detallados.
Primera tabla: Variables introducidas/eliminadas
SPSS muestra qué predictores entraron.
No suele necesitar:
una gran explicación en el TFG.
Sirve para verificar:
que el modelo contiene las variables esperadas.
Segunda tabla: Resumen del modelo
Puede mostrar:
R.
R².
R² ajustado.
Error estándar.
Durbin-Watson.
Ejemplo:
R = .68.
R² = .46.
R² ajustado = .44.
Durbin-Watson = 1.97.
Interpretación:
El modelo explicó el 46 % de la variabilidad observada en satisfacción laboral, con un R² ajustado de .44.
No necesitas repetir:
R = .68
si no aporta nada esencial.
Tercera tabla: ANOVA
Ejemplo:
F(4,195) = 41.30.
p < .001.
Interpretación:
El modelo global resultó estadísticamente significativo.
Cuarta tabla: Coeficientes
Ejemplo:
Predictor | B | EE | β | t | p | VIF |
Autonomía | .51 | .08 | .43 | 6.38 | < .001 | 1.42 |
Estrés | -.36 | .07 | -.34 | -5.14 | < .001 | 1.37 |
Apoyo | .19 | .08 | .16 | 2.38 | .018 | 1.29 |
Edad | .01 | .01 | .06 | 0.91 | .365 | 1.08 |
Ahora puedes interpretar:
qué predictor presenta evidencia de asociación
y:
en qué dirección.
Ejemplo completo de redacción
Se realizó una regresión lineal múltiple para analizar la relación de autonomía, estrés, apoyo social y edad con la satisfacción laboral. El modelo global resultó estadísticamente significativo, F(4,195) = 41,30, p < .001, y explicó el 46 % de la variabilidad de la satisfacción (R² = .46; R² ajustado = .44). La autonomía presentó una asociación positiva con la satisfacción (B = .51, β = .43, p < .001), mientras que el estrés mostró una asociación negativa (B = -.36, β = -.34, p < .001). El apoyo social también presentó una asociación positiva de menor magnitud (B = .19, β = .16, p = .018). La edad no mostró una contribución estadísticamente significativa dentro del modelo (p = .365).
Esto es mucho mejor que:
La regresión fue significativa.
Añade intervalos cuando puedas
Por ejemplo:
Autonomía:
B = .51.
IC 95 % [.35; .67].
Puedes escribir:
B = .51, IC 95 % [.35; .67].
Eso muestra:
precisión.
No digas “el predictor explica X %” mirando beta
β = .43
no significa:
43 % de varianza explicada.
Tampoco:
R² = .46
significa que:
el predictor más grande explica por sí solo el 46 %.
El R² corresponde:
al conjunto del modelo.
La contribución única de cada variable requiere:
otras medidas/análisis.
Correlación semiparcial
SPSS puede proporcionar:
part correlations.
Al cuadrar una correlación semiparcial puedes obtener una estimación de:
la proporción única de varianza asociada a un predictor dentro del modelo.
Pero no necesitas incorporar esto en:
todos los TFG.
Utilízalo si:
responde realmente a tu objetivo.
¿Qué es un coeficiente estandarizado grande?
Contexto.
β = .40
puede resultar:
importante
en un área.
En otra:
moderado.
No uses:
puntos de corte universales
como si beta fuera:
d de Cohen.
Predictores en diferentes unidades
Ejemplo:
Salario:
euros.
Estrés:
1-5.
Autonomía:
1-7.
B de salario puede ser:
.00003.
B de autonomía:
.50.
Eso no significa automáticamente:
salario no importa.
Una unidad de salario es:
1 euro.
Un aumento de:
1.000 euros
equivaldría:
0.03 unidades,
según ese coeficiente.
Interpreta siempre:
la escala.
Puedes reescalar variables
Ejemplo:
salario en:
miles de euros.
Ahora:
B puede ser:
.03
por cada:
1.000 €.
La interpretación resulta:
más intuitiva.
La reescala no cambia:
la relación estadística fundamental.
Qué hacer si R² es bajo
Ejemplo:
R² = .12.
No escribas:
El modelo es malo.
Quizá explicar:
12 %
de una conducta humana compleja
sea relevante.
Pregunta:
¿qué encuentra la literatura?
¿cuál era tu objetivo?
¿qué precisión tienen los coeficientes?
Qué hacer si R² es altísimo
R² = .98.
No celebres automáticamente.
Pregunta:
¿he incluido variables casi idénticas?
¿hay fuga de información?
¿Y está construida a partir de los mismos ítems que X?
¿hay errores?
Ejemplo absurdo:
Y:
puntuación total.
X1-X10:
los diez ítems utilizados para crear ese mismo total.
Obtendrás:
una predicción enorme.
Porque estás intentando predecir:
una suma
con:
sus propias partes.
Eso no demuestra un descubrimiento interesante.
Multicolinealidad por incluir total y subescalas
Ejemplo:
Predictor 1:
Satisfacción global.
Predictor 2:
Satisfacción intrínseca.
Predictor 3:
Satisfacción extrínseca.
Si el global se calcula:
sumando 2 y 3,
has creado:
redundancia matemática.
No hagas esto sin razón.
Casos influyentes: revisa antes de borrar
Supongamos:
Cook indica:
un caso potencialmente influyente.
Abres la base.
Encuentras:
Edad = 222.
Claramente:
error de entrada.
Corrige si puedes verificarlo.
Otro:
Ingresos = 500.000.
Real.
No lo elimines:
solo porque altera el modelo.
Puedes realizar:
análisis de sensibilidad:
modelo con y sin caso,
pero debes justificar cualquier exclusión.
Transformaciones
Si existe:
asimetría;
heterocedasticidad;
no linealidad,
pueden considerarse:
transformaciones.
Ejemplo:
log(Y).
Pero cambias:
la interpretación de coeficientes.
No utilices:
log
como botón de:
“arreglar supuestos.”
Debes entender:
qué estás transformando.
Regresión lineal y causalidad
Este apartado merece repetirse.
Modelo:
Estrés → satisfacción.
B = -.45.
p < .001.
TFG transversal.
No escribas:
El estrés reduce la satisfacción.
Mejor:
Mayores niveles de estrés se asociaron con menores niveles de satisfacción, manteniendo constantes los demás predictores incluidos.
Eso respeta:
el diseño.
Regresión lineal y predicción futura
Si quieres utilizar realmente el modelo para:
predecir casos nuevos,
necesitas valorar:
cómo funciona fuera de la muestra utilizada para construirlo.
Un gran R² dentro de la muestra no garantiza:
buena predicción futura.
Puedes necesitar:
muestra de validación;
cross-validation;
PRESS;
train/test;
según el nivel del proyecto.
SPSS incluso ofrece PRESS como estadístico de validación cruzada dentro del procedimiento.
Para un TFG básico:
quizá no sea necesario.
Pero no confundas:
ajuste
con:
capacidad predictiva externa.
Error frecuente 1: hacer regresión porque “queda avanzada”
La técnica debe responder a:
objetivos.
Error 2: variable dependiente Sí/No
Considera:
logística.
Error 3: meter todos los predictores disponibles
Necesitas:
justificación.
Error 4: interpretar R² como porcentaje de aciertos
Incorrecto.
Error 5: afirmar causalidad
Regresión observacional ≠ causalidad.
Error 6: interpretar B sin conocer las unidades
La escala importa.
Error 7: interpretar beta como porcentaje
β = .40 no significa:
40 %.
Error 8: decir que el predictor con beta mayor “causa más”
No.
Error 9: ignorar R² ajustado
Especialmente con varios predictores.
Error 10: modelo significativo = todos los predictores significativos
No.
Error 11: predictor no significativo = inútil
No necesariamente.
Error 12: no revisar residuos
Los supuestos pertenecen al:
modelo.
Error 13: exigir normalidad a todas las X
El supuesto clásico se centra:
en los errores/residuos.
Error 14: ignorar heterocedasticidad
Puede afectar:
la inferencia.
Error 15: ignorar multicolinealidad
Puede hacer muy inestables los coeficientes.
Error 16: VIF alto = borrar automáticamente
Investiga la causa.
Error 17: eliminar outliers para mejorar p
Nunca.
Error 18: utilizar Stepwise sin justificación
Puede generar:
modelos inestables.
Error 19: crear dummy 1-2-3 y tratarla como continua
Las categorías nominales necesitan:
codificación adecuada.
Error 20: copiar todas las tablas de SPSS
Presenta:
lo importante.
Ejemplo de tabla limpia para el TFG
Regresión lineal múltiple para satisfacción laboral
Predictor | B | EE | β | IC 95 % de B | p | VIF |
Autonomía | .51 | .08 | .43 | [.35; .67] | < .001 | 1.42 |
Estrés | -.36 | .07 | -.34 | [-.50; -.22] | < .001 | 1.37 |
Apoyo social | .19 | .08 | .16 | [.03; .35] | .018 | 1.29 |
Edad | .01 | .01 | .06 | [-.01; .03] | .365 | 1.08 |
Nota. R² = .46; R² ajustado = .44.
Esto puede sustituir:
varias capturas enormes de SPSS.
Cómo redactar la metodología
Ejemplo:
Se realizó un análisis de regresión lineal múltiple para examinar la relación entre autonomía, estrés, apoyo social y edad con la satisfacción laboral. Los predictores se introdujeron simultáneamente mediante el método Enter. Antes de interpretar el modelo se examinaron los supuestos de linealidad, independencia, homocedasticidad y normalidad de los residuos, así como la presencia de multicolinealidad y observaciones potencialmente influyentes. La colinealidad se evaluó mediante tolerancia y VIF.
Sencillo.
Reproducible.
Cómo redactar los supuestos
No necesitas escribir:
Todos los supuestos se cumplen perfectamente.
Mejor:
La inspección del gráfico de residuos estandarizados frente a valores predichos no mostró patrones sistemáticos claros ni una variación marcadamente creciente de la dispersión. El gráfico P-P de los residuos mostró una aproximación razonable a la normalidad. Los valores VIF fueron inferiores a X, sin indicios relevantes de multicolinealidad según el criterio utilizado.
Utiliza:
tus resultados reales.
No copies una frase estándar.
¿Tengo que presentar todos los gráficos?
No.
Puedes analizar:
varios
y mostrar en anexos únicamente:
los relevantes.
Si existe:
un problema claro de heterocedasticidad,
quizá sí merezca:
discusión.
No llenes el TFG con:
10 gráficos diagnósticos
si no aportan nada.
Regresión lineal en jamovi
jamovi también permite realizar:
regresiones lineales.
Puedes obtener:
R²;
coeficientes;
beta;
intervalos;
diagnósticos;
colinealidad;
gráficos.
El significado estadístico es:
el mismo.
No necesitas utilizar SPSS únicamente porque:
“es el programa típico.”
Utiliza una herramienta:
adecuada
y:
que puedas documentar.
¿Puedo hacer regresión en Excel?
Excel ofrece ciertas funciones de regresión.
Pero para diagnósticos y análisis académicos completos:
SPSS;
jamovi;
R;
Stata
pueden proporcionar un flujo mucho más transparente.
No elijas Excel únicamente porque:
ya tienes allí los datos.
Ejemplo completo de Psicología
Tema:
Factores relacionados con ansiedad académica.
Y:
Ansiedad.
X:
Estrés.
Autoestima.
Horas sueño.
Apoyo social.
Resultado:
R² = .38.
F(4,195) = 29.87.
p < .001.
Predictores:
Estrés:
β = .46.
p < .001.
Autoestima:
β = -.22.
p = .004.
Sueño:
β = -.13.
p = .047.
Apoyo:
β = -.06.
p = .31.
Redacción:
El modelo explicó el 38 % de la variabilidad en ansiedad académica y resultó estadísticamente significativo, F(4,195) = 29,87, p < .001. El estrés mostró la asociación positiva más elevada con ansiedad (β = .46, p < .001), mientras que autoestima (β = -.22, p = .004) y horas de sueño (β = -.13, p = .047) presentaron asociaciones negativas. El apoyo social no mostró una contribución estadísticamente significativa una vez considerados los demás predictores (p = .31).
Ejemplo de ADE
Y:
Satisfacción laboral.
Predictores:
Teletrabajo.
Autonomía.
Salario.
Antigüedad.
Si teletrabajo es:
Sí/No,
puedes usar:
dummy.
B teletrabajo:
.32.
Interpretación:
Manteniendo constantes autonomía, salario y antigüedad, los trabajadores que teletrabajaban presentaron una satisfacción esperada .32 puntos superior a los trabajadores de la categoría de referencia.
No digas:
Teletrabajo aumenta .32.
si el estudio es:
observacional.
Ejemplo de Marketing
Y:
Intención de compra 1-7.
Predictores:
Calidad percibida.
Confianza.
Precio percibido.
Resultado:
Confianza:
β = .52.
Calidad:
β = .21.
Precio:
β = -.09.
Puedes discutir:
qué variables mantienen una asociación con intención una vez consideradas conjuntamente.
Ejemplo de Educación
Y:
Nota media.
Predictores:
Horas estudio.
Motivación.
Asistencia.
Edad.
El modelo puede mostrar:
horas y motivación relacionadas.
Pero no concluyas:
aumentar una hora garantiza X nota.
La regresión describe:
el patrón estimado
dentro de la muestra y modelo.
Checklist antes de ejecutar una regresión lineal
Comprueba:
Mi variable dependiente es adecuada para un modelo lineal.
Los predictores responden a objetivos o teoría.
No he añadido variables únicamente porque estaban disponibles.
He revisado datos perdidos.
He comprobado errores de codificación.
Las variables categóricas están correctamente codificadas.
He explorado relaciones gráficamente.
He revisado linealidad.
He revisado residuos.
He valorado homocedasticidad.
He valorado normalidad residual cuando corresponde.
He considerado independencia de errores.
He calculado VIF y tolerancia.
He revisado observaciones influyentes.
Sé qué significa R².
Sé qué significa R² ajustado.
Sé interpretar B.
Sé interpretar beta.
No confundiré significación con importancia.
No afirmaré causalidad que mi diseño no permite.
Informaré el modelo global.
Informaré los predictores principales.
Utilizaré intervalos de confianza cuando corresponda.
Preguntas frecuentes
¿Qué es una regresión lineal en un TFG?
Es un modelo estadístico utilizado para estudiar la relación entre una variable resultado cuantitativa y uno o varios predictores.
¿Qué diferencia hay entre regresión simple y múltiple?
La simple utiliza un predictor; la múltiple utiliza varios predictores simultáneamente.
¿Qué es R²?
Es la proporción de variabilidad observada en la variable dependiente explicada por el conjunto de predictores dentro del modelo.
¿Qué es R² ajustado?
Es una versión corregida de R² que tiene en cuenta el número de predictores y el tamaño de muestra. SPSS proporciona ambos.
¿Qué significa que la ANOVA de la regresión sea significativa?
Indica que el modelo global aporta evidencia estadística de relación entre el conjunto de predictores y la variable dependiente.
¿Qué es B?
Es el coeficiente no estandarizado. Indica el cambio esperado en Y por cada unidad adicional del predictor manteniendo constantes las demás variables.
¿Qué es beta?
Es el coeficiente estandarizado y expresa la asociación en unidades de desviación estándar.
¿B y beta son lo mismo?
No. B conserva las unidades originales; beta utiliza una escala estandarizada.
¿Qué es VIF?
Es un índice utilizado para diagnosticar multicolinealidad entre predictores. SPSS lo proporciona junto con tolerancia.
¿Qué VIF se considera malo?
No existe una frontera universal. Valores elevados indican mayor preocupación y referencias como 5 o 10 se utilizan como criterios orientativos dependiendo del contexto.
¿Qué es la homocedasticidad?
Es el supuesto de que la variabilidad de los errores permanece aproximadamente constante a lo largo de los valores predichos.
¿La variable dependiente debe ser perfectamente normal?
No es esa la formulación adecuada del supuesto clásico. Para determinadas inferencias interesa especialmente el comportamiento de los errores/residuos.
¿Qué son los residuos?
Son las diferencias entre los valores observados y los valores predichos por el modelo.
¿Qué es Durbin-Watson?
Es un estadístico utilizado para detectar autocorrelación serial en los residuos. SPSS puede calcularlo dentro del análisis de regresión.
¿Qué es la distancia de Cook?
Es una medida utilizada para identificar observaciones potencialmente influyentes sobre el modelo.
¿Puedo incluir variables categóricas?
Sí, mediante una codificación adecuada como variables dummy u otros contrastes.
¿Puedo utilizar regresión si mi resultado es Sí/No?
Normalmente deberías considerar un modelo diseñado para resultados dicotómicos, como la regresión logística.
¿Una regresión significativa demuestra causalidad?
No. La causalidad depende del diseño, temporalidad, control de confusión y otros elementos metodológicos.
¿SPSS hace regresión lineal?
Sí.
La ruta es:
Analizar → Regresión → Lineal.
¿Qué tablas necesito interpretar?
Principalmente:
Resumen del modelo.
ANOVA.
Coeficientes.
Y los diagnósticos necesarios para comprobar los supuestos.
¿Tengo que pegar todas las tablas de SPSS?
No. Es preferible presentar una tabla clara con los resultados esenciales.
Ejemplo final
Imagina este TFG:
Factores relacionados con la satisfacción laboral en trabajadores de empresas tecnológicas.
Variable dependiente:
Satisfacción laboral.
Predictores:
Autonomía.
Estrés.
Apoyo social.
Teletrabajo.
Edad.
Resultados:
R² = .48.
R² ajustado = .46.
F(5,214) = 39,51.
p < .001.
Autonomía:
B = .48.
β = .39.
p < .001.
Estrés:
B = -.34.
β = -.31.
p < .001.
Apoyo:
B = .22.
β = .18.
p = .006.
Teletrabajo:
B = .17.
β = .09.
p = .084.
Edad:
B = .004.
β = .03.
p = .511.
Entonces podrías redactar:
Se realizó una regresión lineal múltiple para analizar las variables relacionadas con la satisfacción laboral. El modelo global resultó estadísticamente significativo, F(5,214) = 39,51, p < .001, y explicó el 48 % de la variabilidad observada en satisfacción (R² = .48; R² ajustado = .46). La autonomía presentó una asociación positiva con la satisfacción (B = .48, β = .39, p < .001), mientras que el estrés mostró una asociación negativa (B = -.34, β = -.31, p < .001). El apoyo social también presentó una asociación positiva (B = .22, β = .18, p = .006). La modalidad de teletrabajo y la edad no mostraron contribuciones estadísticamente significativas una vez considerados los demás predictores.
Después debes añadir:
la comprobación de supuestos
y:
la interpretación sustantiva.
La regla más importante
Una regresión no termina cuando SPSS te dice:
p < .001.
Empieza realmente ahí.
Necesitas saber:
¿cuánto explica el modelo?
¿qué predictores aportan información?
¿en qué dirección?
¿qué significa una unidad de cambio?
¿qué incertidumbre tienen los coeficientes?
¿existe multicolinealidad?
¿cómo se comportan los residuos?
¿hay casos influyentes?
¿mi diseño permite hablar de asociación o realmente de causalidad?
Porque ejecutar una regresión lineal en SPSS lleva:
unos segundos.
Interpretarla correctamente dentro de un TFG exige entender:
qué modelo acabas de construir y hasta dónde puedes defender sus conclusiones.





Comentarios