Regresión logística en un TFG: cómo hacerla e interpretarla en SPSS

Regresión logística en un TFG: cómo hacerla e interpretarla en SPSS
Tienes terminada la encuesta de tu TFG.
Quieres estudiar qué variables se relacionan con:
abandonar o no abandonar la universidad.
O:
comprar o no comprar un producto.
O:
aprobar o suspender.
O:
tener intención de dejar la empresa: sí o no.
Tu variable resultado tiene únicamente dos posibilidades.
Entonces haces algo que parece lógico:
abrir la regresión lineal de SPSS.
Pero aparece un problema.
La regresión lineal está pensada para resultados cuantitativos continuos.
Tu variable es:
0 = No.
1 = Sí.
Aquí aparece:
la regresión logística binaria.
Es una de las técnicas más utilizadas cuando queremos estudiar un resultado dicotómico a partir de uno o varios predictores.
SPSS te devolverá términos como:
B.
Wald.
Sig.
Exp(B).
-2 Log Likelihood.
Cox & Snell.
Nagelkerke.
Hosmer-Lemeshow.
Classification Table.
Y entonces empiezan las dudas.
¿Qué significa Exp(B)?
¿Es una probabilidad?
¿OR = 2 significa el doble de probabilidad?
¿Nagelkerke R² se interpreta igual que el R² de una regresión lineal?
¿Hosmer-Lemeshow tiene que ser significativo?
¿Un predictor con p < .05 causa el resultado?
¿Tengo que mirar la tabla de clasificación?
Vamos paso a paso.
¿Qué es una regresión logística?
La regresión logística es un modelo estadístico utilizado cuando la variable dependiente representa normalmente la ocurrencia o no de un determinado evento.
Ejemplo:
Abandono
0 = No.
1 = Sí.
Queremos analizar si el abandono se relaciona con:
estrés;
edad;
modalidad de estudio;
horas de trabajo;
satisfacción académica.
El modelo estima:
la probabilidad de que ocurra el evento definido como 1.
IBM describe la regresión logística binaria precisamente como un procedimiento para modelizar una variable dependiente dicotómica a partir de una o varias variables independientes.
¿Por qué no utilizar regresión lineal?
Imagina que quieres predecir:
0 o 1.
Una regresión lineal podría producir:
-0,30.
1,28.
Pero una probabilidad no puede ser:
-30 %.
Ni:
128 %.
La regresión logística utiliza una transformación que permite mantener las probabilidades estimadas entre:
0 y 1.
Penn State explica precisamente que el modelo utiliza la función logit para relacionar los predictores con la probabilidad de que ocurra el evento.
¿Qué significa regresión logística binaria?
Binaria
significa que la variable dependiente tiene:
dos categorías.
Ejemplos:
Compra:
Sí / No.
Abandono:
Sí / No.
Aprobado:
Sí / No.
Enfermedad:
Presente / Ausente.
Intención de recomendar:
Sí / No.
No importa que los predictores tengan más categorías o sean cuantitativos.
Lo fundamental es:
la variable dependiente.
¿Y si tengo tres categorías?
Ejemplo:
Modalidad elegida:
Presencial.
Híbrida.
Online.
Ya no tienes un resultado binario.
Podrías necesitar:
regresión logística multinomial.
Otro:
Satisfacción:
Baja.
Media.
Alta.
Aquí existe un orden.
Podría tener sentido valorar:
regresión ordinal.
No utilices la logística binaria simplemente porque:
“es una regresión para categorías.”
Ejemplo sencillo
Pregunta:
¿Qué factores están asociados con la intención de abandonar la empresa?
Resultado:
ABANDONO.
0 = No.
1 = Sí.
Predictores:
Estrés.
Satisfacción.
Edad.
Teletrabajo.
La regresión logística puede estudiar:
cómo cambia la probabilidad u odds de abandono
según estos predictores.
Probabilidad y odds no son lo mismo
Este es probablemente el concepto más importante de todo el artículo.
Imagina:
Probabilidad de abandono:
p = .80.
Eso significa:
80 %.
Las odds se calculan:
p / (1-p)
Por tanto:
.80 / .20
=
Las odds son:
4 a 1.
UCLA explica precisamente esta transformación de probabilidad a odds antes de interpretar una regresión logística.
Otro ejemplo
Probabilidad:
50 %.
p = .50.
Odds:
.50 / .50
=
Odds:
1 a 1.
Probabilidad del 20 %
p = .20.
Odds:
.20 / .80
=
.25.
Odds:
0,25.
Por eso odds y probabilidad no son intercambiables
Probabilidad:
20 %.
Odds:
0,25.
Probabilidad:
80 %.
Odds:
Cuando SPSS te devuelve:
Exp(B)
no está proporcionando directamente:
una probabilidad.
Está proporcionando:
una odds ratio.
¿Qué es una odds ratio?
También:
OR.
Compara:
las odds de que ocurra un evento
entre:
dos valores o grupos.
Ejemplo:
Trabajadores remotos:
odds de abandono = 2.
Trabajadores presenciales:
odds = 1.
OR:
2 / 1
=
Interpretación:
las odds de abandono son:
2 veces mayores
en el grupo remoto que en el grupo de referencia.
No significa necesariamente:
“La probabilidad es el doble.”
UCLA muestra precisamente que una odds ratio compara odds y no probabilidades directamente.
Error muy frecuente: OR = 2 = 200 % de probabilidad
No.
Una odds ratio:
OR = 2.
No significa:
200 % de probabilidad.
Ni:
100 puntos porcentuales más.
Significa:
odds dos veces mayores.
La diferencia en probabilidades depende de:
la probabilidad inicial.
Ejemplo
Grupo referencia:
Probabilidad = 10 %.
Odds:
.10/.90 = .111.
OR = 2.
Nuevas odds:
.222.
Probabilidad correspondiente:
.222 / 1.222
≈ 18,2 %.
No:
20 % exactamente.
Otro caso
Probabilidad inicial:
50 %.
Odds:
OR = 2.
Odds nuevas:
Probabilidad:
2 / 3
≈ 66,7 %.
Mismo OR:
Cambio de probabilidad diferente.
Por eso debes tener muchísimo cuidado cuando conviertes:
odds ratio
en:
lenguaje de probabilidad.
¿Qué significa Exp(B)?
SPSS muestra:
B.
Y:
Exp(B).
La relación es:
Exp(B) = e^B.
Exp(B) representa:
la odds ratio asociada al predictor.
IBM y UCLA identifican precisamente Exp(B) como la estimación de odds ratio del coeficiente logístico.
Ejemplo
Estrés:
B = 0,69.
Exp(B) ≈ 2,00.
Interpretación:
por cada aumento de una unidad en estrés:
las odds del evento se multiplican aproximadamente por:
2,
manteniendo constantes los demás predictores.
B positivo
B > 0.
Entonces:
Exp(B) > 1.
A medida que aumenta X:
aumentan las odds de que ocurra:
Y = 1.
B negativo
B < 0.
Entonces:
Exp(B) < 1.
A medida que aumenta X:
disminuyen las odds del evento.
Ejemplo
Satisfacción:
B = -0,51.
Exp(B) = 0,60.
Interpretación:
por cada unidad adicional de satisfacción:
las odds de abandono se multiplican por:
0,60.
Eso equivale a:
una reducción aproximada del 40 % de las odds,
porque:
1 - 0,60 = 0,40.
Pero recuerda:
odds, no probabilidad.
¿Cómo interpretar OR mayor que 1?
Ejemplo:
OR = 1,80.
Las odds del evento aumentan aproximadamente:
80 %
por cada unidad adicional del predictor,
si la interpretación por unidad es adecuada.
OR menor que 1
Ejemplo:
OR = 0,70.
Las odds se reducen aproximadamente:
30 %.
1 - .70 = .30.
OR = 1
No existe cambio en las odds asociado a:
ese incremento/comparación.
El valor nulo de una odds ratio es:
1.
No:
Por eso el intervalo de confianza se compara con 1
Ejemplo:
OR = 1,75.
IC 95 %:
[1,22; 2,51].
No incluye:
Existe evidencia de una asociación positiva bajo el modelo.
Otro:
OR = 1,75.
IC 95 %:
[0,82; 3,73].
Incluye:
Existe mucha más incertidumbre.
No escribas:
“OR es grande, así que es significativo.”
Mira siempre:
intervalo
y:
p.
¿Cuál es el evento que está modelando SPSS?
Importantísimo.
Tienes:
0 = No abandona.
1 = Abandona.
SPSS está modelizando:
1 = Abandona.
Por tanto:
OR > 1
significa:
mayores odds de abandono.
Si codificas al revés:
0 = Abandona.
1 = No abandona.
Ahora el evento modelado es:
No abandono.
La interpretación se invierte.
Comprueba siempre la tabla “Dependent Variable Encoding”
SPSS muestra cómo ha codificado:
las categorías.
Ejemplo:
No = 0.
Sí = 1.
No empieces a interpretar:
Exp(B)
antes de comprobar esto.
UCLA muestra exactamente esta tabla en sus ejemplos de regresión logística en SPSS.
¿Qué variables predictoras puedo utilizar?
Pueden ser:
Cuantitativas
Edad.
Horas trabajadas.
Puntuación de estrés.
Nota.
Categóricas
Sexo.
Modalidad.
Tipo de contrato.
Nivel educativo.
SPSS permite declarar las variables categóricas y construir los contrastes correspondientes.
Cuidado con introducir una variable categórica como si fuera continua
Modalidad:
1 = presencial.
2 = híbrida.
3 = remota.
Si la metes como covariable numérica:
SPSS puede interpretar que pasar:
1 → 2
produce el mismo cambio que:
2 → 3.
Eso puede no tener ningún sentido.
Debes declararla como:
categórica.
Categoría de referencia
Supongamos:
Modalidad:
Presencial.
Híbrida.
Remota.
Referencia:
Presencial.
SPSS creará comparaciones como:
Híbrida vs Presencial.
Remota vs Presencial.
Entonces:
OR híbrida = 0,70.
OR remota = 1,80.
Interpretación:
respecto del grupo presencial:
el grupo híbrido presenta menores odds del evento;
el remoto:
mayores odds.
La categoría de referencia importa mucho
Si cambias la referencia:
cambian los coeficientes y OR mostrados.
Pero no:
los datos.
Por eso debes saber:
qué grupo funciona como referencia.
Regresión logística simple
Un predictor.
Ejemplo:
Abandono ~ Estrés.
Regresión logística múltiple
Varios predictores.
Ejemplo:
Abandono ~
Estrés
Satisfacción
Edad
Modalidad.
Ahora cada OR se interpreta:
ajustado por los demás predictores incluidos.
Odds ratio cruda y ajustada
Esto es importante.
Supongamos:
Teletrabajo y abandono.
Regresión simple:
OR = 2,10.
Después incluyes:
edad;
tipo de puesto;
antigüedad.
OR ajustada:
1,35.
¿Qué ocurrió?
Parte de la asociación inicial estaba relacionada con:
otras características.
No significa que:
la primera OR fuera “falsa.”
Significa que respondía:
a otra pregunta.
OR cruda
Asociación sin ajustar.
OR ajustada
Asociación manteniendo constantes:
las otras variables del modelo.
No confundas ambas.
Regresión logística tampoco demuestra causalidad
Mismo problema que en regresión lineal.
Encuesta transversal:
estrés
y:
abandono previsto.
OR = 2.
No escribas:
“El estrés duplica el riesgo de abandonar.”
Primero:
estás midiendo odds.
Segundo:
un diseño observacional no demuestra automáticamente causalidad.
Mejor:
Mayores niveles de estrés se asociaron con mayores odds de intención de abandono.
Odds no es riesgo
Este error aparece muchísimo en Salud.
OR = 2.
No digas automáticamente:
“El riesgo se duplica.”
Odds ratio y:
risk ratio
no son iguales.
Cuando el evento es raro:
pueden aproximarse.
Pero con eventos frecuentes:
pueden diferir bastante.
Ejemplo
Grupo A:
probabilidad = 60 %.
Grupo B:
30 %.
Risk ratio:
.60/.30
=
Odds A:
.60/.40 = 1.5.
Odds B:
.30/.70 ≈ .429.
OR:
1.5/.429
≈ 3.5.
Mismo conjunto de datos:
RR = 2.
OR = 3,5.
No los confundas.
¿Cuándo utilizar regresión logística?
Cuando tu variable dependiente es dicotómica y quieres estudiar:
cómo uno o varios predictores se relacionan con:
la probabilidad/odds de un evento.
Ejemplos:
Psicología
Riesgo elevado:
Sí/No.
Predictores:
estrés;
autoestima;
sueño.
Educación
Abandono:
Sí/No.
Predictores:
nota;
motivación;
trabajo;
modalidad.
ADE
Intención de dejar empresa:
Sí/No.
Predictores:
satisfacción;
salario;
autonomía;
teletrabajo.
Marketing
Compra:
Sí/No.
Predictores:
confianza;
precio;
calidad.
Turismo
Repetir visita:
Sí/No.
Predictores:
satisfacción;
precio;
tipo alojamiento.
¿Cuándo NO utilizarla?
Si tu resultado es:
una puntuación cuantitativa,
probablemente necesites:
regresión lineal.
Si existen:
más de dos categorías nominales:
logística multinomial.
Si son categorías ordenadas:
logística ordinal.
Si tienes:
medidas repetidas o datos agrupados,
pueden necesitarse modelos más complejos.
IBM advierte que para observaciones binarias correlacionadas o repetidas puede ser más apropiado considerar modelos mixtos generalizados o ecuaciones de estimación generalizadas.
¿Qué supuestos tiene una regresión logística?
No necesita exactamente:
los mismos supuestos de una regresión lineal.
No exige:
normalidad de Y.
Y es:
binaria.
Tampoco necesita:
homocedasticidad clásica.
Pero eso no significa:
“no tiene supuestos.”
Debes revisar:
independencia;
relación adecuada entre predictores continuos y logit;
multicolinealidad;
tamaño muestral;
separación;
observaciones influyentes;
especificación razonable del modelo.
1. Independencia de observaciones
Cada participante debería contribuir:
de forma independiente
cuando utilizas un modelo logístico estándar.
Ejemplo:
una persona:
una fila.
Problema:
mismo estudiante medido:
10 veces
como si fueran:
10 personas.
Aquí existe dependencia.
Un modelo estándar puede ser:
inadecuado.
2. Linealidad del logit
Esta frase suele confundir.
La regresión logística no exige que:
X
se relacione linealmente con:
la probabilidad.
La relación entre:
X
y:
probabilidad
suele tener forma de S.
Lo que se modeliza linealmente es:
el logit de la probabilidad.
Penn State muestra precisamente el modelo:
ln[p/(1-p)] = β₀ + β₁X₁ + ... + βₖXₖ.
Ejemplo
Edad:
18-70.
No puedes asumir automáticamente:
que cada año adicional produce exactamente el mismo cambio multiplicativo en las odds a cualquier edad.
Puede existir:
curvatura.
Cuando utilizas predictores continuos:
conviene revisar la forma funcional.
¿Cómo solucionar una relación no lineal?
Dependiendo del caso:
transformación;
término cuadrático;
splines;
categorización justificada;
otro modelo.
No categorices automáticamente:
edad
en:
joven/mayor
solo para evitar pensar en linealidad.
Pierdes información.
3. Multicolinealidad
Igual que en regresión lineal:
predictores excesivamente relacionados pueden generar:
coeficientes inestables.
Ejemplo:
Puntuación total de satisfacción.
Y sus dos subescalas:
intrínseca;
extrínseca.
Si total = suma de ambas:
introducir las tres puede generar:
redundancia enorme.
Cómo revisarla
Puedes examinar:
correlaciones.
Tolerancia.
VIF mediante un procedimiento lineal auxiliar.
No interpretes:
OR individuales
si los coeficientes son extremadamente inestables debido a:
colinealidad.
4. Tamaño muestral y número de eventos
En logística importa especialmente:
cuántas personas presentan:
el evento.
Ejemplo:
N = 500.
Evento:
Sí = 15.
No = 485.
Aunque N total parezca grande:
solo tienes:
15 eventos.
Intentar introducir:
20 predictores
puede producir:
un modelo muy inestable.
No mires únicamente N total
En resultados binarios importa:
la distribución de la variable dependiente.
500 casos:
250/250
no es igual que:
490/10.
Regla de eventos por variable
Encontrarás frecuentemente:
10 eventos por predictor.
Es una regla clásica y orientativa.
Pero no debe considerarse:
ley universal.
La muestra necesaria depende de:
prevalencia del evento;
número de predictores;
tamaño de efectos;
colinealidad;
objetivo;
validación.
Para un TFG:
lo importante es no construir:
un modelo enorme
con:
muy pocos eventos.
5. Separación completa
Este problema puede aparecer cuando un predictor predice perfectamente el resultado.
Ejemplo:
Todos los estudiantes con:
puntuación X = 1
abandonan.
Todos con:
X = 0
no abandonan.
Existe:
separación perfecta.
Los coeficientes pueden crecer muchísimo y:
la estimación clásica falla o se vuelve inestable.
Ejemplo categórico
Grupo A:
50 casos.
Todos:
No evento.
Grupo B:
Todos:
Sí evento.
SPSS puede mostrar:
coeficientes enormes;
errores estándar enormes;
problemas de convergencia.
No interpretes:
Exp(B) = 250.000
como un descubrimiento espectacular.
Puede existir:
separación.
6. Valores influyentes
También existen en logística.
SPSS puede guardar:
residuos;
residuos estandarizados;
probabilidades;
medidas de influencia.
IBM permite obtener predicciones, residuos e influencia a nivel individual.
No borres casos porque:
“estropean la significación.”
Investiga:
si son errores
o:
observaciones reales.
¿Cómo hacer regresión logística en SPSS?
Ruta:
Analizar → Regresión → Logística binaria.
IBM documenta esta ruta directamente.
Paso 1. Dependiente
Introduce:
la variable binaria.
Ejemplo:
ABANDONO.
0 = No.
1 = Sí.
Paso 2. Covariables
Introduce predictores:
ESTRÉS.
SATISFACCIÓN.
EDAD.
MODALIDAD.
Paso 3. Variables categóricas
Selecciona:
MODALIDAD.
Indica:
categoría de referencia.
Por ejemplo:
Primera.
Última.
Comprueba siempre:
cómo está codificada.
Paso 4. Método
Puede utilizarse:
Enter
para introducir simultáneamente:
los predictores definidos teóricamente.
SPSS ofrece también métodos stepwise.
IBM permite procedimientos como forward y backward mediante varios criterios.
Cuidado con Stepwise
Parece atractivo:
“SPSS elegirá las variables importantes.”
Pero puede generar:
modelos inestables
y:
selección excesivamente dependiente de tu muestra.
Si tu modelo procede de:
teoría;
hipótesis;
literatura,
Enter suele ser mucho más transparente.
Paso 5. Opciones
Puedes solicitar:
IC para Exp(B);
Hosmer-Lemeshow;
gráficos de clasificación;
listado de residuos.
IBM incluye estas opciones en el procedimiento logístico.
Primera tabla: resumen de procesamiento
SPSS muestra:
casos incluidos.
Casos perdidos.
Total.
Comprueba:
N real del modelo.
Puedes tener:
N inicial = 300.
Pero:
N analizado = 241
porque existen:
datos perdidos.
Eso puede cambiar:
muchísimo
la precisión del modelo.
Segunda tabla: codificación de la dependiente
Fundamental.
Ejemplo:
No = 0.
Sí = 1.
Ese:
1
es normalmente:
el evento modelizado.
Tercera tabla: Step 0
Modelo con:
solo constante.
Sirve como:
referencia inicial.
SPSS puede mostrar una primera tabla de clasificación basada únicamente en:
la categoría mayoritaria.
Ejemplo:
80 % no abandona.
20 % sí.
El modelo sin predictores clasifica a todos:
como no abandono.
Exactitud:
80 %.
Parece:
muy alta.
Pero es:
completamente inútil para detectar abandonos.
Esto demuestra por qué la precisión global puede engañar
Si:
95 % = No enfermedad.
5 % = enfermedad.
Un modelo que diga:
“No enfermedad”
para todo el mundo tendrá:
95 % de acierto.
¿Es bueno?
No.
Detecta:
0 %
de los casos positivos.
Por eso no interpretes solo:
overall percentage.
Omnibus Tests of Model Coefficients
Una tabla importante.
Evalúa si:
el modelo con predictores mejora respecto del modelo con:
solo constante.
Ejemplo:
χ²(4) = 38,20.
p < .001.
Puedes escribir:
El modelo que incorporó los predictores mejoró significativamente respecto del modelo con solo constante.
¿Qué significa si Omnibus no es significativo?
Ejemplo:
p = .41.
El conjunto de predictores no parece mejorar suficientemente:
el modelo base.
En ese caso:
interpretar individualmente predictores aislados requiere mucha cautela.
-2 Log Likelihood
También aparece:
-2LL.
Es una medida relacionada con:
la falta de ajuste.
En general:
modelos con menor -2LL
se ajustan mejor
cuando son comparables.
Pero el número aislado:
-2LL = 233,84
no tiene una interpretación intuitiva como:
porcentaje.
Se utiliza principalmente para:
comparaciones de modelos.
¿Qué son Cox & Snell R² y Nagelkerke R²?
SPSS presenta:
pseudo-R².
Se llaman así porque:
no son exactamente equivalentes al R² de una regresión lineal.
UCLA advierte expresamente que estas medidas intentan proporcionar información similar al R² lineal, pero no pueden interpretarse exactamente de la misma forma.
Error frecuente
Nagelkerke R² = .42.
Escribes:
El modelo explica exactamente el 42 % de la varianza.
Demasiado directo.
En logística:
Nagelkerke es:
un pseudo-R².
No debe interpretarse idénticamente al R² OLS.
Entonces, ¿para qué sirve?
Para:
describir aproximadamente el rendimiento/ajuste relativo del modelo
y:
comparar modelos dentro de un contexto.
Ejemplo:
Modelo 1:
Nagelkerke = .12.
Modelo 2:
.31.
El segundo parece:
capturar mucha más información.
Pero no lo conviertas automáticamente en:
31 % de “varianza explicada” en el mismo sentido que regresión lineal.
Cox & Snell
Tiene una limitación:
no siempre puede alcanzar:
Nagelkerke
Reescala Cox & Snell para permitir:
un máximo de 1.
Por eso suele ser:
más fácil de comunicar.
Aun así:
sigue siendo pseudo-R².
Hosmer-Lemeshow
Otra tabla famosa.
Evalúa:
la concordancia entre resultados observados y probabilidades estimadas en grupos de riesgo.
IBM describe la prueba como una medida de bondad de ajuste que agrupa los casos por probabilidades estimadas y compara:
observado
con:
esperado.
Aquí queremos normalmente p > .05
Sí.
Al contrario que en muchísimas pruebas.
Ejemplo:
Hosmer-Lemeshow:
p = .62.
No existe evidencia estadística importante de:
mal ajuste
según esa prueba.
IBM señala que:
p < .05
sugiere un ajuste deficiente en este contraste.
Pero p > .05 NO demuestra que el modelo sea perfecto
Error:
“Hosmer-Lemeshow p = .80, por tanto el modelo se ajusta perfectamente.”
No.
Solo significa:
que la prueba no detecta una discrepancia significativa bajo su procedimiento.
La prueba también depende:
del tamaño muestral;
agrupación;
datos.
No debería ser:
tu único diagnóstico.
¿Y si p < .05?
Existe:
evidencia de falta de ajuste
según Hosmer-Lemeshow.
Debes revisar:
variables omitidas;
no linealidad;
interacciones;
outliers;
especificación;
tamaño muestral.
No intentes:
“arreglar el p”
eliminando participantes.
Tabla de clasificación
SPSS compara:
resultado observado
con:
resultado predicho.
Normalmente utiliza como punto de corte:
0,50.
Ejemplo:
Si probabilidad estimada ≥ .50:
predice Sí.
Si < .50:
predice No.
Pero:
0,50
no es una frontera universal.
Ejemplo
Predicho No | Predicho Sí | |
Real No | 150 | 20 |
Real Sí | 30 | 50 |
Puedes calcular:
Especificidad
150 / 170.
Sensibilidad
50 / 80.
Exactitud global
200 / 250.
La precisión global:
80 %.
Pero debes mirar:
sensibilidad y especificidad.
Sensibilidad
De quienes realmente:
Sí,
¿cuántos detecta el modelo?
También:
true positive rate.
Especificidad
De quienes realmente:
No,
¿cuántos identifica correctamente?
Un modelo puede tener alta exactitud y sensibilidad pésima
Ejemplo:
Evento raro.
N:
1.000.
Sí:
No:
Modelo predice:
No
para todos.
Exactitud:
95 %.
Sensibilidad:
0 %.
Modelo:
prácticamente inútil para identificar:
eventos.
Punto de corte 0,50
Puede no ser adecuado si:
el evento es raro
o:
las consecuencias de falsos positivos y negativos son diferentes.
En determinados estudios se puede estudiar:
curva ROC.
Pero eso supone:
otra capa de análisis.
Curva ROC
Relaciona:
sensibilidad
y:
1 - especificidad
para diferentes puntos de corte.
El área bajo la curva:
AUC
resume la capacidad discriminativa.
IBM permite utilizar las probabilidades guardadas del modelo logístico en su procedimiento ROC.
AUC
De forma orientativa:
0,5:
discriminación equivalente al azar.
Valores mayores:
mejor discriminación.
Pero no conviertas:
.70/.80/.90
en fronteras universales sin contexto.
Importante: calibración y discriminación no son lo mismo
Puedes tener:
buena AUC
pero:
probabilidades mal calibradas.
O:
probabilidades bien calibradas
con:
discriminación moderada.
Discriminación
¿Distingue casos con evento frente a no evento?
Calibración
¿Las probabilidades estimadas corresponden razonablemente con las observadas?
Hosmer-Lemeshow se relaciona más con:
calibración.
ROC:
con discriminación.
Tabla “Variables in the Equation”
La más importante para:
interpretar predictores.
Columnas:
B.
S.E.
Wald.
df.
Sig.
Exp(B).
IC Exp(B).
¿Qué es Wald?
El estadístico de Wald contrasta:
si el coeficiente B difiere de:
Ejemplo:
Wald = 12,4.
p < .001.
Existe evidencia estadística de que:
ese coeficiente no es cero
dentro del modelo.
No interpretes Wald como tamaño del efecto
Wald grande:
no significa:
“efecto enorme.”
La magnitud la interpretas mejor mediante:
B;
OR;
intervalo.
Ejemplo
Estrés:
B = .58.
EE = .15.
Wald = 14,9.
p < .001.
Exp(B) = 1,79.
IC 95 % [1,34; 2,40].
Interpretación:
Cada incremento de un punto en estrés se asoció con unas odds de abandono 1,79 veces mayores, manteniendo constantes los demás predictores.
Convertir OR > 1 a porcentaje
OR = 1,79.
Incremento aproximado de odds:
79 %.
(1,79 - 1) × 100.
OR < 1
Satisfacción:
OR = .65.
Reducción aproximada de odds:
35 %.
(1 - .65) × 100.
No digas:
probabilidad 35 % menor.
Estás hablando de:
odds.
Ejemplo categórico
Modalidad:
Presencial = referencia.
Remota:
OR = 2,40.
Interpretación:
Los trabajadores remotos presentaron unas odds de intención de abandono 2,40 veces superiores a las de los trabajadores presenciales, manteniendo constantes las demás variables.
No:
Los remotos tienen una probabilidad 2,4 veces superior.
Predictor continuo y unidad de medida
Este punto puede cambiar totalmente la interpretación.
Edad:
OR = 1,03.
Por cada:
1 año.
Aumento aproximado de odds:
3 %.
Parece pequeño.
Pero en:
10 años,
el efecto acumulado bajo el modelo es:
1,03¹⁰
≈ 1,34.
Aproximadamente:
34 % mayores odds.
Por eso:
la unidad importa.
Otro ejemplo
Ingresos:
OR = 1,00001
por:
1 euro.
Parece irrelevante.
Pero por:
10.000 euros
puede representar:
un cambio significativo.
Es mejor reescalar:
ingresos en miles de euros.
Variables categóricas con varias categorías
Ejemplo:
Contrato:
Indefinido.
Temporal.
Autónomo.
Referencia:
Indefinido.
SPSS presenta:
Temporal.
Autónomo.
Cada OR compara:
esa categoría
con:
Indefinido.
No interpretes:
el p global de la variable
como si todas las comparaciones fueran:
iguales.
Interacciones
Puede existir:
moderación.
Ejemplo:
la relación entre estrés y abandono cambia según:
modalidad de trabajo.
Entonces puedes incluir:
Estrés × Modalidad.
Si es significativa:
la OR de estrés no es:
constante entre modalidades.
Pero la interpretación se vuelve más compleja.
No añadas:
interacciones indiscriminadamente.
Centrar variables continuas
Puede ayudar cuando utilizas:
interacciones
o:
términos polinómicos.
Ejemplo:
Estrés centrado = estrés - media.
Esto facilita:
interpretar el intercepto
y algunos coeficientes.
No cambia:
el significado fundamental de la relación.
¿Qué significa la constante?
B de:
Constant.
Representa:
el log-odds del evento cuando:
todos los predictores son 0
y:
las variables categóricas están en la referencia.
Puede ser:
poco interpretable.
Ejemplo:
edad = 0.
salario = 0.
estrés = 0.
Si esos valores no existen en tu muestra:
no necesitas dedicar mucho texto a:
la constante.
Probabilidades predichas
Una de las ventajas de logística es poder convertir:
el modelo
en:
probabilidades.
Ejemplo:
Persona A:
Estrés = 2.
Satisfacción = 5.
Probabilidad estimada de abandono:
12 %.
Persona B:
Estrés = 5.
Satisfacción = 2.
Probabilidad:
68 %.
Esto puede resultar más intuitivo que:
odds.
Pero si presentas probabilidades predichas:
explica cómo se calcularon
y:
qué variables se mantienen constantes.
Ejemplo de perfil
Puedes crear:
probabilidades ajustadas
para:
diferentes valores de un predictor.
Ejemplo:
Estrés:
1 → 9 %.
2 → 14 %.
3 → 22 %.
4 → 34 %.
5 → 49 %.
Esto muestra:
la relación no lineal entre predictor y probabilidad.
Aunque:
el logit
sea lineal.
Logit lineal, probabilidad curva
Muy importante.
B constante significa:
cambio constante en:
log-odds.
No:
cambio constante en puntos porcentuales.
Por eso:
un punto adicional de estrés
no necesariamente aumenta la probabilidad:
10 puntos
en todos los niveles.
Pseudo-R² no sustituye interpretación de OR
Puedes tener:
Nagelkerke = .25.
Pero los predictores siguen necesitando:
interpretación individual.
No reduzcas:
todo el modelo
a:
pseudo-R².
¿Cómo comparar modelos?
Puedes introducir:
bloques.
Modelo 1:
edad + sexo.
Modelo 2:
añades satisfacción + estrés.
Observa:
cambio en -2LL;
Omnibus;
pseudo-R²;
clasificación;
AIC si utilizas otro software/procedimiento;
discriminación.
No concluyas:
“Modelo 2 mejor”
solo porque:
Nagelkerke sube ligeramente.
Regresión logística jerárquica
Puedes introducir variables por:
bloques teóricos.
Ejemplo:
Bloque 1
Edad.
Sexo.
Bloque 2
Variables laborales.
Bloque 3
Estrés y satisfacción.
Esto permite estudiar:
si la nueva información mejora:
el modelo.
Stepwise otra vez: precaución
SPSS puede introducir/eliminar variables automáticamente usando:
Wald;
Likelihood Ratio;
Conditional.
No utilices:
stepwise
únicamente para:
“quedarte con las significativas.”
Puede producir:
coeficientes optimistas
y:
modelos poco replicables.
Datos perdidos
SPSS utiliza únicamente:
casos con datos disponibles en todas las variables necesarias
según el procedimiento.
Ejemplo:
N original:
Modelos con:
10 predictores.
N final:
Has perdido:
Eso puede cambiar:
potencia;
composición;
resultados.
Comprueba:
Case Processing Summary.
No respuesta diferencial
Si quienes tienen datos completos son:
sistemáticamente diferentes,
el modelo puede quedar:
sesgado.
No ignores:
la reducción de N.
Error frecuente 1: utilizar regresión lineal para Sí/No
Usa un modelo adecuado al outcome.
Error 2: interpretar Exp(B) como probabilidad
Es:
odds ratio.
Error 3: decir OR = 2 = doble probabilidad
No necesariamente.
Error 4: interpretar OR = .70 como 30 % menos de probabilidad
Es:
30 % menos de odds.
Error 5: olvidar qué categoría es 1
Puedes interpretar todo:
al revés.
Error 6: no declarar variables categóricas
SPSS puede tratarlas como:
continuas.
Error 7: olvidar la categoría de referencia
Las OR dependen de:
esa comparación.
Error 8: interpretar Nagelkerke como R² lineal
Es:
pseudo-R².
Error 9: pensar que Hosmer-Lemeshow tiene que ser significativo
Normalmente p < .05 indica:
posible falta de ajuste.
Error 10: p > .05 en Hosmer = modelo perfecto
No.
Error 11: mirar solo porcentaje total de clasificación
Puede ocultar:
sensibilidad pésima.
Error 12: interpretar Wald como tamaño del efecto
Utiliza:
OR + IC.
Error 13: ignorar intervalos de confianza
Una OR = 3
con:
IC [0,4; 22]
es extremadamente imprecisa.
Error 14: meter demasiados predictores con pocos eventos
El modelo puede ser:
inestable.
Error 15: ignorar separación perfecta
Coeficientes enormes pueden ser:
una señal de problemas.
Error 16: afirmar causalidad
Logística observacional:
no demuestra causalidad.
Error 17: utilizar Stepwise sin justificación
Puede sobreajustar.
Error 18: ignorar linealidad del logit
Especialmente con:
predictores continuos.
Error 19: eliminar outliers para conseguir p < .05
Nunca.
Error 20: copiar todas las tablas de SPSS
Resume:
los resultados relevantes.
Tabla limpia para el TFG
Puedes presentar:
Predictor | B | EE | Wald | OR | IC 95 % OR | p |
Estrés | .58 | .15 | 14.90 | 1.79 | [1.34; 2.40] | < .001 |
Satisfacción | -.43 | .14 | 9.43 | .65 | [.49; .86] | .002 |
Edad | .03 | .02 | 2.10 | 1.03 | [.99; 1.07] | .147 |
Remoto vs presencial | .88 | .31 | 8.05 | 2.41 | [1.31; 4.43] | .005 |
Debajo:
Nagelkerke R².
Omnibus.
Hosmer-Lemeshow.
N.
No necesitas copiar:
seis pantallas de SPSS.
Ejemplo completo de redacción de metodología
Se realizó una regresión logística binaria para analizar las variables asociadas con la intención de abandonar la organización. La variable dependiente fue codificada como 0 = ausencia de intención y 1 = presencia de intención. Se incluyeron como predictores el estrés, la satisfacción laboral, la edad y la modalidad de trabajo. Los predictores fueron introducidos simultáneamente mediante el método Enter. Se solicitaron odds ratios mediante Exp(B), intervalos de confianza del 95 %, la prueba de Hosmer-Lemeshow y la tabla de clasificación. Antes de interpretar el modelo se revisaron la codificación de las variables categóricas, la multicolinealidad, posibles observaciones influyentes y la adecuación funcional de los predictores continuos.
Esto explica:
qué hiciste.
Ejemplo completo de resultados
La regresión logística mostró una mejora estadísticamente significativa respecto del modelo con solo constante, χ²(4) = 42,18, p < .001. El pseudo-R² de Nagelkerke fue .31. La prueba de Hosmer-Lemeshow no mostró evidencia significativa de falta de ajuste, χ²(8) = 6,42, p = .600. El estrés se asoció positivamente con la intención de abandono (OR = 1,79; IC 95 % [1,34; 2,40]; p < .001), mientras que la satisfacción laboral mostró una asociación negativa (OR = .65; IC 95 % [.49; .86]; p = .002). Los trabajadores completamente remotos presentaron mayores odds de intención de abandono que los trabajadores presenciales (OR = 2,41; IC 95 % [1,31; 4,43]; p = .005). La edad no mostró una asociación estadísticamente significativa dentro del modelo (OR = 1,03; p = .147).
Muy claro.
Después interpreta los números
No termines:
con la tabla.
Puedes escribir:
En términos sustantivos, los resultados indican que mayores niveles de estrés se asociaron con mayores odds de intención de abandonar la empresa, mientras que mayores niveles de satisfacción se asociaron con menores odds. La modalidad completamente remota también presentó una asociación positiva con el resultado una vez consideradas las demás variables incluidas.
Ahora estás:
interpretando.
No digas “confirma la hipótesis al 100 %”
Los resultados estadísticos contienen:
incertidumbre.
Puedes decir:
Los resultados fueron compatibles con la hipótesis planteada.
O:
Se observó evidencia de la asociación prevista.
No:
Queda demostrado definitivamente.
Ejemplo de Psicología
Resultado:
Riesgo elevado de ansiedad:
Sí/No.
Predictores:
Sueño.
Estrés.
Autoestima.
Resultado:
Estrés:
OR = 1,55.
Autoestima:
OR = .72.
Sueño:
OR = .81.
Interpretación:
mayor estrés:
mayores odds.
mayor autoestima:
menores odds.
más horas de sueño:
menores odds,
si los intervalos y p respaldan esas estimaciones.
Ejemplo de Educación
Resultado:
abandono:
Sí/No.
Predictores:
nota inicial;
trabajo;
modalidad;
motivación.
OR trabajo:
2,20.
Puede interpretarse:
los estudiantes que trabajan presentan unas odds de abandono 2,20 veces las del grupo de referencia, ajustando por los demás predictores.
No:
“tienen 120 % más de probabilidad.”
Ejemplo de Marketing
Compra:
Sí/No.
Predictores:
confianza.
precio percibido.
exposición campaña.
Campaña B vs A:
OR = 1,90.
Interpretación:
las odds de compra son:
1,90 veces mayores
para B que para A,
manteniendo constantes los demás predictores.
Ejemplo de Turismo
Repetiría visita:
Sí/No.
Satisfacción:
OR = 2,30.
Esto significa:
cada unidad adicional de satisfacción multiplica las odds de intención de repetir por:
2,30,
si esa unidad tiene sentido en la escala.
Pero quizá una unidad de una escala 1-10 es:
grande.
Interpreta siempre:
la escala.
¿Tengo que informar la constante?
Normalmente no es:
el resultado principal.
Puedes dejarla en:
tabla
si la presentas.
Pero no necesitas explicar:
cada coeficiente
si no aporta contenido.
¿Tengo que informar Wald?
Puedes incluirlo.
Pero normalmente:
OR;
IC;
p
serán mucho más interpretables.
¿Tengo que informar pseudo-R²?
Sí puede ser útil.
Especialmente:
Nagelkerke.
Pero describe:
“pseudo-R²”
o:
“R² de Nagelkerke.”
No:
“porcentaje exacto de varianza explicada.”
¿Tengo que informar Hosmer-Lemeshow?
Es habitual en SPSS.
Puedes hacerlo.
Pero no lo conviertas en:
la única prueba de calidad del modelo.
¿Tengo que informar clasificación?
Solo si:
la capacidad de clasificar/predicción
es relevante.
Si tu objetivo es:
estimar asociaciones,
quizá OR e intervalos sean:
más importantes.
Explicación vs predicción
Este punto es importante.
Puedes construir una logística para:
Explicación/asociación
¿Qué variables están asociadas con el evento?
Predicción
¿Podemos predecir qué personas tendrán el evento?
Son objetivos distintos.
Un modelo con coeficientes interesantes:
no necesariamente es:
un gran clasificador.
Y un modelo predictivo:
no necesariamente permite interpretar causalmente sus variables.
Para predicción necesitas validación
Idealmente:
datos nuevos;
validación cruzada;
muestra de test.
No presentes:
la clasificación en la misma muestra
como garantía de:
rendimiento futuro.
Checklist antes de hacer regresión logística
Mi variable dependiente tiene realmente dos categorías.
Sé cuál está codificada como 1.
Sé qué evento estoy modelizando.
He comprobado datos perdidos.
Mis predictores tienen justificación teórica.
Las variables categóricas están declaradas correctamente.
Sé cuál es la categoría de referencia.
No he introducido categorías nominales como números continuos.
Tengo suficientes eventos para el modelo planteado.
He revisado multicolinealidad.
He considerado la relación funcional de predictores continuos con el logit.
He revisado posibles casos influyentes.
No existe un problema evidente de separación.
Sé interpretar B.
Sé interpretar Exp(B).
Distingo odds de probabilidad.
Distingo OR de riesgo relativo.
Utilizaré IC del 95 % para las OR.
No interpretaré Nagelkerke como R² lineal.
Sé interpretar Hosmer-Lemeshow correctamente.
No me fiaré únicamente del porcentaje global de clasificación.
No afirmaré causalidad si el diseño no la permite.
No utilizaré stepwise solo para conseguir variables significativas.
Preguntas frecuentes
¿Qué es una regresión logística?
Es un modelo utilizado para estudiar la relación entre uno o varios predictores y la probabilidad de un resultado categórico, especialmente un resultado binario.
¿Cuándo utilizo regresión logística binaria?
Cuando la variable dependiente tiene dos categorías, como sí/no, éxito/fracaso o evento/no evento.
¿Qué significa Exp(B) en SPSS?
Es la odds ratio asociada al coeficiente B.
¿Qué significa OR = 2?
Que las odds del evento son dos veces mayores por el cambio o comparación definida en el predictor, manteniendo constantes las demás variables del modelo.
¿Significa que la probabilidad se duplica?
No necesariamente. Odds y probabilidad no son lo mismo.
¿Qué significa OR = .70?
Que las odds del evento son aproximadamente un 30 % menores para el incremento o comparación correspondiente.
¿Cuál es el valor nulo de OR?
¿Qué significa B positivo?
Mayores valores del predictor se asocian con mayores log-odds y, por tanto, normalmente mayores odds del evento.
¿Qué significa B negativo?
Mayores valores del predictor se asocian con menores odds del evento.
¿Qué es Wald?
Es un contraste utilizado para evaluar si el coeficiente B difiere estadísticamente de cero.
¿Qué es Nagelkerke R²?
Es una medida de pseudo-R². No debe interpretarse exactamente como el R² de la regresión lineal.
¿Qué es Hosmer-Lemeshow?
Es una prueba de bondad de ajuste que compara eventos observados y esperados entre grupos formados según las probabilidades estimadas.
¿Hosmer-Lemeshow tiene que dar p > .05?
Habitualmente, p < .05 se interpreta como evidencia de falta de ajuste; un resultado no significativo indica que la prueba no detectó una discrepancia importante.
¿p > .05 demuestra que el modelo es bueno?
No. Debe evaluarse junto con otros indicadores y diagnósticos.
¿Qué es la tabla de clasificación?
Compara el resultado observado con la categoría predicha utilizando un punto de corte determinado.
¿Qué es sensibilidad?
Proporción de casos positivos reales correctamente identificados.
¿Qué es especificidad?
Proporción de casos negativos reales correctamente identificados.
¿Una precisión del 90 % significa que el modelo es muy bueno?
No necesariamente. Si el evento es raro, un modelo que predice siempre la categoría mayoritaria puede conseguir una precisión muy alta.
¿Puedo incluir variables categóricas?
Sí. SPSS permite definirlas y construir contrastes respecto de una categoría de referencia.
¿Puedo incluir variables cuantitativas?
Sí.
¿Necesitan ser normales?
La regresión logística no exige la normalidad clásica de predictores y outcome como la regresión lineal. Debes revisar otros supuestos, como independencia, especificación funcional y multicolinealidad.
¿Qué significa linealidad del logit?
Que los predictores continuos se relacionan linealmente con el log-odds del evento dentro de la especificación del modelo.
¿SPSS hace regresión logística?
Sí.
Ruta:
Analizar → Regresión → Logística binaria.
¿Qué pasa si tengo tres resultados posibles?
Puede corresponder una regresión multinomial u otro modelo, dependiendo de si las categorías tienen orden.
¿Una regresión logística significativa demuestra causalidad?
No. La causalidad depende del diseño y de otros elementos metodológicos.
Ejemplo final completo
Imagina este TFG:
Factores asociados con la intención de abandono laboral en trabajadores jóvenes.
Variable dependiente:
Intención de abandono.
0 = No.
1 = Sí.
Predictores:
Estrés.
Satisfacción.
Edad.
Modalidad laboral.
Muestra:
N = 280.
Resultados:
Omnibus:
χ²(5) = 46,82.
p < .001.
Nagelkerke:
R² = .29.
Hosmer-Lemeshow:
p = .71.
Predictores:
Estrés
B = .54.
OR = 1,72.
IC 95 % [1,32; 2,25].
p < .001.
Satisfacción
B = -.47.
OR = .63.
IC 95 % [.48; .82].
p = .001.
Edad
OR = .98.
p = .39.
Modalidad híbrida vs presencial
OR = 1,10.
p = .72.
Modalidad remota vs presencial
OR = 2,26.
IC 95 % [1,24; 4,12].
p = .008.
Puedes redactar:
El modelo de regresión logística mostró una mejora significativa respecto del modelo con solo constante, χ²(5) = 46,82, p < .001. El R² de Nagelkerke fue .29 y la prueba de Hosmer-Lemeshow no mostró evidencia estadísticamente significativa de falta de ajuste, p = .71. El estrés se asoció con mayores odds de intención de abandono (OR = 1,72; IC 95 % [1,32; 2,25]; p < .001), mientras que una mayor satisfacción laboral se asoció con menores odds (OR = .63; IC 95 % [.48; .82]; p = .001). Los trabajadores completamente remotos presentaron mayores odds de intención de abandono que los trabajadores presenciales (OR = 2,26; IC 95 % [1,24; 4,12]; p = .008). No se observaron asociaciones estadísticamente significativas para la edad ni para la modalidad híbrida.
Después puedes explicarlo:
En la muestra analizada, el estrés mostró una asociación positiva con la intención de abandonar la organización, mientras que la satisfacción presentó una asociación inversa. La modalidad completamente remota también mantuvo una asociación con el resultado una vez considerados los demás predictores.
Eso es bastante más correcto que escribir:
“El estrés aumenta un 72 % la probabilidad de abandonar.”
Porque el:
72 %
se refiere a:
las odds.
No directamente a:
la probabilidad.
La regla más importante
Cuando llegues a la columna:
Exp(B)
no escribas inmediatamente:
“probabilidad.”
Detente.
Pregúntate:
¿cuál es el evento codificado como 1?
¿qué categoría funciona como referencia?
¿qué unidad tiene el predictor?
¿Exp(B) es mayor o menor que 1?
¿qué dice su intervalo de confianza?
¿estoy hablando de odds o de riesgo?
¿mi modelo se ajusta razonablemente?
¿tengo suficientes eventos?
¿mi diseño permite hablar únicamente de asociación o realmente de causalidad?
Porque ejecutar una regresión logística en SPSS puede llevar:
unos segundos.
Interpretar correctamente una odds ratio puede evitar:
uno de los errores estadísticos más frecuentes de todo un TFG.
Y esa diferencia es la que separa:
copiar el output de SPSS
de:
entender realmente el modelo que has calculado.





Comentarios