top of page
Buscar

Regresión logística en un TFG: cómo hacerla e interpretarla en SPSS

Foto del escritor: Tu TFG Aprobado
Tu TFG Aprobado
hace 1 día
23 min de lectura

Regresión logística en un TFG: cómo hacerla e interpretarla en SPSS

Tienes terminada la encuesta de tu TFG.

Quieres estudiar qué variables se relacionan con:

abandonar o no abandonar la universidad.

O:

comprar o no comprar un producto.

O:

aprobar o suspender.

O:

tener intención de dejar la empresa: sí o no.

Tu variable resultado tiene únicamente dos posibilidades.

Entonces haces algo que parece lógico:

abrir la regresión lineal de SPSS.

Pero aparece un problema.

La regresión lineal está pensada para resultados cuantitativos continuos.

Tu variable es:

0 = No.

1 = Sí.

Aquí aparece:

la regresión logística binaria.

Es una de las técnicas más utilizadas cuando queremos estudiar un resultado dicotómico a partir de uno o varios predictores.

SPSS te devolverá términos como:

B.

Wald.

Sig.

Exp(B).

-2 Log Likelihood.

Cox & Snell.

Nagelkerke.

Hosmer-Lemeshow.

Classification Table.

Y entonces empiezan las dudas.

¿Qué significa Exp(B)?

¿Es una probabilidad?

¿OR = 2 significa el doble de probabilidad?

¿Nagelkerke R² se interpreta igual que el R² de una regresión lineal?

¿Hosmer-Lemeshow tiene que ser significativo?

¿Un predictor con p < .05 causa el resultado?

¿Tengo que mirar la tabla de clasificación?

Vamos paso a paso.

¿Qué es una regresión logística?

La regresión logística es un modelo estadístico utilizado cuando la variable dependiente representa normalmente la ocurrencia o no de un determinado evento.

Ejemplo:

Abandono

0 = No.

1 = Sí.

Queremos analizar si el abandono se relaciona con:

  • estrés;

  • edad;

  • modalidad de estudio;

  • horas de trabajo;

  • satisfacción académica.

El modelo estima:

la probabilidad de que ocurra el evento definido como 1.

IBM describe la regresión logística binaria precisamente como un procedimiento para modelizar una variable dependiente dicotómica a partir de una o varias variables independientes.

¿Por qué no utilizar regresión lineal?

Imagina que quieres predecir:

0 o 1.

Una regresión lineal podría producir:

-0,30.

1,28.

Pero una probabilidad no puede ser:

-30 %.

Ni:

128 %.

La regresión logística utiliza una transformación que permite mantener las probabilidades estimadas entre:

0 y 1.

Penn State explica precisamente que el modelo utiliza la función logit para relacionar los predictores con la probabilidad de que ocurra el evento.

¿Qué significa regresión logística binaria?

Binaria

significa que la variable dependiente tiene:

dos categorías.

Ejemplos:

Compra:

Sí / No.

Abandono:

Sí / No.

Aprobado:

Sí / No.

Enfermedad:

Presente / Ausente.

Intención de recomendar:

Sí / No.

No importa que los predictores tengan más categorías o sean cuantitativos.

Lo fundamental es:

la variable dependiente.

¿Y si tengo tres categorías?

Ejemplo:

Modalidad elegida:

Presencial.

Híbrida.

Online.

Ya no tienes un resultado binario.

Podrías necesitar:

regresión logística multinomial.

Otro:

Satisfacción:

Baja.

Media.

Alta.

Aquí existe un orden.

Podría tener sentido valorar:

regresión ordinal.

No utilices la logística binaria simplemente porque:

“es una regresión para categorías.”

Ejemplo sencillo

Pregunta:

¿Qué factores están asociados con la intención de abandonar la empresa?

Resultado:

ABANDONO.

0 = No.

1 = Sí.

Predictores:

Estrés.

Satisfacción.

Edad.

Teletrabajo.

La regresión logística puede estudiar:

cómo cambia la probabilidad u odds de abandono

según estos predictores.

Probabilidad y odds no son lo mismo

Este es probablemente el concepto más importante de todo el artículo.

Imagina:

Probabilidad de abandono:

p = .80.

Eso significa:

80 %.

Las odds se calculan:

p / (1-p)

Por tanto:

.80 / .20

=


Las odds son:

4 a 1.

UCLA explica precisamente esta transformación de probabilidad a odds antes de interpretar una regresión logística.

Otro ejemplo

Probabilidad:

50 %.

p = .50.

Odds:

.50 / .50

=


Odds:

1 a 1.

Probabilidad del 20 %

p = .20.

Odds:

.20 / .80

=

.25.

Odds:

0,25.

Por eso odds y probabilidad no son intercambiables

Probabilidad:

20 %.

Odds:

0,25.

Probabilidad:

80 %.

Odds:


Cuando SPSS te devuelve:

Exp(B)

no está proporcionando directamente:

una probabilidad.

Está proporcionando:

una odds ratio.

¿Qué es una odds ratio?

También:

OR.

Compara:

las odds de que ocurra un evento

entre:

dos valores o grupos.

Ejemplo:

Trabajadores remotos:

odds de abandono = 2.

Trabajadores presenciales:

odds = 1.

OR:

2 / 1

=


Interpretación:

las odds de abandono son:

2 veces mayores

en el grupo remoto que en el grupo de referencia.

No significa necesariamente:

“La probabilidad es el doble.”

UCLA muestra precisamente que una odds ratio compara odds y no probabilidades directamente.

Error muy frecuente: OR = 2 = 200 % de probabilidad

No.

Una odds ratio:

OR = 2.

No significa:

200 % de probabilidad.

Ni:

100 puntos porcentuales más.

Significa:

odds dos veces mayores.

La diferencia en probabilidades depende de:

la probabilidad inicial.

Ejemplo

Grupo referencia:

Probabilidad = 10 %.

Odds:

.10/.90 = .111.

OR = 2.

Nuevas odds:

.222.

Probabilidad correspondiente:

.222 / 1.222

≈ 18,2 %.

No:

20 % exactamente.

Otro caso

Probabilidad inicial:

50 %.

Odds:


OR = 2.

Odds nuevas:


Probabilidad:

2 / 3

≈ 66,7 %.

Mismo OR:


Cambio de probabilidad diferente.

Por eso debes tener muchísimo cuidado cuando conviertes:

odds ratio

en:

lenguaje de probabilidad.

¿Qué significa Exp(B)?

SPSS muestra:

B.

Y:

Exp(B).

La relación es:

Exp(B) = e^B.

Exp(B) representa:

la odds ratio asociada al predictor.

IBM y UCLA identifican precisamente Exp(B) como la estimación de odds ratio del coeficiente logístico.

Ejemplo

Estrés:

B = 0,69.

Exp(B) ≈ 2,00.

Interpretación:

por cada aumento de una unidad en estrés:

las odds del evento se multiplican aproximadamente por:

2,

manteniendo constantes los demás predictores.

B positivo

B > 0.

Entonces:

Exp(B) > 1.

A medida que aumenta X:

aumentan las odds de que ocurra:

Y = 1.

B negativo

B < 0.

Entonces:

Exp(B) < 1.

A medida que aumenta X:

disminuyen las odds del evento.

Ejemplo

Satisfacción:

B = -0,51.

Exp(B) = 0,60.

Interpretación:

por cada unidad adicional de satisfacción:

las odds de abandono se multiplican por:

0,60.

Eso equivale a:

una reducción aproximada del 40 % de las odds,

porque:

1 - 0,60 = 0,40.

Pero recuerda:

odds, no probabilidad.

¿Cómo interpretar OR mayor que 1?

Ejemplo:

OR = 1,80.

Las odds del evento aumentan aproximadamente:

80 %

por cada unidad adicional del predictor,

si la interpretación por unidad es adecuada.

OR menor que 1

Ejemplo:

OR = 0,70.

Las odds se reducen aproximadamente:

30 %.

1 - .70 = .30.

OR = 1

No existe cambio en las odds asociado a:

ese incremento/comparación.

El valor nulo de una odds ratio es:

1.

No:


Por eso el intervalo de confianza se compara con 1

Ejemplo:

OR = 1,75.

IC 95 %:

[1,22; 2,51].

No incluye:


Existe evidencia de una asociación positiva bajo el modelo.

Otro:

OR = 1,75.

IC 95 %:

[0,82; 3,73].

Incluye:


Existe mucha más incertidumbre.

No escribas:

“OR es grande, así que es significativo.”

Mira siempre:

intervalo

y:

p.

¿Cuál es el evento que está modelando SPSS?

Importantísimo.

Tienes:

0 = No abandona.

1 = Abandona.

SPSS está modelizando:

1 = Abandona.

Por tanto:

OR > 1

significa:

mayores odds de abandono.

Si codificas al revés:

0 = Abandona.

1 = No abandona.

Ahora el evento modelado es:

No abandono.

La interpretación se invierte.

Comprueba siempre la tabla “Dependent Variable Encoding”

SPSS muestra cómo ha codificado:

las categorías.

Ejemplo:

No = 0.

Sí = 1.

No empieces a interpretar:

Exp(B)

antes de comprobar esto.

UCLA muestra exactamente esta tabla en sus ejemplos de regresión logística en SPSS.

¿Qué variables predictoras puedo utilizar?

Pueden ser:

Cuantitativas

Edad.

Horas trabajadas.

Puntuación de estrés.

Nota.

Categóricas

Sexo.

Modalidad.

Tipo de contrato.

Nivel educativo.

SPSS permite declarar las variables categóricas y construir los contrastes correspondientes.

Cuidado con introducir una variable categórica como si fuera continua

Modalidad:

1 = presencial.

2 = híbrida.

3 = remota.

Si la metes como covariable numérica:

SPSS puede interpretar que pasar:

1 → 2

produce el mismo cambio que:

2 → 3.

Eso puede no tener ningún sentido.

Debes declararla como:

categórica.

Categoría de referencia

Supongamos:

Modalidad:

Presencial.

Híbrida.

Remota.

Referencia:

Presencial.

SPSS creará comparaciones como:

Híbrida vs Presencial.

Remota vs Presencial.

Entonces:

OR híbrida = 0,70.

OR remota = 1,80.

Interpretación:

respecto del grupo presencial:

el grupo híbrido presenta menores odds del evento;

el remoto:

mayores odds.

La categoría de referencia importa mucho

Si cambias la referencia:

cambian los coeficientes y OR mostrados.

Pero no:

los datos.

Por eso debes saber:

qué grupo funciona como referencia.

Regresión logística simple

Un predictor.

Ejemplo:

Abandono ~ Estrés.

Regresión logística múltiple

Varios predictores.

Ejemplo:

Abandono ~

Estrés


Satisfacción


Edad


Modalidad.

Ahora cada OR se interpreta:

ajustado por los demás predictores incluidos.

Odds ratio cruda y ajustada

Esto es importante.

Supongamos:

Teletrabajo y abandono.

Regresión simple:

OR = 2,10.

Después incluyes:

edad;

tipo de puesto;

antigüedad.

OR ajustada:

1,35.

¿Qué ocurrió?

Parte de la asociación inicial estaba relacionada con:

otras características.

No significa que:

la primera OR fuera “falsa.”

Significa que respondía:

a otra pregunta.

OR cruda

Asociación sin ajustar.

OR ajustada

Asociación manteniendo constantes:

las otras variables del modelo.

No confundas ambas.

Regresión logística tampoco demuestra causalidad

Mismo problema que en regresión lineal.

Encuesta transversal:

estrés

y:

abandono previsto.

OR = 2.

No escribas:

“El estrés duplica el riesgo de abandonar.”

Primero:

estás midiendo odds.

Segundo:

un diseño observacional no demuestra automáticamente causalidad.

Mejor:

Mayores niveles de estrés se asociaron con mayores odds de intención de abandono.

Odds no es riesgo

Este error aparece muchísimo en Salud.

OR = 2.

No digas automáticamente:

“El riesgo se duplica.”

Odds ratio y:

risk ratio

no son iguales.

Cuando el evento es raro:

pueden aproximarse.

Pero con eventos frecuentes:

pueden diferir bastante.

Ejemplo

Grupo A:

probabilidad = 60 %.

Grupo B:

30 %.

Risk ratio:

.60/.30

=


Odds A:

.60/.40 = 1.5.

Odds B:

.30/.70 ≈ .429.

OR:

1.5/.429

≈ 3.5.

Mismo conjunto de datos:

RR = 2.

OR = 3,5.

No los confundas.

¿Cuándo utilizar regresión logística?

Cuando tu variable dependiente es dicotómica y quieres estudiar:

cómo uno o varios predictores se relacionan con:

la probabilidad/odds de un evento.

Ejemplos:

Psicología

Riesgo elevado:

Sí/No.

Predictores:

estrés;

autoestima;

sueño.

Educación

Abandono:

Sí/No.

Predictores:

nota;

motivación;

trabajo;

modalidad.

ADE

Intención de dejar empresa:

Sí/No.

Predictores:

satisfacción;

salario;

autonomía;

teletrabajo.

Marketing

Compra:

Sí/No.

Predictores:

confianza;

precio;

calidad.

Turismo

Repetir visita:

Sí/No.

Predictores:

satisfacción;

precio;

tipo alojamiento.

¿Cuándo NO utilizarla?

Si tu resultado es:

una puntuación cuantitativa,

probablemente necesites:

regresión lineal.

Si existen:

más de dos categorías nominales:

logística multinomial.

Si son categorías ordenadas:

logística ordinal.

Si tienes:

medidas repetidas o datos agrupados,

pueden necesitarse modelos más complejos.

IBM advierte que para observaciones binarias correlacionadas o repetidas puede ser más apropiado considerar modelos mixtos generalizados o ecuaciones de estimación generalizadas.

¿Qué supuestos tiene una regresión logística?

No necesita exactamente:

los mismos supuestos de una regresión lineal.

No exige:

normalidad de Y.

Y es:

binaria.

Tampoco necesita:

homocedasticidad clásica.

Pero eso no significa:

“no tiene supuestos.”

Debes revisar:

  • independencia;

  • relación adecuada entre predictores continuos y logit;

  • multicolinealidad;

  • tamaño muestral;

  • separación;

  • observaciones influyentes;

  • especificación razonable del modelo.

1. Independencia de observaciones

Cada participante debería contribuir:

de forma independiente

cuando utilizas un modelo logístico estándar.

Ejemplo:

una persona:

una fila.

Problema:

mismo estudiante medido:

10 veces

como si fueran:

10 personas.

Aquí existe dependencia.

Un modelo estándar puede ser:

inadecuado.

2. Linealidad del logit

Esta frase suele confundir.

La regresión logística no exige que:

X

se relacione linealmente con:

la probabilidad.

La relación entre:

X

y:

probabilidad

suele tener forma de S.

Lo que se modeliza linealmente es:

el logit de la probabilidad.

Penn State muestra precisamente el modelo:

ln[p/(1-p)] = β₀ + β₁X₁ + ... + βₖXₖ.

Ejemplo

Edad:

18-70.

No puedes asumir automáticamente:

que cada año adicional produce exactamente el mismo cambio multiplicativo en las odds a cualquier edad.

Puede existir:

curvatura.

Cuando utilizas predictores continuos:

conviene revisar la forma funcional.

¿Cómo solucionar una relación no lineal?

Dependiendo del caso:

  • transformación;

  • término cuadrático;

  • splines;

  • categorización justificada;

  • otro modelo.

No categorices automáticamente:

edad

en:

joven/mayor

solo para evitar pensar en linealidad.

Pierdes información.

3. Multicolinealidad

Igual que en regresión lineal:

predictores excesivamente relacionados pueden generar:

coeficientes inestables.

Ejemplo:

Puntuación total de satisfacción.

Y sus dos subescalas:

intrínseca;

extrínseca.

Si total = suma de ambas:

introducir las tres puede generar:

redundancia enorme.

Cómo revisarla

Puedes examinar:

correlaciones.

Tolerancia.

VIF mediante un procedimiento lineal auxiliar.

No interpretes:

OR individuales

si los coeficientes son extremadamente inestables debido a:

colinealidad.

4. Tamaño muestral y número de eventos

En logística importa especialmente:

cuántas personas presentan:

el evento.

Ejemplo:

N = 500.

Evento:

Sí = 15.

No = 485.

Aunque N total parezca grande:

solo tienes:

15 eventos.

Intentar introducir:

20 predictores

puede producir:

un modelo muy inestable.

No mires únicamente N total

En resultados binarios importa:

la distribución de la variable dependiente.

500 casos:

250/250

no es igual que:

490/10.

Regla de eventos por variable

Encontrarás frecuentemente:

10 eventos por predictor.

Es una regla clásica y orientativa.

Pero no debe considerarse:

ley universal.

La muestra necesaria depende de:

  • prevalencia del evento;

  • número de predictores;

  • tamaño de efectos;

  • colinealidad;

  • objetivo;

  • validación.

Para un TFG:

lo importante es no construir:

un modelo enorme

con:

muy pocos eventos.

5. Separación completa

Este problema puede aparecer cuando un predictor predice perfectamente el resultado.

Ejemplo:

Todos los estudiantes con:

puntuación X = 1

abandonan.

Todos con:

X = 0

no abandonan.

Existe:

separación perfecta.

Los coeficientes pueden crecer muchísimo y:

la estimación clásica falla o se vuelve inestable.

Ejemplo categórico

Grupo A:

50 casos.

Todos:

No evento.

Grupo B:


Todos:

Sí evento.

SPSS puede mostrar:

coeficientes enormes;

errores estándar enormes;

problemas de convergencia.

No interpretes:

Exp(B) = 250.000

como un descubrimiento espectacular.

Puede existir:

separación.

6. Valores influyentes

También existen en logística.

SPSS puede guardar:

  • residuos;

  • residuos estandarizados;

  • probabilidades;

  • medidas de influencia.

IBM permite obtener predicciones, residuos e influencia a nivel individual.

No borres casos porque:

“estropean la significación.”

Investiga:

si son errores

o:

observaciones reales.

¿Cómo hacer regresión logística en SPSS?

Ruta:

Analizar → Regresión → Logística binaria.

IBM documenta esta ruta directamente.

Paso 1. Dependiente

Introduce:

la variable binaria.

Ejemplo:

ABANDONO.

0 = No.

1 = Sí.

Paso 2. Covariables

Introduce predictores:

ESTRÉS.

SATISFACCIÓN.

EDAD.

MODALIDAD.

Paso 3. Variables categóricas

Selecciona:

MODALIDAD.

Indica:

categoría de referencia.

Por ejemplo:

Primera.

Última.

Comprueba siempre:

cómo está codificada.

Paso 4. Método

Puede utilizarse:

Enter

para introducir simultáneamente:

los predictores definidos teóricamente.

SPSS ofrece también métodos stepwise.

IBM permite procedimientos como forward y backward mediante varios criterios.

Cuidado con Stepwise

Parece atractivo:

“SPSS elegirá las variables importantes.”

Pero puede generar:

modelos inestables

y:

selección excesivamente dependiente de tu muestra.

Si tu modelo procede de:

teoría;

hipótesis;

literatura,

Enter suele ser mucho más transparente.

Paso 5. Opciones

Puedes solicitar:

  • IC para Exp(B);

  • Hosmer-Lemeshow;

  • gráficos de clasificación;

  • listado de residuos.

IBM incluye estas opciones en el procedimiento logístico.

Primera tabla: resumen de procesamiento

SPSS muestra:

casos incluidos.

Casos perdidos.

Total.

Comprueba:

N real del modelo.

Puedes tener:

N inicial = 300.

Pero:

N analizado = 241

porque existen:

datos perdidos.

Eso puede cambiar:

muchísimo

la precisión del modelo.

Segunda tabla: codificación de la dependiente

Fundamental.

Ejemplo:

No = 0.

Sí = 1.

Ese:

1

es normalmente:

el evento modelizado.

Tercera tabla: Step 0

Modelo con:

solo constante.

Sirve como:

referencia inicial.

SPSS puede mostrar una primera tabla de clasificación basada únicamente en:

la categoría mayoritaria.

Ejemplo:

80 % no abandona.

20 % sí.

El modelo sin predictores clasifica a todos:

como no abandono.

Exactitud:

80 %.

Parece:

muy alta.

Pero es:

completamente inútil para detectar abandonos.

Esto demuestra por qué la precisión global puede engañar

Si:

95 % = No enfermedad.

5 % = enfermedad.

Un modelo que diga:

“No enfermedad”

para todo el mundo tendrá:

95 % de acierto.

¿Es bueno?

No.

Detecta:

0 %

de los casos positivos.

Por eso no interpretes solo:

overall percentage.

Omnibus Tests of Model Coefficients

Una tabla importante.

Evalúa si:

el modelo con predictores mejora respecto del modelo con:

solo constante.

Ejemplo:

χ²(4) = 38,20.

p < .001.

Puedes escribir:

El modelo que incorporó los predictores mejoró significativamente respecto del modelo con solo constante.

¿Qué significa si Omnibus no es significativo?

Ejemplo:

p = .41.

El conjunto de predictores no parece mejorar suficientemente:

el modelo base.

En ese caso:

interpretar individualmente predictores aislados requiere mucha cautela.

-2 Log Likelihood

También aparece:

-2LL.

Es una medida relacionada con:

la falta de ajuste.

En general:

modelos con menor -2LL

se ajustan mejor

cuando son comparables.

Pero el número aislado:

-2LL = 233,84

no tiene una interpretación intuitiva como:

porcentaje.

Se utiliza principalmente para:

comparaciones de modelos.

¿Qué son Cox & Snell R² y Nagelkerke R²?

SPSS presenta:

pseudo-R².

Se llaman así porque:

no son exactamente equivalentes al R² de una regresión lineal.

UCLA advierte expresamente que estas medidas intentan proporcionar información similar al R² lineal, pero no pueden interpretarse exactamente de la misma forma.

Error frecuente

Nagelkerke R² = .42.

Escribes:

El modelo explica exactamente el 42 % de la varianza.

Demasiado directo.

En logística:

Nagelkerke es:

un pseudo-R².

No debe interpretarse idénticamente al R² OLS.

Entonces, ¿para qué sirve?

Para:

describir aproximadamente el rendimiento/ajuste relativo del modelo

y:

comparar modelos dentro de un contexto.

Ejemplo:

Modelo 1:

Nagelkerke = .12.

Modelo 2:

.31.

El segundo parece:

capturar mucha más información.

Pero no lo conviertas automáticamente en:

31 % de “varianza explicada” en el mismo sentido que regresión lineal.

Cox & Snell

Tiene una limitación:

no siempre puede alcanzar:


Nagelkerke

Reescala Cox & Snell para permitir:

un máximo de 1.

Por eso suele ser:

más fácil de comunicar.

Aun así:

sigue siendo pseudo-R².

Hosmer-Lemeshow

Otra tabla famosa.

Evalúa:

la concordancia entre resultados observados y probabilidades estimadas en grupos de riesgo.

IBM describe la prueba como una medida de bondad de ajuste que agrupa los casos por probabilidades estimadas y compara:

observado

con:

esperado.

Aquí queremos normalmente p > .05

Sí.

Al contrario que en muchísimas pruebas.

Ejemplo:

Hosmer-Lemeshow:

p = .62.

No existe evidencia estadística importante de:

mal ajuste

según esa prueba.

IBM señala que:

p < .05

sugiere un ajuste deficiente en este contraste.

Pero p > .05 NO demuestra que el modelo sea perfecto

Error:

“Hosmer-Lemeshow p = .80, por tanto el modelo se ajusta perfectamente.”

No.

Solo significa:

que la prueba no detecta una discrepancia significativa bajo su procedimiento.

La prueba también depende:

del tamaño muestral;

agrupación;

datos.

No debería ser:

tu único diagnóstico.

¿Y si p < .05?

Existe:

evidencia de falta de ajuste

según Hosmer-Lemeshow.

Debes revisar:

  • variables omitidas;

  • no linealidad;

  • interacciones;

  • outliers;

  • especificación;

  • tamaño muestral.

No intentes:

“arreglar el p”

eliminando participantes.

Tabla de clasificación

SPSS compara:

resultado observado

con:

resultado predicho.

Normalmente utiliza como punto de corte:

0,50.

Ejemplo:

Si probabilidad estimada ≥ .50:

predice Sí.

Si < .50:

predice No.

Pero:

0,50

no es una frontera universal.

Ejemplo


Predicho No

Predicho Sí

Real No

150

20

Real Sí

30

50

Puedes calcular:

Especificidad

150 / 170.

Sensibilidad

50 / 80.

Exactitud global

200 / 250.

La precisión global:

80 %.

Pero debes mirar:

sensibilidad y especificidad.

Sensibilidad

De quienes realmente:

Sí,

¿cuántos detecta el modelo?

También:

true positive rate.

Especificidad

De quienes realmente:

No,

¿cuántos identifica correctamente?

Un modelo puede tener alta exactitud y sensibilidad pésima

Ejemplo:

Evento raro.

N:

1.000.

Sí:


No:


Modelo predice:

No

para todos.

Exactitud:

95 %.

Sensibilidad:

0 %.

Modelo:

prácticamente inútil para identificar:

eventos.

Punto de corte 0,50

Puede no ser adecuado si:

el evento es raro

o:

las consecuencias de falsos positivos y negativos son diferentes.

En determinados estudios se puede estudiar:

curva ROC.

Pero eso supone:

otra capa de análisis.

Curva ROC

Relaciona:

sensibilidad

y:

1 - especificidad

para diferentes puntos de corte.

El área bajo la curva:

AUC

resume la capacidad discriminativa.

IBM permite utilizar las probabilidades guardadas del modelo logístico en su procedimiento ROC.

AUC

De forma orientativa:

0,5:

discriminación equivalente al azar.

Valores mayores:

mejor discriminación.

Pero no conviertas:

.70/.80/.90

en fronteras universales sin contexto.

Importante: calibración y discriminación no son lo mismo

Puedes tener:

buena AUC

pero:

probabilidades mal calibradas.

O:

probabilidades bien calibradas

con:

discriminación moderada.

Discriminación

¿Distingue casos con evento frente a no evento?

Calibración

¿Las probabilidades estimadas corresponden razonablemente con las observadas?

Hosmer-Lemeshow se relaciona más con:

calibración.

ROC:

con discriminación.

Tabla “Variables in the Equation”

La más importante para:

interpretar predictores.

Columnas:

B.

S.E.

Wald.

df.

Sig.

Exp(B).

IC Exp(B).

¿Qué es Wald?

El estadístico de Wald contrasta:

si el coeficiente B difiere de:


Ejemplo:

Wald = 12,4.

p < .001.

Existe evidencia estadística de que:

ese coeficiente no es cero

dentro del modelo.

No interpretes Wald como tamaño del efecto

Wald grande:

no significa:

“efecto enorme.”

La magnitud la interpretas mejor mediante:

B;

OR;

intervalo.

Ejemplo

Estrés:

B = .58.

EE = .15.

Wald = 14,9.

p < .001.

Exp(B) = 1,79.

IC 95 % [1,34; 2,40].

Interpretación:

Cada incremento de un punto en estrés se asoció con unas odds de abandono 1,79 veces mayores, manteniendo constantes los demás predictores.

Convertir OR > 1 a porcentaje

OR = 1,79.

Incremento aproximado de odds:

79 %.

(1,79 - 1) × 100.

OR < 1

Satisfacción:

OR = .65.

Reducción aproximada de odds:

35 %.

(1 - .65) × 100.

No digas:

probabilidad 35 % menor.

Estás hablando de:

odds.

Ejemplo categórico

Modalidad:

Presencial = referencia.

Remota:

OR = 2,40.

Interpretación:

Los trabajadores remotos presentaron unas odds de intención de abandono 2,40 veces superiores a las de los trabajadores presenciales, manteniendo constantes las demás variables.

No:

Los remotos tienen una probabilidad 2,4 veces superior.

Predictor continuo y unidad de medida

Este punto puede cambiar totalmente la interpretación.

Edad:

OR = 1,03.

Por cada:

1 año.

Aumento aproximado de odds:

3 %.

Parece pequeño.

Pero en:

10 años,

el efecto acumulado bajo el modelo es:

1,03¹⁰

≈ 1,34.

Aproximadamente:

34 % mayores odds.

Por eso:

la unidad importa.

Otro ejemplo

Ingresos:

OR = 1,00001

por:

1 euro.

Parece irrelevante.

Pero por:

10.000 euros

puede representar:

un cambio significativo.

Es mejor reescalar:

ingresos en miles de euros.

Variables categóricas con varias categorías

Ejemplo:

Contrato:

Indefinido.

Temporal.

Autónomo.

Referencia:

Indefinido.

SPSS presenta:

Temporal.

Autónomo.

Cada OR compara:

esa categoría

con:

Indefinido.

No interpretes:

el p global de la variable

como si todas las comparaciones fueran:

iguales.

Interacciones

Puede existir:

moderación.

Ejemplo:

la relación entre estrés y abandono cambia según:

modalidad de trabajo.

Entonces puedes incluir:

Estrés × Modalidad.

Si es significativa:

la OR de estrés no es:

constante entre modalidades.

Pero la interpretación se vuelve más compleja.

No añadas:

interacciones indiscriminadamente.

Centrar variables continuas

Puede ayudar cuando utilizas:

interacciones

o:

términos polinómicos.

Ejemplo:

Estrés centrado = estrés - media.

Esto facilita:

interpretar el intercepto

y algunos coeficientes.

No cambia:

el significado fundamental de la relación.

¿Qué significa la constante?

B de:

Constant.

Representa:

el log-odds del evento cuando:

todos los predictores son 0

y:

las variables categóricas están en la referencia.

Puede ser:

poco interpretable.

Ejemplo:

edad = 0.

salario = 0.

estrés = 0.

Si esos valores no existen en tu muestra:

no necesitas dedicar mucho texto a:

la constante.

Probabilidades predichas

Una de las ventajas de logística es poder convertir:

el modelo

en:

probabilidades.

Ejemplo:

Persona A:

Estrés = 2.

Satisfacción = 5.

Probabilidad estimada de abandono:

12 %.

Persona B:

Estrés = 5.

Satisfacción = 2.

Probabilidad:

68 %.

Esto puede resultar más intuitivo que:

odds.

Pero si presentas probabilidades predichas:

explica cómo se calcularon

y:

qué variables se mantienen constantes.

Ejemplo de perfil

Puedes crear:

probabilidades ajustadas

para:

diferentes valores de un predictor.

Ejemplo:

Estrés:

1 → 9 %.

2 → 14 %.

3 → 22 %.

4 → 34 %.

5 → 49 %.

Esto muestra:

la relación no lineal entre predictor y probabilidad.

Aunque:

el logit

sea lineal.

Logit lineal, probabilidad curva

Muy importante.

B constante significa:

cambio constante en:

log-odds.

No:

cambio constante en puntos porcentuales.

Por eso:

un punto adicional de estrés

no necesariamente aumenta la probabilidad:

10 puntos

en todos los niveles.

Pseudo-R² no sustituye interpretación de OR

Puedes tener:

Nagelkerke = .25.

Pero los predictores siguen necesitando:

interpretación individual.

No reduzcas:

todo el modelo

a:

pseudo-R².

¿Cómo comparar modelos?

Puedes introducir:

bloques.

Modelo 1:

edad + sexo.

Modelo 2:

añades satisfacción + estrés.

Observa:

  • cambio en -2LL;

  • Omnibus;

  • pseudo-R²;

  • clasificación;

  • AIC si utilizas otro software/procedimiento;

  • discriminación.

No concluyas:

“Modelo 2 mejor”

solo porque:

Nagelkerke sube ligeramente.

Regresión logística jerárquica

Puedes introducir variables por:

bloques teóricos.

Ejemplo:

Bloque 1

Edad.

Sexo.

Bloque 2

Variables laborales.

Bloque 3

Estrés y satisfacción.

Esto permite estudiar:

si la nueva información mejora:

el modelo.

Stepwise otra vez: precaución

SPSS puede introducir/eliminar variables automáticamente usando:

Wald;

Likelihood Ratio;

Conditional.

No utilices:

stepwise

únicamente para:

“quedarte con las significativas.”

Puede producir:

coeficientes optimistas

y:

modelos poco replicables.

Datos perdidos

SPSS utiliza únicamente:

casos con datos disponibles en todas las variables necesarias

según el procedimiento.

Ejemplo:

N original:


Modelos con:

10 predictores.

N final:


Has perdido:


Eso puede cambiar:

potencia;

composición;

resultados.

Comprueba:

Case Processing Summary.

No respuesta diferencial

Si quienes tienen datos completos son:

sistemáticamente diferentes,

el modelo puede quedar:

sesgado.

No ignores:

la reducción de N.

Error frecuente 1: utilizar regresión lineal para Sí/No

Usa un modelo adecuado al outcome.

Error 2: interpretar Exp(B) como probabilidad

Es:

odds ratio.

Error 3: decir OR = 2 = doble probabilidad

No necesariamente.

Error 4: interpretar OR = .70 como 30 % menos de probabilidad

Es:

30 % menos de odds.

Error 5: olvidar qué categoría es 1

Puedes interpretar todo:

al revés.

Error 6: no declarar variables categóricas

SPSS puede tratarlas como:

continuas.

Error 7: olvidar la categoría de referencia

Las OR dependen de:

esa comparación.

Error 8: interpretar Nagelkerke como R² lineal

Es:

pseudo-R².

Error 9: pensar que Hosmer-Lemeshow tiene que ser significativo

Normalmente p < .05 indica:

posible falta de ajuste.

Error 10: p > .05 en Hosmer = modelo perfecto

No.

Error 11: mirar solo porcentaje total de clasificación

Puede ocultar:

sensibilidad pésima.

Error 12: interpretar Wald como tamaño del efecto

Utiliza:

OR + IC.

Error 13: ignorar intervalos de confianza

Una OR = 3

con:

IC [0,4; 22]

es extremadamente imprecisa.

Error 14: meter demasiados predictores con pocos eventos

El modelo puede ser:

inestable.

Error 15: ignorar separación perfecta

Coeficientes enormes pueden ser:

una señal de problemas.

Error 16: afirmar causalidad

Logística observacional:

no demuestra causalidad.

Error 17: utilizar Stepwise sin justificación

Puede sobreajustar.

Error 18: ignorar linealidad del logit

Especialmente con:

predictores continuos.

Error 19: eliminar outliers para conseguir p < .05

Nunca.

Error 20: copiar todas las tablas de SPSS

Resume:

los resultados relevantes.

Tabla limpia para el TFG

Puedes presentar:

Predictor

B

EE

Wald

OR

IC 95 % OR

p

Estrés

.58

.15

14.90

1.79

[1.34; 2.40]

< .001

Satisfacción

-.43

.14

9.43

.65

[.49; .86]

.002

Edad

.03

.02

2.10

1.03

[.99; 1.07]

.147

Remoto vs presencial

.88

.31

8.05

2.41

[1.31; 4.43]

.005

Debajo:

Nagelkerke R².

Omnibus.

Hosmer-Lemeshow.

N.

No necesitas copiar:

seis pantallas de SPSS.

Ejemplo completo de redacción de metodología

Se realizó una regresión logística binaria para analizar las variables asociadas con la intención de abandonar la organización. La variable dependiente fue codificada como 0 = ausencia de intención y 1 = presencia de intención. Se incluyeron como predictores el estrés, la satisfacción laboral, la edad y la modalidad de trabajo. Los predictores fueron introducidos simultáneamente mediante el método Enter. Se solicitaron odds ratios mediante Exp(B), intervalos de confianza del 95 %, la prueba de Hosmer-Lemeshow y la tabla de clasificación. Antes de interpretar el modelo se revisaron la codificación de las variables categóricas, la multicolinealidad, posibles observaciones influyentes y la adecuación funcional de los predictores continuos.

Esto explica:

qué hiciste.

Ejemplo completo de resultados

La regresión logística mostró una mejora estadísticamente significativa respecto del modelo con solo constante, χ²(4) = 42,18, p < .001. El pseudo-R² de Nagelkerke fue .31. La prueba de Hosmer-Lemeshow no mostró evidencia significativa de falta de ajuste, χ²(8) = 6,42, p = .600. El estrés se asoció positivamente con la intención de abandono (OR = 1,79; IC 95 % [1,34; 2,40]; p < .001), mientras que la satisfacción laboral mostró una asociación negativa (OR = .65; IC 95 % [.49; .86]; p = .002). Los trabajadores completamente remotos presentaron mayores odds de intención de abandono que los trabajadores presenciales (OR = 2,41; IC 95 % [1,31; 4,43]; p = .005). La edad no mostró una asociación estadísticamente significativa dentro del modelo (OR = 1,03; p = .147).

Muy claro.

Después interpreta los números

No termines:

con la tabla.

Puedes escribir:

En términos sustantivos, los resultados indican que mayores niveles de estrés se asociaron con mayores odds de intención de abandonar la empresa, mientras que mayores niveles de satisfacción se asociaron con menores odds. La modalidad completamente remota también presentó una asociación positiva con el resultado una vez consideradas las demás variables incluidas.

Ahora estás:

interpretando.

No digas “confirma la hipótesis al 100 %”

Los resultados estadísticos contienen:

incertidumbre.

Puedes decir:

Los resultados fueron compatibles con la hipótesis planteada.

O:

Se observó evidencia de la asociación prevista.

No:

Queda demostrado definitivamente.

Ejemplo de Psicología

Resultado:

Riesgo elevado de ansiedad:

Sí/No.

Predictores:

Sueño.

Estrés.

Autoestima.

Resultado:

Estrés:

OR = 1,55.

Autoestima:

OR = .72.

Sueño:

OR = .81.

Interpretación:

mayor estrés:

mayores odds.

mayor autoestima:

menores odds.

más horas de sueño:

menores odds,

si los intervalos y p respaldan esas estimaciones.

Ejemplo de Educación

Resultado:

abandono:

Sí/No.

Predictores:

nota inicial;

trabajo;

modalidad;

motivación.

OR trabajo:

2,20.

Puede interpretarse:

los estudiantes que trabajan presentan unas odds de abandono 2,20 veces las del grupo de referencia, ajustando por los demás predictores.

No:

“tienen 120 % más de probabilidad.”

Ejemplo de Marketing

Compra:

Sí/No.

Predictores:

confianza.

precio percibido.

exposición campaña.

Campaña B vs A:

OR = 1,90.

Interpretación:

las odds de compra son:

1,90 veces mayores

para B que para A,

manteniendo constantes los demás predictores.

Ejemplo de Turismo

Repetiría visita:

Sí/No.

Satisfacción:

OR = 2,30.

Esto significa:

cada unidad adicional de satisfacción multiplica las odds de intención de repetir por:

2,30,

si esa unidad tiene sentido en la escala.

Pero quizá una unidad de una escala 1-10 es:

grande.

Interpreta siempre:

la escala.

¿Tengo que informar la constante?

Normalmente no es:

el resultado principal.

Puedes dejarla en:

tabla

si la presentas.

Pero no necesitas explicar:

cada coeficiente

si no aporta contenido.

¿Tengo que informar Wald?

Puedes incluirlo.

Pero normalmente:

OR;

IC;

p

serán mucho más interpretables.

¿Tengo que informar pseudo-R²?

Sí puede ser útil.

Especialmente:

Nagelkerke.

Pero describe:

“pseudo-R²”

o:

“R² de Nagelkerke.”

No:

“porcentaje exacto de varianza explicada.”

¿Tengo que informar Hosmer-Lemeshow?

Es habitual en SPSS.

Puedes hacerlo.

Pero no lo conviertas en:

la única prueba de calidad del modelo.

¿Tengo que informar clasificación?

Solo si:

la capacidad de clasificar/predicción

es relevante.

Si tu objetivo es:

estimar asociaciones,

quizá OR e intervalos sean:

más importantes.

Explicación vs predicción

Este punto es importante.

Puedes construir una logística para:

Explicación/asociación

¿Qué variables están asociadas con el evento?

Predicción

¿Podemos predecir qué personas tendrán el evento?

Son objetivos distintos.

Un modelo con coeficientes interesantes:

no necesariamente es:

un gran clasificador.

Y un modelo predictivo:

no necesariamente permite interpretar causalmente sus variables.

Para predicción necesitas validación

Idealmente:

datos nuevos;

validación cruzada;

muestra de test.

No presentes:

la clasificación en la misma muestra

como garantía de:

rendimiento futuro.

Checklist antes de hacer regresión logística

  • Mi variable dependiente tiene realmente dos categorías.

  • Sé cuál está codificada como 1.

  • Sé qué evento estoy modelizando.

  • He comprobado datos perdidos.

  • Mis predictores tienen justificación teórica.

  • Las variables categóricas están declaradas correctamente.

  • Sé cuál es la categoría de referencia.

  • No he introducido categorías nominales como números continuos.

  • Tengo suficientes eventos para el modelo planteado.

  • He revisado multicolinealidad.

  • He considerado la relación funcional de predictores continuos con el logit.

  • He revisado posibles casos influyentes.

  • No existe un problema evidente de separación.

  • Sé interpretar B.

  • Sé interpretar Exp(B).

  • Distingo odds de probabilidad.

  • Distingo OR de riesgo relativo.

  • Utilizaré IC del 95 % para las OR.

  • No interpretaré Nagelkerke como R² lineal.

  • Sé interpretar Hosmer-Lemeshow correctamente.

  • No me fiaré únicamente del porcentaje global de clasificación.

  • No afirmaré causalidad si el diseño no la permite.

  • No utilizaré stepwise solo para conseguir variables significativas.

Preguntas frecuentes

¿Qué es una regresión logística?

Es un modelo utilizado para estudiar la relación entre uno o varios predictores y la probabilidad de un resultado categórico, especialmente un resultado binario.

¿Cuándo utilizo regresión logística binaria?

Cuando la variable dependiente tiene dos categorías, como sí/no, éxito/fracaso o evento/no evento.

¿Qué significa Exp(B) en SPSS?

Es la odds ratio asociada al coeficiente B.

¿Qué significa OR = 2?

Que las odds del evento son dos veces mayores por el cambio o comparación definida en el predictor, manteniendo constantes las demás variables del modelo.

¿Significa que la probabilidad se duplica?

No necesariamente. Odds y probabilidad no son lo mismo.

¿Qué significa OR = .70?

Que las odds del evento son aproximadamente un 30 % menores para el incremento o comparación correspondiente.

¿Cuál es el valor nulo de OR?


¿Qué significa B positivo?

Mayores valores del predictor se asocian con mayores log-odds y, por tanto, normalmente mayores odds del evento.

¿Qué significa B negativo?

Mayores valores del predictor se asocian con menores odds del evento.

¿Qué es Wald?

Es un contraste utilizado para evaluar si el coeficiente B difiere estadísticamente de cero.

¿Qué es Nagelkerke R²?

Es una medida de pseudo-R². No debe interpretarse exactamente como el R² de la regresión lineal.

¿Qué es Hosmer-Lemeshow?

Es una prueba de bondad de ajuste que compara eventos observados y esperados entre grupos formados según las probabilidades estimadas.

¿Hosmer-Lemeshow tiene que dar p > .05?

Habitualmente, p < .05 se interpreta como evidencia de falta de ajuste; un resultado no significativo indica que la prueba no detectó una discrepancia importante.

¿p > .05 demuestra que el modelo es bueno?

No. Debe evaluarse junto con otros indicadores y diagnósticos.

¿Qué es la tabla de clasificación?

Compara el resultado observado con la categoría predicha utilizando un punto de corte determinado.

¿Qué es sensibilidad?

Proporción de casos positivos reales correctamente identificados.

¿Qué es especificidad?

Proporción de casos negativos reales correctamente identificados.

¿Una precisión del 90 % significa que el modelo es muy bueno?

No necesariamente. Si el evento es raro, un modelo que predice siempre la categoría mayoritaria puede conseguir una precisión muy alta.

¿Puedo incluir variables categóricas?

Sí. SPSS permite definirlas y construir contrastes respecto de una categoría de referencia.

¿Puedo incluir variables cuantitativas?

Sí.

¿Necesitan ser normales?

La regresión logística no exige la normalidad clásica de predictores y outcome como la regresión lineal. Debes revisar otros supuestos, como independencia, especificación funcional y multicolinealidad.

¿Qué significa linealidad del logit?

Que los predictores continuos se relacionan linealmente con el log-odds del evento dentro de la especificación del modelo.

¿SPSS hace regresión logística?

Sí.

Ruta:

Analizar → Regresión → Logística binaria.

¿Qué pasa si tengo tres resultados posibles?

Puede corresponder una regresión multinomial u otro modelo, dependiendo de si las categorías tienen orden.

¿Una regresión logística significativa demuestra causalidad?

No. La causalidad depende del diseño y de otros elementos metodológicos.

Ejemplo final completo

Imagina este TFG:

Factores asociados con la intención de abandono laboral en trabajadores jóvenes.

Variable dependiente:

Intención de abandono.

0 = No.

1 = Sí.

Predictores:

Estrés.

Satisfacción.

Edad.

Modalidad laboral.

Muestra:

N = 280.

Resultados:

Omnibus:

χ²(5) = 46,82.

p < .001.

Nagelkerke:

R² = .29.

Hosmer-Lemeshow:

p = .71.

Predictores:

Estrés

B = .54.

OR = 1,72.

IC 95 % [1,32; 2,25].

p < .001.

Satisfacción

B = -.47.

OR = .63.

IC 95 % [.48; .82].

p = .001.

Edad

OR = .98.

p = .39.

Modalidad híbrida vs presencial

OR = 1,10.

p = .72.

Modalidad remota vs presencial

OR = 2,26.

IC 95 % [1,24; 4,12].

p = .008.

Puedes redactar:

El modelo de regresión logística mostró una mejora significativa respecto del modelo con solo constante, χ²(5) = 46,82, p < .001. El R² de Nagelkerke fue .29 y la prueba de Hosmer-Lemeshow no mostró evidencia estadísticamente significativa de falta de ajuste, p = .71. El estrés se asoció con mayores odds de intención de abandono (OR = 1,72; IC 95 % [1,32; 2,25]; p < .001), mientras que una mayor satisfacción laboral se asoció con menores odds (OR = .63; IC 95 % [.48; .82]; p = .001). Los trabajadores completamente remotos presentaron mayores odds de intención de abandono que los trabajadores presenciales (OR = 2,26; IC 95 % [1,24; 4,12]; p = .008). No se observaron asociaciones estadísticamente significativas para la edad ni para la modalidad híbrida.

Después puedes explicarlo:

En la muestra analizada, el estrés mostró una asociación positiva con la intención de abandonar la organización, mientras que la satisfacción presentó una asociación inversa. La modalidad completamente remota también mantuvo una asociación con el resultado una vez considerados los demás predictores.

Eso es bastante más correcto que escribir:

“El estrés aumenta un 72 % la probabilidad de abandonar.”

Porque el:

72 %

se refiere a:

las odds.

No directamente a:

la probabilidad.

La regla más importante

Cuando llegues a la columna:

Exp(B)

no escribas inmediatamente:

“probabilidad.”

Detente.

Pregúntate:

¿cuál es el evento codificado como 1?

¿qué categoría funciona como referencia?

¿qué unidad tiene el predictor?

¿Exp(B) es mayor o menor que 1?

¿qué dice su intervalo de confianza?

¿estoy hablando de odds o de riesgo?

¿mi modelo se ajusta razonablemente?

¿tengo suficientes eventos?

¿mi diseño permite hablar únicamente de asociación o realmente de causalidad?

Porque ejecutar una regresión logística en SPSS puede llevar:

unos segundos.

Interpretar correctamente una odds ratio puede evitar:

uno de los errores estadísticos más frecuentes de todo un TFG.

Y esa diferencia es la que separa:

copiar el output de SPSS

de:

entender realmente el modelo que has calculado.


Regresión logística en un TFG: cómo hacerla e interpretarla en SPSS

 
 
 

Comentarios


bottom of page