sábado, 20 de enero de 2018
Ejercicio de curvas de Kaplan Meier, para estudiar sobrevida de injertos.
Cuando se estudia la sobrevida de trasplantes de riñon, se realizan por lo menos tres curvas de Kaplan Meier:
1) de sobrevida global del paciente
2) de sobrevida del injerto (considerando la muerte como pérdida del injerto)
3) de sobrevida del injerto (considerando la muerte como observación censurada)
El presente ejercicio invita a calcular estas tres gráficas.
Base y letra del problema
lunes, 15 de enero de 2018
Kaplan Meier con endopoint combinado
miércoles, 10 de enero de 2018
Kaplan Meier con Censura por muerte y sin censura por muerte. Solución en video.
En los estudios acerca de sobrevida de trasplantes de riñon, se estudia la sobrevida según dos alternativas:
1) el evento a considerar es que el riñon deja de funcionar (por ejemplo paciente entra en diálisis) y la muerte simplemente convierte una observación en censurada.
2) el evento a considerar es pérdida de funcionamiento del riñon o muerte (si el paciente muere el injerto deja de funcionar.
En los estudios sobre el tema es muy usual calcular la sobrevida del riñon de ambas maneras, y presentarlas a ambas.
También se estudia, cosa que no haremos en este ejercicio por razones de brevedad, la sobrevida global del paciente, independientemente de la causa de muerte.
Con esta temática, se estructuró el problema que sigue. Su solución puede verse en el video.
Base y letra del problema
Video
1) el evento a considerar es que el riñon deja de funcionar (por ejemplo paciente entra en diálisis) y la muerte simplemente convierte una observación en censurada.
2) el evento a considerar es pérdida de funcionamiento del riñon o muerte (si el paciente muere el injerto deja de funcionar.
En los estudios sobre el tema es muy usual calcular la sobrevida del riñon de ambas maneras, y presentarlas a ambas.
También se estudia, cosa que no haremos en este ejercicio por razones de brevedad, la sobrevida global del paciente, independientemente de la causa de muerte.
Con esta temática, se estructuró el problema que sigue. Su solución puede verse en el video.
Base y letra del problema
Video
viernes, 5 de enero de 2018
Curva de Kaplan Meier con endpoint combinado y más de un tratamiento. Video
La base adjunta simula enfermos cardíacos tratados, a partir de cierto momento inicial, con tres drogas distintas.
Se decidió trabajar con un endopoint combinado primario, compuesto por 1) muertes por causas cardiovasculares 2) stroke y 3) infarto no fatal al miocardio.
Se comparan tres drogas según el endpoint combinado.
Video
lunes, 1 de enero de 2018
Ejercicio de cálculo de fechas, Kaplan Meier y restricción de tiempo de segumiento a 5 años. Solución en video
Ejercicio en que se pide calcular tiempo de seguimiento a partir de dos fechas, y luego reducir el tiempo de seguimiento a 5 años.
Para el tiempo del seguimiento total y para el seguimiento a 5 años, se piden curvas de Kaplan Meier, discriminadas por sexo.
Base de datos y letra del problema
Solución en Video
miércoles, 10 de mayo de 2017
Regresión logística binaria. Categorización de variables continuas: una práctica con sus problemas.
En ocasiones se tiene una variable continua, por ejemplo edad, y se dicotomiza, esto es, se forman dos grupos. Por ejemplo menos de 45 años y más de 45 años.
Las dicotomizaciones son muy problemáticas. Siguiendo con el ejemplo anterior, se ubica en una misma categoría a alguien de 18 años que a uno de 44. Y se ubican en otra categoría única a alguien de 46 años que a alguien de digamos 64.
Y probablemente esas distintas edades deban ser tratadas como separadas. Si lo que nos interesa es la probabilidad de sufrir un infarto, no es lo mismo 44 que 64.
Se pierde mucha información pasando de una edad precisa a una categoría etaria. Y con la variable dicotomizada hacen falta muestras más grandes para detectar similares efectos.
En epidemiología, por ejemplo, casi no se usa la dicotomización. Se prefieren varias categorías, por ejemplo 4 o 5. Así se pierde mucho menos información. Pero aún así es preferible continuar con variables continuas, a veces usando transformaciones. Por ejemplo, quizás en vez de X se use log X o X al cuadrado. Las transformaciones usadas dependen estrictamente de cada caso.
La categorización de variables tiene un punto fuerte: ayuda en la presentación de datos, en particular en tablas.
Pero la categorización es innecesaria en análisis estadísticos y puede tener problemas reales.
Para un tratamiento más profundo y detallado del tema verse:
https://www.ncbi.nlm.nih.gov/pmc/articles/PMC1458573/
http://biostat.mc.vanderbilt.edu/wiki/Main/CatContinuous
https://bmcmedresmethodol.biomedcentral.com/articles/10.1186/1471-2288-12-21
viernes, 5 de mayo de 2017
LR test, Wald test y Hosmer y Lemeshow.
LR test
LR test, o Likelihood Ratio test, o test de Razón de verosimilitud. Se emplea en regresión logística por SPSS para comparar modelos.
Por ejemplo, para comparar el modelo del bloque 0 (sin variables explicativas) con el modelo del bloque 1.
Allí vemos un chi 2, sus grados de libertad y su significación. El chi 2 corresponde a un LR test.
Es calculado como la diferencia entre -2LL del modelo con solo una constante y -2LL del segundo modelo.
Wald

Para decidir si incluir o no a una variable en el modelo, SPSS nos ofrece el test de Wald, y el chi cuadrado que le corresponde conjuntamente con su significación. Se calcula dividiendo cada coeficiente por su error estándar, y luego elevando al cuadrado. También es posible calcular el test de Wald para un conjunto de variables que definan un factor (por ejemplo una variable categórica con tres o más categorías).
Para SPSS es fácil de calcular el test de Wald, pero no se considera un test particularmente confiable, en especial con muestras chicas: se lo ve como un tanto conservador en exceso.
Cuando se está con una muestra chica y se debe decidir si incluir una variable o no, también se puede recurrir al LR test, que es considerado más confiable, aunque es más demandante computacionalmente. Una manera de testear si una variable es significativa, consiste en correr un bloque del modelo sin dicha variable, y añadir dicha variable en un segundo bloque. Y entonces nos fijamos si el bloque añadió significativamente al modelo: esto SPSS lo hace con un LR test o test de razón de verosimilitud.
Hosmer y Lemeshow

Es una prueba de bondad de ajuste. Se adjudican probabilidades de tener el evento a cada caso, se dividen en deciles en SPSS (en otros softwares se puede trabajar con distinta cantidad de cuantiles), y en cada decil se comparan los valores observados con los esperados.
A esta tabla, inspeccionable "a ojo", se le añade una prueba de chi cuadrado. Es señal de buen ajuste que el chi cuadrado no dé significativo.
¿Qué aspira a detectar la prueba de Hosmer y Lemeshow? Principalmente variables no lineales e interacciones no tenidas en cuenta. Adicionalmente podría detectar problemas de la función "link", por ejemplo si queremos usar una regresión logística pero la regresión logística no es el modelo más apto. Podría ser mejor un modelo probit o complementary log log, por ejemplo. ("Under the assumption of binary response, there are two alternatives to logit model: probit model and complementary-log-log model.").
Hosmer y Lemeshow es un test muy usado, aunque ha sufrido críticas importantes. Por ejemplo, un problema importante es que si chequeamos con 10 grupos puede dar muy bien, y si chequeamos con 9 o con 11 puede dar mal.
De otro lado no es muy cómodo apoyarse en el p valor del chi cuadrado. Si hay pocos casos, el chi cuadrado va a ser poco sensible a problemas de especificación. Si hay muchos casos, puede ser muy sensible, y problemas irrelevantes de especificación pueden hacer que el p valor quede por debajo del valor crítico.
De todas maneras, es usado. Con pequeñas muestras, el test de Hosmer y Lemeshow tiene poco poder y es improbable que detecte sutiles desviaciones del modelo logístico. Hosmer y Lemeshow aconsejaban tamaños de muestra mayores a 400 casos, según un artículo sobre regresión logística de Viv Bewick y otros.
Otros autores aceptan Hosmer y Lemeshow si los valores esperados son 5 o más en cada celda y hay más de 5 grupos. SPSS por defecto arma 10 grupos (deciles).
Y aún otros aceptan los resultados de Hosmer y Lemeshow si las cantidades de esperados y observados se parecen bastante en términos generales.
Para SPSS es fácil de calcular el test de Wald, pero no se considera un test particularmente confiable, en especial con muestras chicas: se lo ve como un tanto conservador en exceso.
Cuando se está con una muestra chica y se debe decidir si incluir una variable o no, también se puede recurrir al LR test, que es considerado más confiable, aunque es más demandante computacionalmente. Una manera de testear si una variable es significativa, consiste en correr un bloque del modelo sin dicha variable, y añadir dicha variable en un segundo bloque. Y entonces nos fijamos si el bloque añadió significativamente al modelo: esto SPSS lo hace con un LR test o test de razón de verosimilitud.
Hosmer y Lemeshow
Es una prueba de bondad de ajuste. Se adjudican probabilidades de tener el evento a cada caso, se dividen en deciles en SPSS (en otros softwares se puede trabajar con distinta cantidad de cuantiles), y en cada decil se comparan los valores observados con los esperados.
A esta tabla, inspeccionable "a ojo", se le añade una prueba de chi cuadrado. Es señal de buen ajuste que el chi cuadrado no dé significativo.
¿Qué aspira a detectar la prueba de Hosmer y Lemeshow? Principalmente variables no lineales e interacciones no tenidas en cuenta. Adicionalmente podría detectar problemas de la función "link", por ejemplo si queremos usar una regresión logística pero la regresión logística no es el modelo más apto. Podría ser mejor un modelo probit o complementary log log, por ejemplo. ("Under the assumption of binary response, there are two alternatives to logit model: probit model and complementary-log-log model.").
Hosmer y Lemeshow es un test muy usado, aunque ha sufrido críticas importantes. Por ejemplo, un problema importante es que si chequeamos con 10 grupos puede dar muy bien, y si chequeamos con 9 o con 11 puede dar mal.
De otro lado no es muy cómodo apoyarse en el p valor del chi cuadrado. Si hay pocos casos, el chi cuadrado va a ser poco sensible a problemas de especificación. Si hay muchos casos, puede ser muy sensible, y problemas irrelevantes de especificación pueden hacer que el p valor quede por debajo del valor crítico.
De todas maneras, es usado. Con pequeñas muestras, el test de Hosmer y Lemeshow tiene poco poder y es improbable que detecte sutiles desviaciones del modelo logístico. Hosmer y Lemeshow aconsejaban tamaños de muestra mayores a 400 casos, según un artículo sobre regresión logística de Viv Bewick y otros.
Otros autores aceptan Hosmer y Lemeshow si los valores esperados son 5 o más en cada celda y hay más de 5 grupos. SPSS por defecto arma 10 grupos (deciles).
Y aún otros aceptan los resultados de Hosmer y Lemeshow si las cantidades de esperados y observados se parecen bastante en términos generales.
domingo, 30 de abril de 2017
Regresión Logística Binaria: El problema de las celdas vacías o con pocos casos.
Se dice en el sitio de la UCLA (http://stats.idre.ucla.edu/spss/dae/logit-regression/)
Empty cells or small cells:
You should check for empty or small cells by doing a crosstab between categorical predictors and the outcome variable. If a cell has very few cases (a small cell), the model may become unstable or it might not run at all.
Andy Field también aconseja en una fase preparatoria de la regresión logística chequear que se tienen datos para todas las combinaciones de las variables predictoras. Dice que se debe chequear que las frecuencias esperadas sean mayores que 1 y que no más del 20% sean menores que 5. Esto es porque los tests de bondad de ajuste hacen esta asunción.
Prosigue diciendo que cuando las muestras se dividen en categorías y una o más combinaciones están vacías esto puede crear problemas. Estos problemas serán probablemente señalados por intervalos de confianza irrazonablemente amplios.
Intervalos de confianza
Según Field, los investigadores concientes producen y chequean tablas cruzadas de múltiples vías para todas las variables categóricas independientes. Y los investigadores perezosos pero precavidos no se molestan con las tabulaciones cruzadas, pero miran cuidadosamente la amplitud de los intervalos de confianza, que no deben ser exageradamente amplios.
martes, 25 de abril de 2017
Regresión logística binaria: el problema de la SEPARACION COMPLETA
Extraños sucesos tienen lugar cuando una variable por sí misma puede separar completamente la presencia de eventos de su ausencia.
Eso es la separación completa. Se verá un ejemplo de separación completa en el video adjunto, y se mostrará cómo los intervalos de confianza del Odds Ratio (expB) nos ayudan a detectarla.
Y si el SPSS da un mensaje de no convergencia, no se debe confiar en los coeficientes de las distintas variables:
In general, you should not use the results from a logistic regression unless the parameter estimates have converged. You can increase the number of iterations allowed to see if they will converge, though usually, if the estimation doesn't converge within the default number (20 for the LOGISTIC REGRESSION procedure), it's quite possible convergence isn't going to be achieved by allowing more iterations. Inspection of the iterations history table may show that some estimates are growing larger though the log likelihood is stable, in which case a complete or quasi-complete separation is likely the issue. If this is the case, while the individual estimates are not valid (because finite estimates do not exist for such models), the predicted probabilities produced by the entire model can be used
https://drive.google.com/open?id=0B9C7VyfotFyJV2ZkX0tBUjlJZE0
Material suplementario de UCLA:
http://stats.idre.ucla.edu/other/mult-pkg/faq/general/faqwhat-is-complete-or-quasi-complete-separation-in-logisticprobit-regression-and-how-do-we-deal-with-them/
jueves, 20 de abril de 2017
Regresión Logística Binaria. Graficando el efecto de una variable sobre las probabilidades de un evento
En este video se muestra maneras de graficar el efecto de una variable continua sobre las probabilidades de un evento.
Primero se muestra para un modelo con una sola variable predictora, y luego para un modelo con varias variables.
https://drive.google.com/open?id=0B9C7VyfotFyJcF80bkFBQU52bGM
sábado, 15 de abril de 2017
Preguntas (con respuestas en documento adjunto) sobre una salida de regresión logística
En el vínculo adjunto hay tres archivos: una base de datos, un archivo con preguntas y un archivo con respuestas.
Se propone que el estudiante lea el archivo con preguntas sobre una salida de regresión logística y las conteste. Se adjunta la base, pero su uso no es imprescindible.
El documento con respuestas idealmente debe ser leído después de que el estudiante de sus propias respuestas al documento de preguntas. Conjuntamente con las respuestas, en algunos casos se añaden explicaciones complementarias que se pensó podían ser de interés.
https://drive.google.com/open?id=0B9C7VyfotFyJZkVjSlpoNmJLM0k
Un buen recurso externo con contenido similar en grandes rasgos al video, puede encontrarse en Logistic Regression | SPSS Annotated Output, de la UCLA (Universidad de California, Los Angeles)
Se propone que el estudiante lea el archivo con preguntas sobre una salida de regresión logística y las conteste. Se adjunta la base, pero su uso no es imprescindible.
El documento con respuestas idealmente debe ser leído después de que el estudiante de sus propias respuestas al documento de preguntas. Conjuntamente con las respuestas, en algunos casos se añaden explicaciones complementarias que se pensó podían ser de interés.
https://drive.google.com/open?id=0B9C7VyfotFyJZkVjSlpoNmJLM0k
Un buen recurso externo con contenido similar en grandes rasgos al video, puede encontrarse en Logistic Regression | SPSS Annotated Output, de la UCLA (Universidad de California, Los Angeles)
lunes, 10 de abril de 2017
Regresión logística con varias variables predictoras. Hosmer y Lemeshow y distancia de Cook
En este ejemplo se ve cómo interpretar un análisis con varias variables predictoras.
Se exploran relaciones bivariadas, y finalmente se chequea el modelo con prueba de Hosmer y Lemeshow y distancias de Cook.
https://drive.google.com/open?id=0B9C7VyfotFyJckJ4c0dyV29MLUU
miércoles, 5 de abril de 2017
Otra forma de chequear linealidad entre variable predictora y ln(odds): el test de Box-Tidwell
El test de Box-Tidwell consiste en añadir al modelo un término producto de la variable predictora continua y su logaritmo neperiano.
O sea, si se desea efectuar este test para la variable X1, primero calculamos el ln(X1) = X1_LN.
A continuación añadimos a la variable predictora X1, el producto X1 * X1_LN.
Si este producto es significativo, la relación no es lineal.
No es la única forma de chequear problemas de linealidad, pero probablemente sea una de las más específicas y precisas.
Adicionalmente pueden usarse gráficas de la variable predictora contra el evento con curvas Loess.
También se pueden grabar las probabilidades del modelo logístico, y correr una gráfica de las probabilidades predichas contra el evento, con curva Loess. Cuanto mayores sean las probabilidades predichas, más eventos deberá haber.
En cuanto a soluciones a las relaciones curvilíneas, dos de las más usadas son introducir un término cuadrático y si corresponde uno cúbico, o alternativamente categorizar la variable continua, por ejemplo en quintiles. Ambas soluciones funcionaron adecuadamente en el ejemplo.
https://drive.google.com/open?id=0B9C7VyfotFyJNWxZTER3dmxFMGs
viernes, 31 de marzo de 2017
Regresión logística binaria. Chequeo de la linealidad de la relación entre una variable continua y el ln(odds). Método gráfico, tomado de Bioestadística Amigable. Video
La ecuación de regresión logística es una ecuación de regresión lineal en donde Y = ln(odds).
En particular, para una variable continua, la ecuación será:
ln(odds) = constante + b1 * x1.
Pero para que una regresión lineal funcione correctamente, la relación de la variable dependiente con la independiente debe ser lineal.
Pero ¿cómo chequear si x1 y el ln(odds) se relacionan linealmente?
Hay más de una forma de hacerlo. Aquí mostraré el método usado por Miguel Angel Martínez y otros en el libro Bioestadística Amigable de editorial Elsevier.
https://drive.google.com/open?id=0B9C7VyfotFyJeEQyWE5JSklfVDg
miércoles, 29 de marzo de 2017
Ejercicio de mediación, con análisis estratificado y regresión logística. Video
Se analiza relación entre alcohol y cáncer de hígado, presumiblemente mediado por cirrosis.
Archivo y letra del problema
Video
Archivo y letra del problema
Video
martes, 28 de marzo de 2017
Regresión logística binaria: intermediación. Video
En ocasiones pensamos que una primera variable (variable1) actúa sobre una segunda (variable2) y esta a su vez sobre una variable efecto.
Dado este esquema causal, la variable 1 actúa sobre el efecto de forma indirecta. Modificando el valor que toma incidimos sobre el efecto.
La variable 2 del esquema se llama variable intermedia, o a veces también variable interviniente.
Si queremos saber la magnitud del efecto total de la variable 1 sobre el efecto, ¿corresponde controlar por la variable 2?. La respuesta es no, no se debe controlar.
Sin embargo hay ocasiones en que tenemos la relación entre la variable 1 y el efecto e introducimos en el modelo la variable 2. ¿Para qué lo hacemos? Para verificar la hipótesis de que la variable 2 es una variable intermedia. Si la variable 2 es efectivamente intermedia, la variable 1 va a pasar a ser no significativa y la variable 2 sí lo será
Pero, de nuevo, si nuestro foco está en conocer el efecto total de la variable 1 sobre el efecto, no tiene sentido controlar por la variable 2.
https://drive.google.com/open?id=0B9C7VyfotFyJaGwtMmJYZTFqN1U
sábado, 25 de marzo de 2017
Ejercicio sobre supresión y confusión en el contexto de una regresión logística (sin solución)
Se analiza a nivel primero de tablas de contingencia y luego a través de regresiones logísticas la relación primero entre aburrimiento y comisión de errores en tareas muy simples, y luego esta relación se controla con la variable inteligencia.
https://drive.google.com/open?id=0B9C7VyfotFyJUEJEMmU3SzVaajg
lunes, 20 de marzo de 2017
Relación logística binaria: confusión (ejemplo 2: supresión). Video
Hablamos de confusión cuando si introducimos una tercera variable en una relación bivariada, cambia de manera más o menos importante la magnitud del efecto calculado.
En el ejemplo que sigue, se intenta predecir la probabilidad de un grupo de países de obtener puntajes altos en las pruebas Pisa. Se utilizaron para intentar la predicción dos variables de escala: salario de los docentes y gastos por alumno.
En la primera regresión logística, con variable dependiente Puntaje Pisa y con variable explicativa Salario Medio Docente, el Odds ratio fue de 1.397.
Luego se introdujo en la regresión logística una segunda variable predictora: Gasto por alumno. Y entonces, el OR para salario medio docente creció: pasó a 1.535.
La relación original Puntajes Altos en pruebas Pisa y Salario Docente estaba parcialmente suprimida. Se vio en su pleno efecto cuando se introdujo Gasto por Alumno.
https://drive.google.com/open?id=0B9C7VyfotFyJZGt1emcxdmJNXzQ
sábado, 18 de marzo de 2017
Ejercicio sobre confusión, con análisis estratificado y regresión logística. Video
El ejercicio consiste en ver las tasas de muertes que tienen dos hospitales. Primero se ven las tasas crudas y luego controladas por la gravedad inicial de los casos.
Letra del problema y base de datos
Video
miércoles, 15 de marzo de 2017
Regresión Logística Binaria: Confusión (ejemplo 1: espureidad). Video
El término confusión se refiere a la presencia de terceras variables que alteran las relaciones entre otras variables.
En el ejemplo que se verá, hay una asociación aparente entre alcohol y cáncer de pulmón. Quienes toman más alcohol tienen más cáncer de pulmón.
Pero esto en realidad no es indicio de una relación causal. Esta relación está "confundida" por la presencia de otra variable: cigarrillo. Sucede que quienes fuman más también toman más, y por ello entre quienes toman aparecen más cánceres de pulmón.
Aquí se verá el cambio importante en las OR (expB) como indicativo de fenómenos de confusión.
Es del caso señalar que la confusión significa de manera amplia alteración en la apreciación de la relación causal entre dos variables. Luego de controlar, la relación origina se puede mostrar más fuerte, más débil o incluso nula. Lo que caracteriza a la confusión es la variación en el OR luego de que se controla.
Para que la magnitud de la confusión sea relevante, algunos autores piden que el OR cambie, subiendo o bajando, al menos un 20%.
https://drive.google.com/open?id=0B9C7VyfotFyJRWV3dmJEOHhMX3c
Materiales suplementarios:
https://www.healthknowledge.org.uk/node/803
https://www.iarc.fr/en/publications/pdfs-online/epi/cancerepi/CancerEpi-14.pdf
Suscribirse a:
Entradas (Atom)
