0041/2026 - Predictive Models for Primary Health Care: Assessing PCATool with Machine Learning in Rio de Janeiro, Brazil Modelos Preditivos para Atenção Primária à Saúde: Acessando o PCATool com Aprendizado de Máquina no Rio de Janeiro, Brasil
This study aimed to evaluate the predictive performance of machine learning algorithms in estimating PCATool, leveraging two datasets spanning 10 years. Participants were adults (?18y) and children (?12y) surveyed in 2014 and 2024 in Rio de Janeiro. The outcomes were the PCATool i) general and ii) essential scores (Low [?6.6] and High [>6.6]). Data from 2014 was divided (80:20) into: i) training and ii) test set. Data from 2024 was used for external validation. Five different machine-learning models were tested. A total of 4,417 adults and 4,072 children were included. Random Forest Classifier (RFC) demonstrated the best overall performance for the general score in adults, achieving an AUC=0.68 (95%CI[0.64–0.72]) in the test set and 0.66 (95%CI[0.62–0.69]) in the validation set. For the essential score in adults, RFC also outperformed other models, with an AUC=0.68 (95%CI[0.63–0.72]) in the test set and 0.65 (95%CI[0.62–0.69]) in the validation set. In children, Extreme Gradient Boosting exhibited the best overall performance for the general score, achieving an AUC=0.65 (95%CI[0.60–0.69]) in the test set and 0.63 (95%CI[0.59–0.66]) in the validation set. Shapley value analysis identified continuity of care with the same doctor as the most influential predictor across models. These findings highlight the potential of machine learning to predict PCATool scores.
Palavras-chave:
Public Health, machine learning, prediction.
Abstract:
Este estudo teve como objetivo avaliar o desempenho preditivo de algoritmos de aprendizado de máquina na estimativa do PCATool, utilizando dois conjuntos de dados abrangendo 10 anos. Os participantes foram adultos (≥18 anos) e crianças (≤12 anos) entrevistados em 2014 e 2024 no Rio de Janeiro. Os desfechos foram os escores do PCATool i) geral e ii) essencial (Baixo [≤6,6] e Alto [>6,6]). Os dados de 2014 foram divididos (80:20) em: i) conjunto de treinamento e ii) conjunto de teste. Os dados de 2024 foram usados para validação externa. Cinco diferentes modelos de aprendizado de máquina foram testados. Um total de 4.417 adultos e 4.072 crianças foram incluídos. O Random Forest Classifier (RFC) demonstrou o melhor desempenho geral para o escore geral em adultos, alcançando uma AUC=0,68 (IC95%[0,64–0,72]) no conjunto de teste e 0,66 (IC95%[0,62–0,69]) no conjunto de validação. Para o escore essencial em adultos, o RFC também superou outros modelos, com AUC=0,68 (IC95%[0,63–0,72]) no conjunto de teste e 0,65 (IC95%[0,62–0,69]) no conjunto de validação. Em crianças, o Extreme Gradient Boosting apresentou o melhor desempenho geral para o escore geral, com AUC=0,65 (IC95%[0,60–0,69]) no conjunto de teste e 0,63 (IC95%[0,59–0,66]) no conjunto de validação. A análise de valores Shapley identificou a continuidade do cuidado com o mesmo médico como o preditor mais influente entre os modelos. Esses resultados destacam o potencial do aprendizado de máquina para prever escores do PCATool.
Modelos Preditivos para Atenção Primária à Saúde: Acessando o PCATool com Aprendizado de Máquina no Rio de Janeiro, Brasil
Resumo (abstract):
Este estudo teve como objetivo avaliar o desempenho preditivo de algoritmos de aprendizado de máquina na estimativa do PCATool, utilizando dois conjuntos de dados abrangendo 10 anos. Os participantes foram adultos (≥18 anos) e crianças (≤12 anos) entrevistados em 2014 e 2024 no Rio de Janeiro. Os desfechos foram os escores do PCATool i) geral e ii) essencial (Baixo [≤6,6] e Alto [>6,6]). Os dados de 2014 foram divididos (80:20) em: i) conjunto de treinamento e ii) conjunto de teste. Os dados de 2024 foram usados para validação externa. Cinco diferentes modelos de aprendizado de máquina foram testados. Um total de 4.417 adultos e 4.072 crianças foram incluídos. O Random Forest Classifier (RFC) demonstrou o melhor desempenho geral para o escore geral em adultos, alcançando uma AUC=0,68 (IC95%[0,64–0,72]) no conjunto de teste e 0,66 (IC95%[0,62–0,69]) no conjunto de validação. Para o escore essencial em adultos, o RFC também superou outros modelos, com AUC=0,68 (IC95%[0,63–0,72]) no conjunto de teste e 0,65 (IC95%[0,62–0,69]) no conjunto de validação. Em crianças, o Extreme Gradient Boosting apresentou o melhor desempenho geral para o escore geral, com AUC=0,65 (IC95%[0,60–0,69]) no conjunto de teste e 0,63 (IC95%[0,59–0,66]) no conjunto de validação. A análise de valores Shapley identificou a continuidade do cuidado com o mesmo médico como o preditor mais influente entre os modelos. Esses resultados destacam o potencial do aprendizado de máquina para prever escores do PCATool.
Chisini, LA, D’Avila, OP, Ribeiro, MC, Harzheim, E, Pinto, LF. Predictive Models for Primary Health Care: Assessing PCATool with Machine Learning in Rio de Janeiro, Brazil. Cien Saude Colet [periódico na internet] (2026/fev). [Citado em 14/08/2026].
Está disponível em: http://cienciaesaudecoletiva.com.br/artigos/predictive-models-for-primary-health-care-assessing-pcatool-with-machine-learning-in-rio-de-janeiro-brazil/19939?id=19939