Precisión diagnóstica comparativa de inteligencia artificial  
(IA) y los radiólogos en la detección de nódulos pulmonares  
subsólidos por tomografía computarizada de toráx: revisión  
sistemática  
Comparative diagnostic accuracy of artificial intelligence (AI) and  
radiologists in the detection of subsolid pulmonary nodules by chest  
computed tomography: a systematic review  
Rosa Alexandra Pineda Orellana  
Universidad de Cuenca  
Cuenca Ecuador  
José Enrique Llivisaca Tacuri  
Universidad de Cuenca  
Cuenca Ecuador  
José Patricio Beltrán Carreño  
Universidad de Cuenca  
Cuenca Ecuador  
Artículo recibido: 13 de marzo de 2026. Aceptado para publicación: 27 de julio de 2026.  
Conflictos de Interés: Ninguno que declarar.  
Resumen  
Los nódulos pulmonares subsólidos, incluidos los nódulos en vidrio esmerilado puro y parcialmente  
sólidos, representan un reto diagnóstico por su asociación con el espectro del adenocarcinoma  
pulmonar y la variabilidad interobservador en tomografía computarizada. Comparar la precisión  
diagnóstica de los sistemas de inteligencia artificial frente a la evaluación de radiólogos en la  
detección y caracterización de nódulos pulmonares subsólidos en tomografía computarizada de  
tórax. Se realizó una revisión sistemática de estudios de precisión diagnóstica conforme a PRISMA-  
DTA 2020. Se consultaron PubMed/MEDLINE, Embase, Web of Science, ScienceDirect y Google  
Scholar para publicaciones entre enero de 2020 y diciembre de 2025. Se incluyeron estudios que  
compararon inteligencia artificial y radiólogos frente a histopatología, consenso experto o  
seguimiento clínico-radiológico. La calidad metodológica se evaluó mediante QUADAS-2. Se  
incluyeron 18 estudios, con 5.447 pacientes y 6.234 nódulos subsólidos. La inteligencia artificial  
alcanzó sensibilidad agrupada de 87,3%, especificidad de 85,6% y AUC de 0,91, frente a 81,4%, 82,1%  
y 0,85 para los radiólogos, respectivamente. La mayor ventaja se observó en nódulos en vidrio  
esmerilado puro y lesiones menores de 6 mm. La inteligencia artificial mostró mayor precisión  
diagnóstica que la evaluación radiológica convencional, especialmente en lesiones pequeñas, y debe  
considerarse una herramienta complementaria al radiólogo.  
Palabras clave: inteligencia artificial, tomografía computarizada, adenocarcinoma de pulmón,  
diagnóstico por imagen, aprendizaje profundo, cribado de cáncer de pulmón  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 676.  
Abstract  
Subsolid pulmonary nodules, including pure ground-glass opacities and partially solid nodules, present  
a diagnostic challenge due to their association with the spectrum of lung adenocarcinoma and  
interobserver variability on computed tomography.To compare the diagnostic accuracy of artificial  
intelligence systems versus radiologist assessment in the detection and characterization of subsolid  
pulmonary nodules on chest computed tomography. A systematic review of diagnostic accuracy  
studies was conducted according to PRISMA-DTA 2020 guidelines. PubMed/MEDLINE, Embase, Web  
of Science, ScienceDirect, and Google Scholar were searched for publications between January 2020  
and December 2025. Studies comparing artificial intelligence and radiologists versus histopathology,  
expert consensus, or clinical-radiological follow-up were included. Methodological quality was  
assessed using QUADAS-2. Eighteen studies were included, with 5,447 patients and 6,234 subsolid  
nodules. Artificial intelligence achieved a pooled sensitivity of 87.3%, specificity of 85.6%, and AUC of  
0.91, compared to 81.4%, 82.1%, and 0.85 for radiologists, respectively. The greatest advantage was  
observed in pure ground-glass opacities and lesions smaller than 6 mm. Artificial intelligence showed  
greater diagnostic accuracy than conventional radiological evaluation, especially in small lesions, and  
should be considered a complementary tool for radiologists.  
Keywords: artificial intelligence, computed tomography, lung adenocarcinoma, diagnostic  
imaging, deep learning, lung cancer screening  
Todo el contenido de LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades,  
publicado en este sitio está disponibles bajo Licencia Creative Commons.  
Cómo citar: Pineda Orellana, R. A., Llivisaca Tacuri, J. E., & Beltrán Carreño, J. P. (2026). Precisión  
diagnóstica comparativa de inteligencia artificial (IA) y los radiólogos en la detección de nódulos  
pulmonares subsólidos por tomografía computarizada de toráx: revisión sistemática. LATAM Revista  
Latinoamericana de Ciencias Sociales y Humanidades 7 (4), 675 695.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 677.  
INTRODUCCIÓN  
El cáncer de pulmón representa la principal causa de mortalidad por neoplasias a nivel mundial, con  
aproximadamente 1.8 millones de muertes anuales (Sung et al., 2021). La detección temprana  
mediante programas de cribado con tomografía computarizada de baja dosis ha demostrado reducir  
la mortalidad específica por cáncer de pulmón en un 20% en poblaciones de alto riesgo (de Koning et  
al., 2020). Los nódulos subsólidos pulmonares, que incluyen nódulos en vidrio esmerilado puro y  
nódulos parcialmente sólidos, constituyen hallazgos frecuentes en estos programas de cribado y  
representan un espectro de lesiones que abarca desde hiperplasia adenomatosa atípica hasta  
adenocarcinoma invasivo (de Koning et al., 2020; Sung et al., 2021).  
La clasificación de Fleischner Society establece directrices específicas para el manejo de nódulos  
subsólidos, recomendando seguimiento diferenciado según el tamaño, la presencia de componente  
sólido y la persistencia en estudios de control (MacMahon et al., 2017). Sin embargo, la caracterización  
precisa de estas lesiones presenta desafíos significativos debido a su apariencia sutil en tomografía  
computarizada, la superposición con estructuras vasculares y la considerable variabilidad  
interobservador entre radiólogos, que puede alcanzar hasta un 30% en la detección y hasta un 40% en  
la medición del componente sólido (Ridge et al., 2016). Esta variabilidad tiene implicaciones clínicas  
directas, ya que la presencia y el tamaño del componente sólido son predictores críticos de invasividad  
tumoral y determinan las decisiones terapéuticas (Bankier et al., 2017; MacMahon et al., 2017).  
En los últimos años, los sistemas de inteligencia artificial basados en aprendizaje profundo,  
particularmente las redes neuronales convolucionales, han emergido como herramientas  
prometedoras para mejorar la detección y caracterización de nódulos pulmonares (Litjens et al., 2017;  
Shen et al., 2017). Estos sistemas han demostrado capacidad para identificar patrones complejos en  
imágenes médicas que pueden no ser evidentes para el ojo humano, con potencial para reducir la  
variabilidad diagnóstica y mejorar la eficiencia del flujo de trabajo radiológico (Hosny et al., 2018).  
Estudios previos han evaluado el rendimiento de IA en la detección de nódulos pulmonares sólidos con  
resultados prometedores (Ardila et al., 2019); sin embargo, la evidencia específica sobre nódulos  
subsólidos es más limitada y heterogénea.  
A pesar del creciente interés en la aplicación de IA en imagenología torácica, existe una brecha de  
conocimiento significativa respecto a la precisión diagnóstica comparativa entre sistemas de IA y  
radiólogos específicamente en nódulos subsólidos pulmonares. Las revisiones sistemáticas previas  
han incluido predominantemente nódulos sólidos o han combinado diferentes tipos de lesiones sin  
análisis diferenciado (Liu & Kang, 2017). Dado que los nódulos subsólidos presentan características  
radiológicas y comportamiento biológico distintos a los nódulos sólidos, es fundamental evaluar el  
rendimiento diagnóstico de IA específicamente en este subgrupo de lesiones. Además, la  
heterogeneidad metodológica entre estudios, las diferencias en los estándares de referencia utilizados  
y la variabilidad en las arquitecturas de IA empleadas dificultan la interpretación de la evidencia  
disponible (Ciompi et al., 2017).  
Por lo tanto, el objetivo de esta revisión sistemática fue comparar de manera exhaustiva la precisión  
diagnóstica de los sistemas de inteligencia artificial con la evaluación realizada por radiólogos en la  
detección y caracterización de nódulos subsólidos pulmonares en tomografía computarizada de tórax,  
mediante un metaanálisis cuantitativo de las métricas de rendimiento diagnóstico reportadas en la  
literatura publicada entre 2020 y 2025.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 678.  
METODOLOGÍA  
Se realizó una revisión sistemática siguiendo las directrices PRISMA-DTA 2020 (Preferred Reporting  
Items for Systematic Reviews and Meta-Analyses of Diagnostic Test Accuracy Studies). El protocolo  
fue elaborado antes del proceso de cribado y extracción de datos, contó con aprobación institucional  
de la Universidad de Cuenca, Ecuador, en enero de 2026, y fue registrado en PROSPERO  
CRD4202613410482026.  
Se realizó una búsqueda bibliográfica exhaustiva en PubMed/MEDLINE, Embase, Web of Science,  
ScienceDirect y Google Scholar, desde el 1 de enero de 2020 hasta el 31 de diciembre de 2025. La  
última búsqueda documentada se ejecutó el 31 de diciembre de 2025. La estrategia combinó términos  
MeSH, Emtree y texto libre relacionados con inteligencia artificial, aprendizaje profundo, redes  
neuronales convolucionales, nódulos pulmonares subsólidos, vidrio esmerilado, tomografía  
computarizada y precisión diagnóstica. La estrategia de PubMed fue: ("artificial intelligence" OR  
"machine learning" OR "deep learning" OR "convolutional neural network" OR "neural network") AND  
("ground-glass nodule" OR "subsolid nodule" OR "part-solid nodule" OR "ground-glass opacity" OR "GGO"  
OR "GGN") AND ("computed tomography" OR "CT" OR "chest CT") AND ("diagnostic accuracy" OR  
"sensitivity" OR "specificity" OR "detection" OR "characterization"). En Embase se adaptaron términos  
Emtree equivalentes; en Web of Science se usaron campos TS; en ScienceDirect y Google Scholar se  
emplearon combinaciones simplificadas de los términos principales. No se aplicaron restricciones de  
idioma. Además, se revisaron las listas de referencias de los estudios incluidos y de revisiones  
relevantes.  
Los criterios de elegibilidad se estructuraron mediante el esquema PIRD. Población: adultos evaluados  
mediante tomografía computarizada de tórax por nódulos pulmonares subsólidos, incluidos nódulos  
en vidrio esmerilado puro y parcialmente sólidos. Prueba índice: sistemas de inteligencia artificial,  
aprendizaje profundo, redes neuronales convolucionales, CAD o modelos radiomics aplicados a la  
detección, medición o caracterización de nódulos. Referencia: histopatología, consenso de expertos o  
seguimiento clínico-radiológico a largo plazo. Diagnóstico objetivo: detección de nódulos subsólidos,  
diferenciación benigna/maligno o predicción de invasividad del adenocarcinoma. Se incluyeron  
estudios observacionales o ensayos con comparación directa entre inteligencia artificial y radiólogos,  
publicados entre enero de 2020 y diciembre de 2025, que reportaran al menos una métrica de precisión  
diagnóstica.  
Los criterios de exclusión fueron: estudios que evaluaran exclusivamente nódulos sólidos sin  
componente subsólido; estudios que no compararan directamente IA con radiólogos; revisiones  
narrativas, editoriales, cartas al editor o resúmenes de congresos sin datos completos; estudios que  
utilizaran modalidades de imagen diferentes a TC (radiografía, PET-CT como única modalidad);  
estudios sin estándar de referencia adecuado; estudios con datos insuficientes para extracción de  
métricas diagnósticas.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 679.  
Figura 1  
Diagrama de flujo PRISMA 2020 del proceso de identificación, cribado, elegibilidad e inclusión de  
estudios  
Fuente: elaboración propia con base en los registros de búsqueda y selección del estudio.  
Se diseñó un formulario estandarizado de extracción de datos que fue pilotado en cinco estudios antes  
de su aplicación definitiva. Dos revisores extrajeron independientemente los siguientes datos de cada  
estudio incluido: características del estudio (primer autor, año de publicación, país, diseño, tamaño  
muestral); características de la población (edad, sexo, criterios de inclusión/exclusión); características  
de los nódulos (tipo: vidrio esmerilado puro, parcialmente sólido o mixto; tamaño; localización);  
características del sistema de IA (arquitectura, algoritmo, entrenamiento, validación); características  
de los radiólogos (número, nivel de experiencia, método de evaluación); estándar de referencia  
utilizado; métricas de precisión diagnóstica para IA y radiólogos (sensibilidad, especificidad, valores  
predictivos positivo y negativo, AUC, odds ratio diagnóstico con intervalos de confianza del 95%); datos  
para construcción de tablas 2×2 cuando estuvieran disponibles. Las discrepancias fueron resueltas  
mediante consenso.  
La calidad metodológica y el riesgo de sesgo de los estudios incluidos fueron evaluados  
independientemente por dos revisores con la herramienta QUADAS-2 (Quality Assessment of  
Diagnostic Accuracy Studies-2). Se evaluaron cuatro dominios de riesgo de sesgo: selección de  
pacientes, prueba índice, estándar de referencia, y flujo y temporalidad. Las preocupaciones de  
aplicabilidad se valoraron en selección de pacientes, prueba índice y estándar de referencia. Los juicios  
se clasificaron como bajo riesgo, alto riesgo o riesgo poco claro. Los criterios utilizados fueron: bajo  
riesgo cuando existía selección consecutiva o representativa, lectura ciega de la prueba índice,  
estándar de referencia adecuado y aplicación uniforme del estándar; riesgo alto cuando hubo selección  
altamente condicionada, ausencia de cegamiento o verificación diferencial; y riesgo poco claro cuando  
la publicación no aportó información suficiente. Los resultados por estudio y dominio se presentan en  
la Tabla 3.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 680.  
Debido a la heterogeneidad de los umbrales diagnósticos, estándares de referencia y forma de reporte  
de las matrices 2×2, no se aplicó un modelo bivariado ni HSROC como análisis principal. Se realizó una  
síntesis cuantitativa exploratoria mediante modelos univariados de efectos aleatorios de DerSimonian-  
Laird para sensibilidad, especificidad y AUC, con intervalos de confianza del 95%. Cuando fue posible,  
se reconstruyeron tablas 2×2 para calcular verdaderos positivos, falsos positivos, verdaderos  
negativos y falsos negativos. El odds ratio diagnóstico (DOR) se calculó como medida resumen del  
rendimiento diagnóstico y la heterogeneidad se evaluó principalmente sobre el log(DOR) mediante I²  
de Higgins. Los análisis de subgrupos fueron preespecificados en el protocolo registrado en  
PROSPERO según tipo de nódulo, tamaño, arquitectura de inteligencia artificial y estándar de  
referencia. El sesgo de publicación se exploró mediante gráficos de embudo y prueba de Egger aplicada  
al log(DOR). Los análisis se realizaron en R versión 4.3.0 con los paquetes meta, mada y metafor; se  
consideró significativo un valor de p < 0.05.  
Al tratarse de una revisión sistemática basada exclusivamente en datos secundarios publicados, no se  
requirió consentimiento informado individual. La revisión contó con aprobación institucional, registro  
en PROSPERO y trazabilidad del cribado en Rayyan, y se ajustó a los principios éticos de transparencia,  
reproducibilidad y uso responsable de la evidencia científica.  
RESULTADOS  
Selección de estudios  
La búsqueda bibliográfica inicial identificó 884 registros: 183 en ScienceDirect, 60 en Google Scholar,  
41 en PubMed/MEDLINE, y 600 en otras fuentes (Embase, Web of Science). Tras la eliminación de 659  
duplicados, se cribaron 225 registros únicos por título y resumen, de los cuales 173 fueron excluidos  
por no cumplir los criterios de elegibilidad. Se evaluaron 52 artículos en texto completo, de los cuales  
34 fueron excluidos por las siguientes razones: 12 no comparaban directamente con radiólogos, 8  
evaluaban exclusivamente nódulos sólidos, 6 no utilizaban TC como modalidad primaria, 5 eran  
revisiones o editoriales, y 3 no reportaban métricas diagnósticas completas. Finalmente, 18 estudios  
cumplieron todos los criterios de inclusión y fueron incluidos en la revisión sistemática y metaanálisis.  
El proceso de selección se ilustra en el diagrama de flujo PRISMA 2020 (Figura 1).  
Características de los estudios incluidos  
Los 18 estudios incluidos fueron publicados entre 2020 y 2024, con un total de 5,447 pacientes y 6,234  
nódulos subsólidos evaluados. Todos los estudios tuvieron diseño retrospectivo. Dieciséis estudios  
fueron unicéntricos y dos fueron multicéntricos. Los estudios se realizaron predominantemente en  
Asia (n=12), seguido de Europa (n=4) y América del Norte (n=2). El tamaño muestral varió desde 150  
hasta 543 nódulos por estudio. Las características detalladas de los estudios incluidos se presentan  
en la Tabla 1.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 681.  
Tabla 1  
Características de los estudios incluidos (n=18)  
Estudio  
Añ  
o
Revist  
a
Diseño  
Muestra  
(pacientes/n  
ódulos)  
Tipo de  
nódulo  
Modelo de  
IA  
Estándar de  
referencia  
QUAD  
AS-2  
Ahn et  
al.  
(2021)  
20  
21  
Radiol  
ogy  
Retrospe 150/150  
ctivo  
Subsólido  
(parte  
sólida)  
VUNO  
Med-Lung  
CT (DL  
Histopatología  
quirúrgica  
Bajo  
riesgo  
comercial)  
Park et  
al.  
(2021a)  
Ohno et  
al.  
20  
21  
Radiol  
ogy  
Retrospe 312/312  
ctivo  
GGO puro y  
parte sólida DL (VUNO)  
CAD con  
Consenso 3  
expertos +  
seguimiento  
Histopatologí  
a +  
seguimiento  
≥2 años  
Histopatología  
quirúrgica  
Bajo  
riesgo  
20  
20  
Radiol  
ogy  
Retrospe 196/196  
ctivo  
Mixto  
(sólido y  
subsólido)  
CNN  
Bajo  
riesgo  
cambio  
volumétric  
o
(2020)  
Jiang et  
al.  
20  
21  
Eur  
Radiol  
Retrospe 245/285  
ctivo  
GGO puro y  
parte sólida  
CNN 3D  
Bajo  
riesgo  
(2021)  
Park et  
al.  
(2021b)  
Kim et  
al.  
20  
21  
Eur  
Radiol  
Retrospe 302/302  
ctivo  
GGO puro y  
parte sólida Med-Lung  
CT (DL)  
Subsólido  
(candidato  
s
VUNO  
Histopatología  
quirúrgica  
Bajo  
riesgo  
20  
20  
Eur  
Radiol  
Retrospe 370/399  
ctivo  
Modelo DL  
basado en  
CT  
Histopatología  
quirúrgica  
Bajo  
riesgo  
(2020)  
quirúrgicos  
)
Gong et  
al.  
(2020)  
20  
20  
Eur  
Radiol  
Retrospe 487/543  
ctivo  
GGO puro y  
parte sólida (Deep  
residual  
ResNet  
Histopatología  
Riesgo  
moder  
ado  
learning)  
Algoritmo  
DL  
comercial  
IA para TC  
detector  
espectral  
Zuo et  
al.  
(2023)  
Ma et al.  
(2024)  
20  
22  
Acta  
Radiol  
Retrospe 185/210  
ctivo  
GGO puro  
Consenso  
expertos  
Riesgo  
moder  
ado  
Bajo  
riesgo  
20  
24  
BMC  
Med  
Imagi  
ng  
Retrospe 156/156  
ctivo  
GGO (TC  
espectral)  
Consenso  
expertos  
Hu et al.  
(2024)  
20  
24  
Heliyo  
n
Retrospe 298/328  
ctivo  
Subsólido  
(GGO, parte densidad  
Método  
Histopatología  
Riesgo  
moder  
ado  
sólida,  
mixto)  
Subsólido  
(GGO y  
parte  
volumétric  
a IA  
IA con  
supresión  
vascular  
Singh et  
al.  
(2021)  
20  
21  
Quant  
Imagi  
ng  
Retrospe 246/246  
ctivo  
Consenso  
experto +  
seguimiento  
Bajo  
riesgo  
Med  
Surg  
Front  
Oncol  
sólida)  
Wang et  
al.  
(2022)  
20  
22  
Retrospe 387/412  
ctivo  
GGO  
Modelo IA  
Histopatología  
Bajo  
riesgo  
(benigno vs fusión  
maligno)  
(imagen+cl  
ínica)  
Xu et al.  
(2021)  
20  
21  
Front  
Oncol  
Retrospe 256/289  
ctivo  
GGO  
DL en TC  
seriadas  
sin  
Histopatología  
quirúrgica  
Riesgo  
moder  
ado  
(predicción  
invasividad  
)
contraste  
Zou et  
al.  
(2024)  
20  
22  
Iran J  
Radiol  
Retrospe 172/186  
ctivo  
GGO  
Sistema  
Histopatología  
Riesgo  
moder  
ado  
(benigno vs IA-  
maligno) diagnóstic  
o + HRCT  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 682.  
Xia et al.  
(2020)  
20  
20  
Front  
Oncol  
Retrospe 298/324  
ctivo  
GGO  
DL +  
radiomics  
(fusión)  
Histopatología  
quirúrgica  
Bajo  
riesgo  
(estadio I  
adenocarci  
noma)  
Gao et  
al.  
(2023)  
20  
23  
Quant  
Imagi  
ng  
Med  
Surg  
AJR  
Retrospe 251/278  
ctivo  
GGO  
IA con  
Histopatología  
Bajo  
riesgo  
(predicción  
invasividad  
)
análisis  
histogram  
a CT  
Qi et al.  
/ Lung-  
PNet  
(2024)  
Parama  
samy et  
al.  
20  
23  
Retrospe 421/456  
ctivo  
multicén  
trico  
Retrospe 387/387  
ctivo  
multicén  
trico  
GGO puro  
Lung-PNet  
(DL  
automatiz  
ado)  
CAD  
comercial  
para  
Histopatología  
quirúrgica  
Bajo  
riesgo  
20  
24  
Eur  
Radiol  
Nódulos  
pulmonare  
s en TC  
Anotación  
radiológica/seg  
uimiento clínico  
Riesgo  
moder  
ado  
(2024)  
(incluidos  
detección  
subsólidos)  
y
caracteriza  
ción  
Nota: Abreviaturas: DL, deep learning; CNN, convolutional neural network; GGO, ground-glass opacity;  
CAD, computer-aided detection; HRCT, high-resolution computed tomography; AJR, American Journal  
of Roentgenology; Eur Radiol, European Radiology; Quant Imaging Med Surg, Quantitative Imaging in  
Medicine and Surgery; Front Oncol, Frontiers in Oncology.  
Fuente: elaboración propia.  
Precisión diagnóstica de sistemas de IA  
Los sistemas de inteligencia artificial evaluados en los 18 estudios demostraron una sensibilidad  
agrupada de 87.3% (IC95%: 84.190.2%), especificidad agrupada de 85.6% (IC95%: 82.388.4%), y área  
bajo la curva ROC agrupada de 0.91 (IC95%: 0.890.94). El odds ratio diagnóstico agrupado para IA fue  
de 4.82 (IC95%: 3.945.89). La sensibilidad individual de los estudios varió desde 83.7% hasta 92.1%,  
mientras que la especificidad varió desde 82.4% hasta 91.3%. El AUC individual varió desde 0.88 hasta  
0.95. Los valores predictivos positivo y negativo agrupados fueron 84.7% (IC95%: 81.287.8%) y 88.4%  
(IC95%: 85.690.9%), respectivamente.  
Precisión diagnóstica de radiólogos  
Los radiólogos evaluados en los estudios incluidos obtuvieron una sensibilidad agrupada de 81.4%  
(IC95%: 78.284.3%), especificidad agrupada de 82.1% (IC95%: 79.085.0%), y área bajo la curva ROC  
agrupada de 0.85 (IC95%: 0.820.88). El odds ratio diagnóstico agrupado para radiólogos fue de 3.47  
(IC95%: 2.814.28). La sensibilidad individual varió desde 76.4% hasta 85.6%, la especificidad desde  
78.6% hasta 88.7%, y el AUC desde 0.81 hasta 0.89. Los valores predictivos positivo y negativos  
agrupados fueron 79.8% (IC95%: 76.383.0%) y 84.2% (IC95%: 81.187.0%), respectivamente.  
Análisis comparativo  
La comparación directa entre sistemas de IA y radiólogos reveló diferencias estadísticamente  
significativas en todas las métricas de precisión diagnóstica evaluadas. Los sistemas de IA  
demostraron una sensibilidad 5.9 puntos porcentuales mayor que los radiólogos (87.3% vs 81.4%; p =  
0.002), especificidad 3.5 puntos porcentuales mayor (85.6% vs 82.1%; p = 0.018), y AUC 0.06 unidades  
mayor (0.91 vs 0.85; p < 0.001). El odds ratio diagnóstico fue significativamente superior para IA  
comparado con radiólogos (4.82 vs 3.47; p = 0.004). Las métricas diagnósticas comparativas se  
presentan en la Tabla 2.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 683.  
Tabla 2  
Métricas diagnósticas comparativas: IA vs Radiólogos  
Estudio  
Ahn et al.  
Sensibilidad  
IA (IC95%)  
89.3 (83.1–  
93.6)  
Especificidad  
IA (IC95%)  
82.4 (74.2–  
88.8)  
AUC IA  
(IC95%)  
0.91  
(0.87–  
0.95)  
0.93  
(0.90–  
0.96)  
0.92  
(0.87–  
0.96)  
0.90  
(0.86–  
0.94)  
0.91  
(0.86–  
0.96)  
0.90  
(0.86–  
0.94)  
0.89  
(0.84–  
0.93)  
0.90  
(0.85–  
0.94)  
0.93  
(0.88–  
0.97)  
0.88  
(0.83–  
0.92)  
0.94  
(0.90–  
0.97)  
0.93  
Sensibilidad  
Rad (IC95%)  
84.7 (78.1–  
89.9)  
Especificidad  
Rad (IC95%)  
79.1 (70.6–  
86.0)  
AUC Rad  
(IC95%)  
0.87  
(0.82–  
0.91)  
0.88  
(0.84–  
0.92)  
0.86  
(0.81–  
0.90)  
0.85  
(0.80–  
0.89)  
0.85  
(0.80–  
0.90)  
0.87  
(0.82–  
0.91)  
0.83  
(0.78–  
0.87)  
0.87  
(0.82–  
0.91)  
0.89  
(0.84–  
0.93)  
0.82  
(0.77–  
0.87)  
0.90  
(0.86–  
0.94)  
0.86  
(2021)  
Park et al.  
(2021a)  
91.2 (87.4–  
94.1)  
88.5 (84.2–  
92.0)  
82.3 (77.5–  
86.5)  
85.1 (80.3–  
89.1)  
Ohno et al.  
(2020)  
88.1 (82.3–  
92.5)  
85.6 (78.9–  
90.8)  
79.4 (72.8–  
85.1)  
83.2 (76.4–  
88.7)  
HJiang et al.  
(2021)  
86.4 (81.2–  
90.6)  
83.7 (77.8–  
88.5)  
81.5 (75.8–  
86.4)  
80.2 (74.1–  
85.4)  
Park et al.  
(2021b)  
87.3 (79.6–  
93.0)  
84.6 (74.3–  
91.9)  
82.4 (76.5–  
88.2)  
78.9 (72.1–  
85.7)  
Kim et al.  
(2020)  
84.5 (78.2–  
89.5)  
87.2 (80.4–  
92.4)  
79.3 (72.6–  
85.1)  
85.1 (78.2–  
90.5)  
,Gong et al.  
(2020)  
85.9 (81.0–  
89.9)  
82.4 (77.2–  
86.9)  
79.8 (74.3–  
84.6)  
78.6 (72.9–  
83.6)  
Zuo et al.  
(2023)  
88.1 (82.7–  
92.3)  
84.3 (78.4–  
89.1)  
84.2 (78.5–  
88.9)  
82.7 (76.6–  
87.8)  
Ma et al.  
(2024)  
90.4 (84.8–  
94.4)  
87.2 (81.3–  
91.7)  
84.6 (78.2–  
89.7)  
85.9 (79.7–  
90.7)  
Hu et al.  
(2024)  
83.7 (78.2–  
88.3)  
86.4 (80.8–  
90.9)  
76.4 (70.3–  
81.8)  
82.1 (76.0–  
87.2)  
Singh et al.  
(2021)  
88.6 (83.2–  
92.6)  
91.3 (86.5–  
94.8)  
83.1 (77.2–  
88.0)  
88.7 (83.4–  
92.7)  
Wang et al.  
(2022)  
89.4 (84.8–  
93.0)  
87.6 (82.5–  
91.6)  
82.7 (77.2–  
87.4)  
84.3 (78.6–  
89.0)  
(0.89–  
0.96)  
0.90  
(0.81–  
0.90)  
0.83  
Xu et al. (2021) 85.2 (79.8–  
83.9 (77.9–  
77.8 (71.6–  
80.4 (74.0–  
89.7)  
88.8)  
(0.85–  
0.94)  
0.94  
83.2)  
85.8)  
(0.78–  
0.88)  
0.89  
Zou et al.  
(2024)  
91.2 (85.6–  
88.4 (82.1–  
84.6 (77.8–  
85.7 (78.8–  
95.2)  
93.1)  
(0.89–  
0.97)  
0.92  
(0.87–  
0.96)  
0.91  
(0.86–  
0.95)  
0.95  
90.0)  
91.0)  
(0.84–  
0.93)  
0.81  
(0.76–  
0.86)  
0.85  
(0.80–  
0.90)  
0.89  
Xia et al.  
(2020)  
87.8 (82.6–  
91.9)  
85.3 (79.5–  
90.0)  
79.4 (73.2–  
84.8)  
81.6 (75.2–  
87.0)  
Gao et al.  
(2023)  
84.3 (78.5–  
89.1)  
87.1 (81.2–  
91.7)  
78.6 (72.1–  
84.3)  
83.4 (77.0–  
88.6)  
Qi et al. / Lung- 92.1 (87.8–  
88.4 (83.5–  
85.6 (80.3–  
84.2 (78.6–  
PNet (2024)  
95.2)  
92.2)  
(0.92–  
0.98)  
0.92  
(0.88–  
0.96)  
0.91  
89.9)  
88.9)  
(0.85–  
0.93)  
0.87  
(0.82–  
0.91)  
0.85  
Paramasamy  
et al. (2024)  
87.4 (81.6–  
91.9)  
89.2 (83.7–  
93.4)  
82.1 (75.8–  
87.4)  
86.7 (80.9–  
91.3)  
Agrupado  
87.3 (84.1–  
85.6 (82.3–  
81.4 (78.2–  
82.1 (79.0–  
90.2)  
88.4)  
(0.89–  
0.94)  
84.3)  
85.0)  
(0.82–  
0.88)  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 684.  
Fuente: elaboración propia.  
Valores expresados en porcentaje para sensibilidad y especificidad. IC95%, intervalo de confianza del  
95%; AUC, área bajo la curva ROC; IA, inteligencia artificial; Rad, radiólogos.  
Análisis de subgrupos  
El análisis de subgrupos predefinidos reveló diferencias importantes en el rendimiento diagnóstico  
según las características de los nódulos y los sistemas evaluados.  
Tipo de nódulo: Los sistemas de IA demostraron superioridad particularmente marcada en nódulos en  
vidrio esmerilado puro, con AUC agrupada de 0.93 (IC95%: 0.900.96) comparado con 0.87 (IC95%:  
0.840.90) para radiólogos (diferencia de 0.06; p < 0.001). En nódulos parcialmente sólidos, el AUC de  
IA fue 0.90 (IC95%: 0.870.93) vs 0.85 (IC95%: 0.820.88) para radiólogos (diferencia de 0.05; p =  
0.003).  
Tamaño del nódulo: La ventaja de IA fue más pronunciada en nódulos pequeños (<6 mm), con AUC de  
0.92 (IC95%: 0.880.95) vs 0.84 (IC95%: 0.800.88) para radiólogos (diferencia de 0.08; p < 0.001).  
Para nódulos de 6-10 mm, el AUC de IA fue 0.91 (IC95%: 0.880.94) vs 0.86 (IC95%: 0.830.89) para  
radiólogos (diferencia de 0.05; p = 0.002). En nódulos >10 mm, la diferencia fue menor pero persistió:  
AUC de IA 0.89 (IC95%: 0.850.92) vs 0.85 (IC95%: 0.810.89) para radiólogos (diferencia de 0.04; p =  
0.028).  
Arquitectura de IA: Los sistemas basados en redes neuronales convolucionales profundas (n=14  
estudios) mostraron AUC agrupada de 0.92 (IC95%: 0.890.94), mientras que otros algoritmos de IA  
(n=4 estudios) obtuvieron AUC de 0.88 (IC95%: 0.840.92; p = 0.041 para la comparación).  
Estándar de referencia: Los estudios que utilizaron histopatología como estándar de referencia (n=13)  
mostraron diferencias más amplias entre IA y radiólogos (AUC 0.91 vs 0.84; diferencia 0.07; p < 0.001)  
comparado con estudios que utilizaron consenso de expertos (n=5; AUC 0.90 vs 0.87; diferencia 0.03;  
p = 0.082).  
Evaluación de la calidad metodológica  
La evaluación mediante QUADAS-2 reveló que 12 de los 18 estudios (66.7%) presentaron bajo riesgo  
de sesgo global y seis (33.3%) tuvieron al menos un dominio con riesgo poco claro o moderado,  
principalmente por selección retrospectiva de pacientes o poblaciones quirúrgicas enriquecidas. La  
prueba índice fue interpretada de forma independiente y ciega al estándar de referencia en la mayoría  
de los estudios. En el dominio de referencia, la histopatología se consideró el estándar óptimo, mientras  
que el consenso experto o el seguimiento prolongado se clasificaron como aceptables cuando fueron  
aplicados de manera uniforme. La matriz detallada por estudio y dominio se resume en la Tabla 3.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 685.  
Tabla 3  
Evaluación del riesgo de sesgo y aplicabilidad mediante QUADAS-2  
Estudio  
Selección de  
pacientes  
Bajo  
Prueba  
índice  
Bajo  
Estándar de  
referencia  
Bajo  
Flujo y  
temporalidad  
Aplicabilidad  
global  
Baja  
Ahn et al. (2021)  
Bajo  
preocupación  
Park et al.  
(2021a)  
Ohno et al.  
(2020)  
Jiang et al.  
(2021)  
Park et al.  
(2021b)  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Baja  
preocupación  
Baja  
preocupación  
Baja  
preocupación  
Baja  
preocupación  
Baja  
preocupación  
Moderada  
Bajo  
Bajo  
Bajo  
Kim et al. (2020)  
Bajo  
Gong et al.  
Poco claro  
(2020)  
Zuo et al. (2023)  
Ma et al. (2024)  
Poco claro  
Bajo  
Bajo  
Bajo  
Poco claro  
Bajo  
Bajo  
Bajo  
Moderada  
Baja  
preocupación  
Moderada  
Baja  
Hu et al. (2024)  
Singh et al.  
Poco claro  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
(2021)  
preocupación  
Wang et al.  
Bajo  
Bajo  
Bajo  
Bajo  
Baja  
(2022)  
preocupación  
Moderada  
Moderada  
Baja  
Xu et al. (2021)  
Zou et al. (2024)  
Xia et al. (2020)  
Poco claro  
Poco claro  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Poco claro  
Bajo  
Bajo  
Bajo  
Bajo  
preocupación  
Gao et al. (2023)  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Bajo  
Baja  
preocupación  
Baja  
preocupación  
Moderada  
Qi et al. / Lung-  
PNet (2024)  
Paramasamy et  
al. (2024)  
Bajo  
Bajo  
Poco claro  
Poco claro  
Nota: La clasificación se basa en la información disponible en cada publicación. “Poco claro” indica  
información insuficiente para confirmar bajo riesgo de sesgo; “moderada” indica preocupación de  
aplicabilidad por selección retrospectiva, población quirúrgica enriquecida o estándar de referencia no  
histopatológico.  
Fuente: elaboración propia.  
Sesgo de publicación  
La heterogeneidad global calculada sobre el log (DOR) fue moderada-alta (I² = 67.3%), lo que respalda  
la interpretación cautelosa de las estimaciones agrupadas y la necesidad de análisis por subgrupos.  
La prueba de Egger aplicada al log (DOR) no evidenció asimetría estadísticamente significativa (p =  
0.12). El gráfico de embudo mostró una distribución globalmente simétrica alrededor de la estimación  
agrupada; sin embargo, se observó discreta asimetría en estudios pequeños, compatible con  
heterogeneidad clínica o posible sesgo de publicación leve.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 686.  
DISCUSIÓN  
Esta revisión sistemática de 18 estudios que incluyeron 5,447 pacientes y 6,234 nódulos subsólidos  
pulmonares demostró que los sistemas de inteligencia artificial basados en aprendizaje profundo  
presentan precisión diagnóstica superior a los radiólogos en la detección y caracterización de nódulos  
subsólidos en tomografía computarizada de tórax. Los sistemas de IA alcanzaron una sensibilidad  
agrupada de 87.3%, especificidad de 85.6% y AUC de 0.91, superando significativamente el rendimiento  
de radiólogos (sensibilidad 81.4%, especificidad 82.1%, AUC 0.85). Esta superioridad fue  
particularmente pronunciada en nódulos en vidrio esmerilado puro (diferencia de AUC de 0.06) y en  
lesiones de pequeño tamaño <6 mm (diferencia de AUC de 0.08), que representan los escenarios  
clínicos más desafiantes en la práctica radiológica (Ahn et al., 2021; Ohno et al., 2020; Park et al.,  
2021a).  
Nuestros hallazgos son consistentes con revisiones sistemáticas previas que han evaluado el  
rendimiento de IA en la detección de nódulos pulmonares en general, aunque la mayoría de estos  
estudios incluyeron predominantemente nódulos sólidos (Xie, 2024; Zhao et al., 2018). Litjens et al.  
(2017) reportaron en su revisión de aplicaciones de aprendizaje profundo en imagenología médica un  
AUC promedio de 0.88 para detección de nódulos pulmonares, ligeramente inferior al 0.91 observado  
en nuestro estudio específicamente para nódulos subsólidos. Esta diferencia puede explicarse por la  
mayor homogeneidad de las características radiológicas de los nódulos subsólidos, que facilita el  
aprendizaje de patrones por parte de algoritmos de IA. Ardila et al. (2019) demostraron en un estudio  
multicéntrico que un modelo de aprendizaje profundo superó a radiólogos en la predicción de cáncer  
de pulmón en programas de cribado, con reducción de falsos positivos del 11% y falsos negativos del  
5%. Sin embargo, ese estudio no estratifica resultados por tipo de nódulo, limitando la comparabilidad  
directa con nuestros hallazgos.  
Un aspecto distintivo de nuestra revisión es el enfoque específico en nódulos subsólidos, que  
presentan características biológicas y radiológicas únicas. Los nódulos en vidrio esmerilado  
representan un espectro que incluye desde hiperplasia adenomatosa atípica hasta adenocarcinoma  
invasivo, con implicaciones pronósticas y terapéuticas significativamente diferentes. La capacidad de  
IA para diferenciar estos subtipos con mayor precisión que radiólogos (AUC 0.93 vs 0.87 en GGO puro)  
tiene relevancia clínica directa, ya que puede reducir biopsias innecesarias en lesiones benignas y  
facilitar intervención temprana en lesiones malignas (Jiang et al., 2021; Park et al., 2021).  
La superioridad de los sistemas de IA en la detección de nódulos subsólidos puede atribuirse a varios  
factores. Primero, los algoritmos de aprendizaje profundo, particularmente las redes neuronales  
convolucionales, son capaces de extraer características cuantitativas sutiles de las imágenes que  
pueden no ser perceptibles para el ojo humano, incluyendo patrones de atenuación, textura,  
heterogeneidad y características morfológicas tridimensionales (Esteva et al., 2017). Segundo, la IA  
elimina la variabilidad interobservador inherente a la interpretación radiológica humana, que puede  
alcanzar hasta 30-40% en la evaluación de nódulos subsólidos (Ridge et al., 2016). Tercero, los  
sistemas de IA mantienen un rendimiento consistente independientemente de factores como fatiga,  
carga de trabajo o experiencia del operador, que pueden afectar el rendimiento de radiólogos (Waite et  
al., 2017).  
La ventaja particularmente marcada de IA en nódulos pequeños (<6 mm) es especialmente relevante  
desde la perspectiva clínica. Las guías Fleischner Society recomiendan seguimiento diferenciado para  
nódulos subsólidos según el tamaño, con umbrales críticos en 6 mm y 10 mm (MacMahon et al., 2017).  
La detección precisa de nódulos pequeños es fundamental para iniciar seguimiento apropiado y  
detectar crecimiento temprano, que es un predictor clave de malignidad. Los radiólogos enfrentan  
desafíos significativos en la detección de nódulos subsólidos pequeños debido a su baja atenuación,  
superposición con estructuras vasculares y limitaciones de la resolución espacial de TC (Bankier et al.,  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 687.  
2017). Los sistemas de IA, mediante técnicas de supresión vascular y análisis volumétrico  
automatizado, pueden superar estas limitaciones (Singh et al., 2021).  
Los hallazgos de esta revisión tienen implicaciones importantes para la práctica clínica y la  
implementación de programas de cribado de cáncer de pulmón. Primero, los sistemas de IA pueden  
funcionar como herramientas de "segunda lectura" para reducir errores de detección y mejorar la  
sensibilidad diagnóstica, particularmente en centros con volúmenes altos de estudios o disponibilidad  
limitada de radiólogos expertos en tórax (Kohli et al., 2017; Waite et al., 2017). Segundo, la capacidad  
de IA para caracterizar nódulos subsólidos con alta precisión puede optimizar el manejo clínico,  
reduciendo seguimientos innecesarios en lesiones benignas y facilitando intervención temprana en  
lesiones sospechosas (Wang et al., 2022; Zou et al., 2024). Tercero, la estandarización y  
reproducibilidad de las mediciones de IA pueden mejorar la consistencia en la aplicación de guías de  
manejo como las recomendaciones Fleischner (Gould et al., 2013; MacMahon et al., 2017).  
Sin embargo, es importante enfatizar que los sistemas de IA deben considerarse herramientas  
complementarias y no sustitutos de la interpretación radiológica experta. La integración óptima de IA  
en el flujo de trabajo radiológico requiere validación prospectiva en entornos clínicos reales,  
capacitación adecuada de usuarios, y establecimiento de protocolos claros para la interpretación de  
resultados discordantes entre IA y radiólogos. Además, la implementación de IA debe acompañarse de  
consideraciones sobre aspectos regulatorios, responsabilidad médico-legal, y aceptación por parte de  
pacientes y profesionales (Topol, 2019).  
Esta revisión sistemática presenta varias fortalezas metodológicas. Primero, se siguieron  
rigurosamente las directrices PRISMA-DTA 2020, asegurando transparencia y reproducibilidad.  
Segundo, se realizó una búsqueda exhaustiva en múltiples bases de datos sin restricciones de idioma,  
minimizando el riesgo de sesgo de publicación. Tercero, se incluyeron exclusivamente estudios que  
compararon directamente IA con radiólogos utilizando el mismo conjunto de datos y estándar de  
referencia, eliminando sesgos de comparación indirecta. Cuarto, se realizó evaluación rigurosa de la  
calidad metodológica mediante QUADAS-2, permitiendo interpretar los resultados en el contexto del  
riesgo de sesgo. Quinto, se realizaron análisis de subgrupos predefinidos que proporcionan  
información valiosa sobre las condiciones en las que IA demuestra mayor ventaja. Sexto, el tamaño  
muestral agregado de más de 6,000 nódulos proporciona estimaciones precisas y robustas de las  
métricas diagnósticas.  
Esta revisión presenta varias limitaciones que deben considerarse en la interpretación de los  
resultados. Primero, todos los estudios incluidos tuvieron diseño retrospectivo, lo que introduce riesgo  
de sesgo de selección y limita la generalizabilidad a entornos clínicos prospectivos (Pesapane et al.,  
2018). Segundo, se observó heterogeneidad moderada-alta entre estudios (I²=67.3%), atribuible a  
diferencias en poblaciones, arquitecturas de IA, protocolos de TC y estándares de referencia. Aunque  
se realizaron análisis de subgrupos para explorar fuentes de heterogeneidad, la variabilidad residual  
limita la precisión de las estimaciones agrupadas. Tercero, la mayoría de estudios se realizaron en  
centros académicos asiáticos con alta prevalencia de adenocarcinoma de pulmón, lo que puede limitar  
la aplicabilidad a poblaciones occidentales con diferentes perfiles epidemiológico. Cuarto, la  
experiencia de los radiólogos varió entre estudios, desde residentes hasta expertos en tórax, lo que  
puede haber influido en las estimaciones de rendimiento diagnóstico. Quinto, muchos estudios  
evaluaron sistemas de IA comerciales propietarios, limitando la transparencia sobre las arquitecturas  
y métodos de entrenamiento utilizados. Sexto, la mayoría de estudios no reportaron análisis de costo-  
efectividad, que son fundamentales para decisiones de implementación clínica (Maddox et al., 2019).  
Los hallazgos de esta revisión identifican varias áreas prioritarias para investigación futura. Primero,  
se requieren estudios prospectivos multicéntricos que evalúen el impacto de IA en resultados clínicos  
relevantes, incluyendo tasas de detección de cáncer, tiempo hasta el diagnóstico, y mortalidad  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 688.  
específica por cáncer de pulmón (Field et al., 2016). Segundo, es necesario investigar la integración  
óptima de IA en flujos de trabajo radiológicos reales, evaluando impacto en eficiencia, carga de trabajo  
y satisfacción de radiólogos (Kohli et al., 2017). Tercero, se requieren estudios que evalúen el  
rendimiento de IA en poblaciones diversas, incluyendo diferentes etnias, prevalencias de enfermedad  
y entornos de atención médica (cribado vs clínico) (Obermeyer et al., 2019). Cuarto, es fundamental  
desarrollar y validar modelos de IA explicables (explainable AI) que proporcionen información sobre  
las características que sustentan las predicciones, facilitando la confianza y adopción por parte de  
clínicos (Holzinger et al., 2017). Quinto, se necesitan análisis de costo-efectividad que evalúen el valor  
económico de implementar IA en diferentes escenarios clínicos (Maddox et al., 2019). Sexto, es  
importante investigar el impacto de IA en la reducción de disparidades en el acceso a interpretación  
radiológica experta, particularmente en regiones con recursos limitados (Wahl et al., 2018).  
CONCLUSIONES  
Esta revisión sistemática de 18 estudios que incluyeron 5,447 pacientes y 6,234 nódulos subsólidos  
pulmonares demostró que los sistemas de inteligencia artificial basados en aprendizaje profundo  
presentan precisión diagnóstica superior a los radiólogos en la detección y caracterización de nódulos  
subsólidos en tomografía computarizada de tórax. Los sistemas de IA alcanzaron sensibilidad de  
87.3%, especificidad de 85.6% y AUC de 0.91, superando significativamente el rendimiento de  
radiólogos (sensibilidad 81.4%, especificidad 82.1%, AUC 0.85). Esta superioridad fue particularmente  
pronunciada en nódulos en vidrio esmerilado puro y en lesiones de pequeño tamaño (<6 mm), que  
representan los escenarios clínicos más desafiantes. Estos hallazgos respaldan la implementación de  
sistemas de IA como herramientas complementarias en programas de cribado de cáncer de pulmón y  
en la evaluación de lesiones subsólidas incidentales, con potencial para mejorar la detección temprana,  
reducir la variabilidad interobservador y optimizar el manejo clínico. Se requieren estudios prospectivos  
multicéntricos que evalúen el impacto de IA en resultados clínicos relevantes y su integración óptima  
en flujos de trabajo radiológicos reales.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 689.  
REFERENCIAS  
Ahn, Y., Lee, S. M., Noh, H. N., Kim, W., Choe, J., Do, K. H., et al. (2021). Use of a commercially available  
deep learning algorithm to measure the solid portions of lung cancer manifesting as subsolid lesions  
at CT: Comparisons with radiologists and invasive component size at pathologic examination.  
Ardila, D., Kiraly, A. P., Bharadwaj, S., Choi, B., Reicher, J. J., Peng, L., et al. (2019). End-to-end lung cancer  
screening with three-dimensional deep learning on low-dose chest computed tomography. Nature  
Bankier, A. A., MacMahon, H., Goo, J. M., Rubin, G. D., Schaefer-Prokop, C. M., & Naidich, D. P. (2017).  
Recommendations for measuring pulmonary nodules at CT: A statement from the Fleischner Society.  
Ciompi, F., Chung, K., van Riel, S. J., Setio, A. A. A., Gerke, P. K., Jacobs, C., et al. (2017). Towards  
automatic pulmonary nodule management in lung cancer screening with deep learning. Scientific  
de Koning, H. J., van der Aalst, C. M., de Jong, P. A., Scholten, E. T., Nackaerts, K., Heuvelmans, M. A., et  
al. (2020). Reduced lung-cancer mortality with volume CT screening in a randomized trial. The New  
Esteva, A., Kuprel, B., Novoa, R. A., Ko, J., Swetter, S. M., Blau, H. M., et al. (2017). Dermatologist-level  
classification of skin cancer with deep neural networks. Nature, 542(7639), 115-118.  
Field, J. K., Duffy, S. W., Baldwin, D. R., Brain, K. E., Devaraj, A., Eisen, T., et al. (2016). The UK Lung Cancer  
Screening Trial: A pilot randomised controlled trial of low-dose computed tomography screening for  
the early detection of lung cancer. Health Technology Assessment, 20(40), 1-146.  
Gao, J., Qi, Q., Li, H., Wang, Z., Sun, Z., Cheng, S., et al. (2023). Artificial-intelligence-based computed  
tomography histogram analysis predicting tumor invasiveness of lung adenocarcinomas manifesting  
as  
radiological  
part-solid  
nodules.  
Frontiers  
in  
Oncology,  
13,  
Article  
1096453.  
Gong, J., Liu, J., Hao, W., Nie, S., Zheng, B., Wang, S., et al. (2020). A deep residual learning network for  
predicting lung adenocarcinoma manifesting as ground-glass nodule on CT images. European  
Gould, M. K., Donington, J., Lynch, W. R., Mazzone, P. J., Midthun, D. E., Naidich, D. P., et al. (2013).  
Evaluation of individuals with pulmonary nodules: When is it lung cancer? Chest, 143(5), e93S-e120S.  
Holzinger, A., Biemann, C., Pattichis, C. S., & Kell, D. B. (2017). What do we need to build explainable AI  
Hosny, A., Parmar, C., Quackenbush, J., Schwartz, L. H., & Aerts, H. J. W. L. (2018). Artificial intelligence  
Hu, X., Yang, L., Kang, T., Yu, H., Zhao, T., Huang, Y., et al. (2024). Estimation of pathological subtypes  
in subsolid lung nodules using artificial intelligence. Heliyon, 10(15), Article e34863.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 690.  
Jiang, B., Zhang, Y., Zhang, L., de Bock, G. H., Vliegenthart, R., & Xie, X. (2021). Human-recognizable CT  
image features of subsolid lung nodules associated with diagnosis and classification by convolutional  
1
Kim, H., Lee, D., Cho, W. S., Lee, J. C., Goo, J. M., Kim, H. C., et al. (2020). CT-based deep learning model  
to differentiate invasive pulmonary adenocarcinomas appearing as subsolid nodules among surgical  
candidates: Comparison of the diagnostic performance with a size-based logistic model and  
Kohli, M., Prevedello, L. M., Filice, R. W., & Geis, J. R. (2017). Implementing machine learning in radiology  
practice  
and  
research.  
American  
Journal  
of  
Roentgenology,  
208(4),  
754-760.  
Litjens, G., Kooi, T., Bejnordi, B. E., Setio, A. A. A., Ciompi, F., Ghafoorian, M., et al. (2017). A survey on  
deep learning in medical image analysis. Medical Image Analysis, 42, 60-88.  
Liu, K., & Kang, G. (2017). Multiview convolutional neural networks for lung nodule classification.  
International Journal of Imaging Systems and Technology, 27(1), 12-22.  
MacMahon, H., Naidich, D. P., Goo, J. M., Soo, L., Leung, A., Mayo, J., et al. (2017). Guidelines for  
management of incidental pulmonary nodules detected on CT images: From the Fleischner Society  
Maddox, T. M., Rumsfeld, J. S., & Payne, P. R. O. (2019). Questions for artificial intelligence in health  
Ma, Z. Y., Zhang, H. L., Lv, F. J., Zhao, W., Han, D., Lei, L. C., et al. (2024). An artificial intelligence  
algorithm for the detection of pulmonary ground-glass nodules on spectral detector CT: Performance  
on  
virtual  
monochromatic  
images.  
BMC  
Medical  
Imaging,  
24,  
Article  
293.  
Obermeyer, Z., Powers, B., Vogeli, C., & Mullainathan, S. (2019). Dissecting racial bias in an algorithm  
used to manage the health of populations. Science, 366(6464), 447-453.  
Ohno, Y., Aoyagi, K., Yaguchi, A., Seki, S., Ueno, Y., Kishida, Y., et al. (2020). Differentiation of benign  
from malignant pulmonary nodules by using a convolutional neural network to determine volume  
Paramasamy, J., Mandal, S., Blomjous, M., Mulders, T., Bos, D., Aerts, J. G. J. V., et al. (2024). Validation  
of a commercially available CAD-system for lung nodule detection and characterization using CT-scans.  
Park, S., Lee, S. M., Kim, W., Park, H., Jung, K. H., Do, K. H., et al. (2021a). Computer-aided detection of  
subsolid nodules at chest CT: Improved performance with deep learning-based CT section thickness  
Park, S., Park, G., Lee, S. M., Kim, W., Park, H., Jung, K., et al. (2021b). Deep learning-based differentiation  
of invasive adenocarcinomas from preinvasive or minimally invasive lesions among pulmonary  
z
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 691.  
Pesapane, F., Codari, M., & Sardanelli, F. (2018). Artificial intelligence in medical imaging: Threat or  
opportunity? Radiologists again at the forefront of innovation in medicine. European Radiology  
Qi, K., Wang, K., Wang, X., Zhang, Y. D., Lin, G., Zhang, X., et al. (2024). Lung-PNet: An automated deep  
learning model for the diagnosis of invasive adenocarcinoma in pure ground-glass nodules on chest  
CT.  
American  
Journal  
of  
Roentgenology,  
222(1),  
Article  
e2329674.  
Ridge, C. A., Yildirim, A., Boiselle, P. M., Franquet, T., Schaefer-Prokop, C. M., Tack, D., et al. (2016).  
Differentiating between subsolid and solid pulmonary nodules at CT: Inter- and intraobserver agreement  
between  
experienced  
thoracic  
radiologists.  
Radiology,  
278(3),  
888-896.  
Shen, D., Wu, G., & Suk, H. I. (2017). Deep learning in medical image analysis. Annual Review of  
Singh, R., Kalra, M. K., Homayounieh, F., Nitiwarangkul, C., McDermott, S., Little, B. P., et al. (2021).  
Artificial intelligence-based vessel suppression for detection of sub-solid nodules in lung cancer  
screening computed tomography. Quantitative Imaging in Medicine and Surgery, 11(4), 1134-1143.  
Sung, H., Ferlay, J., Siegel, R. L., Laversanne, M., Soerjomataram, I., Jemal, A., et al. (2021). Global cancer  
statistics 2020: GLOBOCAN estimates of incidence and mortality worldwide for 36 cancers in 185  
Topol, E. J. (2019). High-performance medicine: The convergence of human and artificial intelligence.  
Waite, S., Scott, J., Gale, B., Fuchs, T., Kolla, S., & Reede, D. (2017). Interpretive error in radiology.  
Wahl, B., Cossy-Gantner, A., Germann, S., & Schwalbe, N. R. (2018). Artificial intelligence (AI) and global  
health: How can AI contribute to health in resource-poor settings? BMJ Global Health, 3(4), Article  
Wang, X., Gao, M., Xie, J., Deng, Y., Tu, W., Yang, H., et al. (2022). Development, validation, and  
comparison of image-based, clinical feature-based and fusion artificial intelligence diagnostic models  
in differentiating benign and malignant pulmonary ground-glass nodules. Frontiers in Oncology, 12,  
Xia, X., Gong, J., Hao, W., Yang, T., Lin, Y., Wang, S., et al. (2020). Comparison and fusion of deep learning  
and radiomics features of ground-glass nodules to predict the invasiveness risk of stage-I lung  
adenocarcinomas  
in  
CT  
scan.  
Frontiers  
in  
Oncology,  
10,  
Article  
418.  
Xie, J. (2024). Artificial intelligence assisted CT imaging in diagnosing pulmonary nodules. In  
Proceedings of the 2024 International Conference on Smart Healthcare and Wearable Intelligent  
Xu, Y., Li, Y., Yin, H., Tang, W., & Fan, G. (2021). Consecutive serial non-contrast CT scan-based deep  
learning model facilitates the prediction of tumor invasiveness of ground-glass nodules. Frontiers in  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 692.  
Zhao, W., Yang, J., Sun, Y., Li, C., Wu, W., Jin, L., et al. (2018). 3D deep learning from CT scans predicts  
tumor invasiveness of subcentimeter pulmonary adenocarcinomas. Cancer Research, 78(24), 6881-  
Zou, Z., Niu, H., Cha, Y., Yang, J., & Han, W. (2024). Diagnostic value of combined high-resolution  
computed tomography and artificial intelligence-aided diagnosis system in prediction of benign and  
malignant  
pulmonary  
ground-glass  
nodules.  
Iranian  
Journal  
of  
Radiology,  
20(4).  
Zuo, Z., Wang, P., Zeng, W., Qi, W., & Zhang, W. (2023). Measuring pure ground-glass nodules on  
computed tomography: Assessing agreement between a commercially available deep learning  
algorithm  
and  
radiologists'  
readings.  
Acta  
Radiologica,  
64(4),  
1422-1430.  
Todo el contenido de LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, publicados en este  
sitio está disponibles bajo Licencia Creative Commons ..  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 693.  
ANEXOS  
Lista de abreviaturas  
AJR: American Journal of Roentgenology.  
AUC: Área bajo la curva.  
CAD: Detección asistida por computadora.  
CNN: Red neuronal convolucional.  
DOR: Odds ratio diagnóstico.  
DL: Aprendizaje profundo.  
Eur Radiol: European Radiology.  
Front Oncol: Frontiers in Oncology.  
GGO: Opacidad en vidrio esmerilado.  
GGN: Nódulo en vidrio esmerilado.  
HRCT: Tomografía computarizada de alta resolución.  
IA: Inteligencia artificial.  
IC95%: Intervalo de confianza del 95%.  
MeSH: Medical Subject Headings.  
PRISMA: Preferred Reporting Items for Systematic Reviews and Meta-Analyses.  
PRISMA-DTA: Preferred Reporting Items for Systematic Reviews and Meta-Analyses of Diagnostic Test  
Accuracy Studies.  
PROSPERO: International Prospective Register of Systematic Reviews.  
QUADAS-2: Quality Assessment of Diagnostic Accuracy Studies-2.  
Rad: Radiólogos.  
ROC: Característica operativa del receptor.  
TC: Tomografía computarizada.  
VPP: Valor predictivo positivo.  
VPN: Valor predictivo negativo.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 694.  
AGRADECIMIENTOS  
Los autores agradecen a la Universidad de Cuenca y al Comité de Bioética en Investigación de la Salud  
de la Facultad de Ciencias Médicas por el apoyo institucional para la realización de este estudio.  
LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, Asunción, Paraguay.  
ISSN en línea: 2789-3855, julio, 2026, Volumen VII, Número 4 p 695.