PEDİATRİK SUPRAKONDİLER HUMERUS KIRIKLARINDA BÜYÜK DİL MODELLERİNİN TANI VE YÖNETİM KARARLARI: AAOS KILAVUZUNA DAYALI KARŞILAŞTIRMALI ÇALIŞMA

Abdullah Alper ŞAHİN, Murat ALPARSLAN

Bozok Tıp Dergisi - 2026;16(2):303-311

Ordu Üniversitesi Tıp Fakültesi, Ortopedi ve Travmatoloji Anabilim Dalı, Ordu, Türkiye

 

Amaç: Bu çalışma, büyük dil modellerinin (ChatGPT 5.2 Thinking, Gemini 3.1 Pro ve Claude Sonnet 4.6) pediatrik suprakondiler humerus (SCH) kırıklarının tespitinde, Gartland sistemine göre sınıflandırılmasında ve Amerikan Ortopedi Cerrahları Akademisi (AAOS) klinik uygulama kılavuzlarına dayalı tedavi önerileri sunmada tanısal performansını ve klinik güvenliğini değerlendirmek amacıyla yapılmıştır.Gereç ve Yöntem: Bu retrospektif gözlemsel çalışmada, dirsek travması (84 kırık ve 44 kırık olmayan) ile başvuran 128 pediatrik hastanın radyografileri ve klinik verileri analiz edildi. Referans standardı, AAOS kılavuzlarına göre ortopedi uzmanlarının konsensüs değerlendirmesi ile belirlendi. Anonimleştirilmiş AP ve lateral dirsek radyografileri, yaş, cinsiyet ve kısa klinik öykü ile birlikte her modele sağlandı. Tanı performansı duyarlılık, özgüllük ve genel doğruluk kullanılarak değerlendirildi. Gartland sınıflandırmasındaki uyum Cohen'in kappa (kappa) katsayısı kullanılarak değerlendirildi. Klinik güvenlik, cerrahi karar önerilerindeki yetersiz tedavi ve aşırı tedavi riskleri analiz edilerek incelendi. Bulgular: Gemini 3.1, kırık tespiti için en yüksek duyarlılığı (%96) gösterdi, ancak özgüllüğü düşüktü (41%). ChatGPT 5.2, hem duyarlılık hem de özgüllük açısından %64 ile daha dengeli bir profil sergilerken, Claude 4.6 en düşük genel tanı doğruluğunu (%55) gösterdi. Gartland sınıflandırmasında Gemini 3.1 en yüksek uyumu (kappa=0,60) elde ederken, Claude 4.6 en düşük uyumu (kappa=0,33) gösterdi. Tedavi önerileri açısından Gemini 3.1, cerrahi vakaların yetersiz tedavisini önledi, ancak önemli ölçüde aşırı tedaviye yol açarken, ChatGPT 5.2 cerrahi olarak endike olan vakaların %40'ını kaçırdı.Sonuç: LLM'ler radyografik yorumlamada destekleyici bilgiler sunsa da, mevcut performansları yanlış pozitif ve yanlış negatif kararların alınması riskini önemli ölçüde artırmaktadır. Bu bulgular, LLM'lerin pediatrik SCH kırıklarında bağımsız klinik karar verme için henüz yeterince güvenilir olmadığını ve uzman gözetiminin hala gerekli olduğunu göstermektedir.