Damla Serçe UNAT, Ömer Selim UNAT, Mutlu Onur GÜÇSAV, Berkay Can KARAKOÇ, Aysu AYRANCI, Ahmet Emin ERBAYCU
Anatolian Journal of General Medical Research - 2026;36(2):200-211
Amaç: Büyük dil modelleri (LLM), hastalar ve toplum tarafından tıbbi bilgiye ulaşmak amacıyla giderek daha sık kullanılmaktadır. Göğüs hastalıkları alanında bilgi gereksinimi kronik ve potansiyel olarak ciddi hastalıkları kapsadığından, yapay zeka tarafından oluşturulan tıbbi iletişim içeriğinin kalitesinin sistematik olarak değerlendirilmesi önem taşımaktadır. Yöntem: Bu kesitsel karşılaştırmalı çalışmada, temel solunum hastalıkları alanlarını kapsayan 37 standart göğüs hastalıkları sorusuna verilen yanıtlar değerlendirildi. Her soru dört LLM-Gemini 2.5, GPT-4, Claude Sonnet 4 ve DeepSeek v3.2-ile 25 yıldan fazla klinik deneyime sahip bir göğüs hastalıkları profesörü tarafından yanıtlandı. Üç göğüs hastalıkları uzmanı ve üç uzman olmayan değerlendiriciden oluşan altı kör değerlendirici, anonimleştirilmiş yanıtları beşli Likert ölçeği ile; doğruluk/algılanan güvenilirlik, açıklık ve bilimsel yeterlilik/pratik yararlılık alanlarında değerlendirdi. Değerlendiriciler arası güvenilirlik sınıf içi korelasyon katsayısı (ICC) ile analiz edildi. Karşılaştırmalı analizlerde tekrarlı ölçümler tek yönlü varyans analizi, Bonferroni düzeltmeli ikili karşılaştırmalar ve Friedman testi kullanıldı. Bulgular: Değerlendiriciler arası güvenilirlik, tekil ölçümlerde zayıf (ICC 0,09-0,12), ortalama ölçümlerde ise düşük-orta ile orta düzeyde (ICC 0,36-0,45) bulundu ve bu durum iletişim odaklı değerlendirmenin öznel yapısı ile uyumluydu. Genel olarak, büyük dil modeli yanıtları tüm değerlendirme alanlarında hekim yanıtlarına göre daha yüksek iletişim kalitesi puanları aldı. Gemini 2.5 ve GPT-4 özellikle doğruluk/algılanan güvenilirlik ve açıklık alanlarında en olumlu skorları elde etti. Büyük dil modelleri ile hekim yanıtları arasındaki farklar, uzman değerlendiricilere kıyasla uzman olmayan değerlendiricilerde daha belirgindi. Uzman değerlendiriciler arasında ise hekim tarafından oluşturulan yanıtlar doğruluk ve bilimsel yeterlilik açısından en yüksek puan alan yanıtlar arasında yer alırken, bu örüntü açıklık alanında gözlenmedi. Sonuç: Güncel büyük dil modelleri, hem uzman hem de uzman olmayan değerlendiriciler açısından açık, güvenilir ve pratik olarak yararlı göğüs hastalıkları bilgisi sunabilir. Bu bulgular, büyük dil modellerinin hasta eğitimi ve sağlık iletişiminde yardımcı araçlar olarak kullanılabileceğini desteklemektedir. Bununla birlikte, bu sistemler klinik yargının, mesleki sorumluluğun ve hekim gözetiminin yerini alamaz.