Engin Denizhan DEMİRKIRAN
Abant Tıp Dergisi - 2026;15(2):196-206
Amaç: Büyük dil modelleri (LLM'ler), tıbbi soruları yanıtlamak için giderek daha fazla kullanılmaktadır; ancak kılavuz temelli ürolojik kararlar konusunda güvenilirlikleri hâlâ belirsizdir. Bu çalışma, yaygın olarak kullanılan üç LLM'nin, üreter taşlarının aktif yönetimi konusunda Avrupa Üroloji Derneği (EAU) 2026 kılavuzundaki önerilerle ne kadar uyumlu olduğunu değerlendirmeyi amaçlamıştır. Gereç ve Yöntemler: Bu kesitsel, vaka sunumu temelli karşılaştırmalı çalışmada, EAU 2026 üreter taşı tedavi algoritması 40 standartlaştırılmış klinik vaka sunumuna dönüştürülmüştür (dört grup halinde onar vaka: proksimal <10 mm, proksimal >10 mm, distal <10 mm, distal >10 mm). ChatGPT, Gemini ve Claude'a, belirli bir kılavuza atıfta bulunmayan aynı standartlaştırılmış soru soruldu. Yanıtlar, önceden tanımlanmış EAU tabanlı referans cevaplara göre ikili bir sistem kullanılarak puanlandı. Uyum, Cochran'ın Q testi ile karşılaştırıldı. Bulgular: Toplam 120 adet LLM tarafından üretilen yanıt değerlendirildi. Genel uyum oranı %96,7 (116/120) olarak belirlendi. ChatGPT tam uyum sağlarken (40/40, %100), Gemini ve Claude ise her biri %95 (38/40) uyum sağladı; aradaki fark istatistiksel olarak anlamlı değildi (Cochran's Q=2,67, p=0,264). Uyum, 10 mm'den küçük tüm senaryolarda tamdı ve URS önceliği gerektiren 10 mm'den büyük senaryolarda %93,3'e düştü. Dört uyumsuzluğun tümü, >10 mm taşlarda "yanlış önceliklendirme" niteliğindeydi ve şok dalgası litotripsiyi üreteroskopi ile eşit düzeyde sunuyordu; her biri, Amerikan Üroloji Derneği (AUA) çerçevesiyle kılavuzlar arası karışıklığı içeriyordu. Önceden tanımlanmış puanlama kategorileri kapsamında hiçbir güvenli olmayan öneri veya kılavuz yanılgısı gözlemlenmedi. Sonuç: Değerlendirilen LLM'ler, üreter taşları için EAU 2026 birinci basamak tedavi önerileriyle yüksek düzeyde uyum göstermiştir. Uyum, öncelik açısından hassas olmayan <10 mm senaryolarda tamdı; ancak URS ve SWL arasındaki doğru hiyerarşinin gerekli olduğu durumlarda azalmıştır. LLM çıktıları klinik karar desteği için kullanıldığında uzman denetimi hâlâ gereklidir ve komut istemleri referans kılavuzu açıkça belirtmelidir.