Emrah IŞIKTEKİN, Erhan HOCAOĞLU
Uludağ Üniversitesi Tıp Fakültesi Dergisi - 2026;52(1):1-8
Çalışmanın amacı, diyabetik ayak ülseri yönetimine ilişkin yapay zeka tarafından üretilen hekim düzeyindeki eğitsel yanıtların kalite, klinik güvenilirlik ve kılavuz uyumunu değerlendirmektir. Çift kör, karşılaştırmalı analiz, üç yaygın kullanılan büyük dil modeli -ChatGPT, Gemini ve Claude-kullanılarak gerçekleştirilmiş ve bu modeller önleme, tanı ve sınıflandırma ile tedaviyi kapsayan on iki standart klinik soru üzerinden değerlendirilmiştir. Tüm sorular, Uluslararası Diyabetik Ayak Çalışma Grubu (IWGDF) tarafından yayımlanan mevcut bir klinik kılavuz temel alınarak geliştirilmiştir. Yanıtlar, klinik derinlik, teknik doğruluk, karar verme yararlılığı, genel kalite ve potansiyel olarak zararlı veya yanıltıcı bilgi varlığı dahil olmak üzere önceden tanımlanmış kriterlere göre altı uzman değerlendirici tarafından bağımsız olarak incelenmiştir. Uluslararası kabul gören kılavuz ile uyumu, yerleşik önerilere dayalı yapılandırılmış kontrol listeleri kullanılarak değerlendirilmiştir. Tüm değerlendirme alanlarında modeller arasında anlamlı farklılıklar saptanmıştır. Gemini, klinik derinlik, teknik doğruluk, karar verme yararlılığı ve genel kalite açısından daha yüksek performans göstermiş ve aynı zamanda kılavuz temelli önerilerle daha yüksek düzeyde uyum sergilemiştir. Buna karşılık ChatGPT ve Claude daha düşük skorlar elde etmiş ve yanıltıcı bilgi üretme eğilimlerinin daha yüksek olduğu gözlenmiştir. Değerlendiriciler arası uyum analizinde orta -iyi düzeyde tutarlılık saptanmıştır. Bu bulgular, yapay zeka sistemlerinin klinik açıdan anlamlı bilgi üretme potansiyeline sahip olduğunu göstermekle birlikte, performanslarının değişken olduğunu ve yüksek riskli klinik karar verme süreçlerinde her zaman gerekli standartları karşılamayabileceğini ortaya koymaktadır. Bu nedenle bu sistemlerin rutin klinik uygulamalara entegrasyonu öncesinde dikkatli değerlendirme ve doğrulama gereklidir.