Mert KELEŞ, Elif ÖNCÜ
Necmettin Erbakan University Dental Journal - 2026;8(2):271-282
Amaç: Bu çalışmada, ChatGPT-4o, Gemini-2.5 Flash ve DeepSeek-V3 tarafından periodontal hastalıklarla ilgili yaygın hasta sorularına verilen yanıtların doğruluğu, kalitesi, anlaşılabilirliği, eyleme dönüştürülebilirliği ve okunabilirliği karşılaştırılmıştır. Gereç ve Yöntemler: Hasta ifadelerine dayanan yirmi açık uçlu soru her bir sohbet robotuna yöneltilmiştir. İki periodontolog, yanıtları bilimsel doğruluk, genel kalite (GQS), anlaşılabilirlik ve eyleme dönüştürülebilirlik (PEMAT-P) açısından bağımsız olarak değerlendirmiş; okunabilirlik ise Ateşman Okunabilirlik İndeksi kullanılarak hesaplanmıştır. Uzman değerlendirmesine dayalı alanlarda değerlendiriciler arası güvenilirlik iyi ile mükemmel düzeydeydi. Bulgular: Sohbet robotları arasında doğruluk veya genel kalite açısından anlamlı fark bulunmamıştır (p > 0.05). Anlaşılabilirlik, eyleme dönüştürülebilirlik ve okunabilirlik açısından ise anlamlı farklılıklar gözlenmiştir (p < 0.001). ChatGPT-4o ve DeepSeek-V3 anlaşılabilirlik açısından benzer skorlar göstermiş ve Gemini-2.5 Flash'tan daha yüksek performans sergilemiştir. Eyleme dönüştürülebilirlik açısından ChatGPT-4o ve Gemini-2.5 Flash benzer skorlar göstermiş ve DeepSeek-V3'ten daha yüksek performans göstermiştir. Okunabilirlik açısından ChatGPT-4o en yüksek skorları elde etmiş, bunu DeepSeek-V3 ve Gemini-2.5 Flash izlemiştir. Sonuç: Tüm sohbet robotları doğru yanıtlar üretmesine rağmen, performansları iletişim alanlarına göre farklılık göstermiştir. ChatGPT-4o özellikle okunabilirlik ve hasta odaklı açıklık açısından en olumlu genel profili göstermiştir; ancak hiçbir model tüm kriterlerde mutlak olarak üstün kabul edilmemelidir.