YAPAY ZEKÂ MODELLERİ DİŞ BEYAZLATMADA KLİNİK KARAR VERME SÜREÇLERİNE HAZIR MI? CHATGPT-5, GEMİNİ 2.5 PRO, DEEPSEEK V3.2 VE CLAUDE SONNET 4.5'İN DOĞRULUK, TAMLIK VE OKUNABİLİRLİK AÇISINDAN KANITA DAYALI DEĞERLENDİRİLMESİ

Suzan CANGUL, Ozkan ADIGUZEL, Tuba TUNC, Makbule TASYUREK, Hatice ORTAC

Acta Medica Nicomedia - 2026;9(1):1-12

Dicle University, Faculty of Dentistry, Department of Restorative Dentistry, Diyarbakir, Türkiye

 

Amaç: Bu çalışmanın amacı, büyük dil modelleri (LLM) olan ChatGPT-5, Gemini 2.5 Pro, DeepSeek v3.2 ve Claude Sonnet 4.5 tarafından diş hekimliğinde beyazlatma ile ilgili sunulan bilgilerin doğruluk, tamlık ve okunabilirlik açısından karşılaştırılmasıdır. Yöntem: Diş beyazlatmasının çeşitli yönlerini kapsayan toplam 25 açık uçlu soru hazırlanmış ve dört farklı büyük dil modeline yöneltilmiştir. Elde edilen yanıtlar kaydedilmiş ve kaynakları gizlenmiş şekilde iki restoratif diş tedavisi uzmanı tarafından bağımsız olarak değerlendirilmiştir. Doğruluk ve kapsamlılık sırasıyla 5'li ve 3'lü Likert ölçekleri kullanılarak değerlendirilmiştir. Okunabilirlik ise Flesch Reading Ease Score (FRES), Flesch-Kincaid Grade Level (FKGL) ve Simple Measure of Gobbledygook (SMOG) indeksleri kullanılarak analiz edilmiştir. İstatistiksel analizlerde Sınıf İçi Korelasyon Katsayısı (ICC), Shapiro-Wilk testi, Kruskal-Wallis testi, Dunn-Bonferroni testi ve Spearman korelasyon analizi kullanılmıştır. Bulgular: Diş beyazlatmaya ilişkin açık uçlu sorulara verilen yanıtların doğruluk puanları açısından yapay zekâ modelleri arasında istatistiksel olarak anlamlı farklılık saptanmıştır (p<0,05). DeepSeek v3.2'nin doğruluk puanı (4,52+/-0,77), ChatGPT-5'in doğruluk puanından (3,88+/-1,01) istatistiksel olarak anlamlı derecede daha yüksek bulunmuştur. Okunabilirlik açısından değerlendirilen FRES puanlarının ise DeepSeek v3.2'de (42,02+/-7,63), ChatGPT-5 (29,09+/-9,07), Gemini 2.5 Pro (33,92+/-9,24) ve Claude Sonnet 4.5'e (21,65+/-9,29) kıyasla istatistiksel olarak anlamlı derecede daha yüksek olduğu belirlenmiştir. Sonuç: DeepSeek v3.2, doğruluk açısından ChatGPT-5'e kıyasla daha iyi performans göstermiştir. Yanıtların tamlık puanları bakımından modeller arasında istatistiksel olarak anlamlı bir farklılık bulunmamıştır. Bununla birlikte, FRES sonuçları DeepSeek v3.2'nin diğer sohbet botlarına göre daha yüksek okunabilirliğe sahip metinler ürettiğini göstermiştir. Genel olarak, bu bulgular DeepSeek v3.2'nin hem doğruluk hem de okunabilirlik açısından üstün performans sergilediğini ortaya koymaktadır.