ACCURACY AND COMPLETENESS OF CONTEMPORARY LARGE LANGUAGE MODELS IN PROSTHODONTICS: AN EXPERT-BASED COMPARATIVE STUDY

Elif Yiğit İREN, Hatice Betül ÜÇKUYU

Acıbadem Üniversitesi Sağlık Bilimleri Dergisi - 2026;17(3):0-0

Department of Prosthodontics, Faculty of Dentistry, Kırıkkale University, Kırıkkale, Türkiye

 

Amaç: Bu çalışmanın amacı, dört güncel büyük dil modelinin (ChatGPT-5.2, Gemini 3, Microsoft Copilot, DeepSeek-V3.2) protetik diş hekimliğinin temel alanlarında ve farklı soru formatlarında bilimsel doğruluk ve yanıt tamlığını karşılaştırmaktır. Yöntem: Hareketli protezler, sabit protezler, implantoloji, temporomandibular bozukluklar ve oklüzyon ile dental materyal bilimi olmak üzere beş ana prostodontik alanı kapsayan elli soru, standart ders kitapları ve klinik kılavuzlardan oluşturulmuştur. Sorular; klinik muhakemenin farklı düzeylerini yansıtmak amacıyla evet/hayır, çoktan seçmeli ve açık uçlu formatlarda sunulmuştur. ChatGPT-5.2 (OpenAI), Gemini 3 (Google), Microsoft Copilot (Microsoft) ve DeepSeek-V3.2 tarafından üretilen yanıtlar, beş protez uzmanı tarafından Likert temelli ölçekler kullanılarak doğruluk ve yanıt tamlığı açısından bağımsız olarak değerlendirilmiştir. Puanlama tutarlılığını sağlamak için değerlendiriciler arası uyum analiz edilmiş, model performansları ise parametrik olmayan istatistiksel testler ile alanlar ve soru tipleri arasında karşılaştırılmıştır. Bulgular: Genel doğruluk açısından dört model arasında istatistiksel olarak anlamlı farklılık saptanmıştır (p<0.05); en yüksek medyan doğruluk Gemini 3'te, ardından ChatGPT-5.2 ve Copilot'ta gözlenmiş, en düşük performans ise DeepSeek-V3.2'te tespit edilmiştir. Soru formatları arasında istatistiksel olarak anlamlı bir fark bulunmamıştır (tüm p>0.05); ancak tanımlayıcı eğilimler evet/hayır sorularında daha yüksek, çoktan seçmeli sorularda ise daha düşük skorlar olduğunu göstermiştir. Yanıt tamlığı da modeller arasında anlamlı farklılık göstermiştir (p<0.05); en kapsamlı yanıtları Gemini 3 sağlamıştır. Ancak bireysel prostodontik alanlar içinde modeller arasında istatistiksel olarak anlamlı bir fark saptanmamıştır (p>0.05). Sonuç: Güncel büyük dil modelleri protetik diş hekimliği alanında kabul edilebilir teorik performans göstermektedir; protetik diş hekimliği eğitimine ve ön bilgi edinimine destek sağlayabilir; ancak uzman klinik kararların yerini alamaz.