OSTEOARTRİT HAKKINDAKİ POPÜLER SORULARA ÜÇ FARKLI YAPAY ZEKÂ MODELİNİN YANITLARININ ORTOPEDİ VE ROMATOLOJİ UZMANLARI TARAFINDAN DEĞERLENDİRİLMESİ

Öner KILINÇ, Neşe ÇABUK ÇELİK

Mersin Üniversitesi Sağlık Bilimleri Dergisi - 2026;19(2):325-332

Ortopedi ve Travmatoloji Kliniği, Mersin Şehir Eğitim ve Araştırma Hastanesi, Mersin, Türkiye

 

Amaç: Bu çalışma, osteoartrit (OA) ile ilgili popüler hasta sorularına üç farklı yapay zekâ (YZ) modelinin (ChatGPT -3.5, DeepSeek -R1 ve Gemini -2.5) verdiği yanıtların doğruluk, tamlık ve okunabilirlik açısından karşılaştırılmasını amaçlamaktadır. Yöntem: Google Trends verilerinden elde edilen OA ile ilgili 12 hasta odaklı soru, üç YZ modeline yöneltildi. Yanıtlar, bir ortopedi ve bir romatoloji uzmanı tarafından doğruluk (1 -6 puan), tamlık (1 -3 puan) ve Flesch Okuma Kolaylığı puanı (FRES) açısından değerlendiril di. İstatistiksel analizlerde Friedman testi ve Cohen'in kappa katsayısı kullanıldı. Bulgular: Ortalama doğruluk puanları ChatGPT için 5,83 +/- 0,39, DeepSeek için 5,67 +/- 0,49, Gemini için 5,75 +/- 0,45 olarak bulundu (p = 0,472). Ortalama tamlık puanları sırasıyla 2,75 +/- 0,45, 2,58 +/- 0,51 ve 2,75 +/- 0,45 idi (p = 0,449). Değerlendiriciler arası uyum doğruluk için 0,90, tamlık için 0,88 olarak saptandı (her ikisi p<0,001). Okunabilirlik puanları ChatGPT için 47,2 ("çok zor"), DeepSeek için 27,9 ("çok zor"), Gemini için 55,8 ("zor") idi. Nitel analizde, ChatGPT ve DeepSeek'in talep edilenden fazla ve ayrıntılı bilgi sunma eğiliminde olduğu, Gemini'nin ise daha kısa ve doğrudan yanıtlar verdiği belirlendi. Sonuç: YZ modelleri OA ile ilgili yüksek doğruluk ve tamlık düzeyinde bilgi sunabilmektedir. Ancak ChatGPT ve DeepSeek'in okunabilirlik düzeyi düşük sağlık okuryazarlığı olan bireyler için yetersiz olabilir. Bu nede nle, YZ çıktılarının hedef kitleye uygun dilde düzenlenerek, uzman denetimi ile sunulması hasta eğitimi ve bilgilendirme süreçlerinde kritik öneme sahiptir.