Öner KILINÇ, Neşe ÇABUK ÇELİK
Mersin Üniversitesi Sağlık Bilimleri Dergisi - 2026;19(2):325-332
Amaç: Bu çalışma, osteoartrit (OA) ile ilgili popüler hasta sorularına üç farklı yapay zekâ (YZ) modelinin (ChatGPT -3.5, DeepSeek -R1 ve Gemini -2.5) verdiği yanıtların doğruluk, tamlık ve okunabilirlik açısından karşılaştırılmasını amaçlamaktadır. Yöntem: Google Trends verilerinden elde edilen OA ile ilgili 12 hasta odaklı soru, üç YZ modeline yöneltildi. Yanıtlar, bir ortopedi ve bir romatoloji uzmanı tarafından doğruluk (1 -6 puan), tamlık (1 -3 puan) ve Flesch Okuma Kolaylığı puanı (FRES) açısından değerlendiril di. İstatistiksel analizlerde Friedman testi ve Cohen'in kappa katsayısı kullanıldı. Bulgular: Ortalama doğruluk puanları ChatGPT için 5,83 +/- 0,39, DeepSeek için 5,67 +/- 0,49, Gemini için 5,75 +/- 0,45 olarak bulundu (p = 0,472). Ortalama tamlık puanları sırasıyla 2,75 +/- 0,45, 2,58 +/- 0,51 ve 2,75 +/- 0,45 idi (p = 0,449). Değerlendiriciler arası uyum doğruluk için 0,90, tamlık için 0,88 olarak saptandı (her ikisi p<0,001). Okunabilirlik puanları ChatGPT için 47,2 ("çok zor"), DeepSeek için 27,9 ("çok zor"), Gemini için 55,8 ("zor") idi. Nitel analizde, ChatGPT ve DeepSeek'in talep edilenden fazla ve ayrıntılı bilgi sunma eğiliminde olduğu, Gemini'nin ise daha kısa ve doğrudan yanıtlar verdiği belirlendi. Sonuç: YZ modelleri OA ile ilgili yüksek doğruluk ve tamlık düzeyinde bilgi sunabilmektedir. Ancak ChatGPT ve DeepSeek'in okunabilirlik düzeyi düşük sağlık okuryazarlığı olan bireyler için yetersiz olabilir. Bu nede nle, YZ çıktılarının hedef kitleye uygun dilde düzenlenerek, uzman denetimi ile sunulması hasta eğitimi ve bilgilendirme süreçlerinde kritik öneme sahiptir.