YAPAY ZEKA DOĞUM UZMANININ YERİNE KONUŞURSA: GERÇEK HASTA SORULARINDA ÇOK DİLLİ DOĞRULUK

Alihan TIĞLI, Yakup BAYKUŞ, Rulin DENİZ, Sefer ÜSTEBAY, Muammer Hayri BEKTAŞ, Çağdaş ÇÖLLÜOĞLU

Hipokrat Tıp Dergisi - 2026;6(2):61-69

Department of Obstetrics and Gynaecology, Bandırma Onyedi Eylül University Faculty of Medicine, Bandırma, Türkiye

 

Amaç Sağlık alanında üretken büyük dil modellerinin (LLM) kullanımı hızla artmaktadır. Ancak çok dilli doğrulukları ve sundukları bilimsel referansların güvenilirliği hakkında kapsamlı veri sınırlıdır. Bu çalışma, üç ücretsiz LLM'nin (ChatGPT, Google Gemini, DeepSeek) Türkçe ve İngilizce gebelik sorularındaki yanıt doğruluğunu ve referans kalitesini karşılaştırmayı amaçladı. Gereç ve Yöntemler Karşılaştırmalı gözlemsel çalışmada, klinikte sık karşılaşılan 14 gebelik sorusu her modele Türkçe ve İngilizce olarak yöneltildi ve güncel bilimsel web (World Wide Web) kaynaklarıyla yanıt vermeleri istendi. Yanıtlar modeli bilmeden kadın hastalıkları ve doğum uzmanları tarafından doğruluk açısından değerlendirildi. Referanslar ayrı bir ekip tarafından güvenilirlik ve bilimsel geçerlilik açısından incelendi. İstatistiksel analiz yapıldı. Bulgular Dil ve model altyapısının performansı anlamlı şekilde etkilediği görüldü. Google Gemini ve DeepSeek İngilizce sorularda Türkçe'ye göre daha yüksek doğruluk gösterdi (p<0.05). ChatGPT'de dil bazlı fark saptanmadı. İngilizce sorularda Gemini ve DeepSeek, ChatGPT'den daha doğruydu (p<0.05); Türkçe sorularda anlamlı fark yoktu. Referans güvenilirliği açısından ChatGPT her iki dilde de en yüksek "mükemmel referans" oranına sahipti (Türkçe %78,5, İngilizce %71,4). Sonuç LLM'ler gebelik hakkında genel bilgi sunabilir; ancak dil yeterliliği ve referans güvenilirliği açısından önemli sınırlılıkları vardır. Klinik karar gerektiren durumlarda tek başına kullanımları uygun değildir. Ana dil odaklı eğitim, referans doğrulama sistemlerinin güçlendirilmesi ve hekim denetiminin entegrasyonu gereklidir.