Alihan TIĞLI, Yakup BAYKUŞ, Rulin DENİZ, Sefer ÜSTEBAY, Muammer Hayri BEKTAŞ, Çağdaş ÇÖLLÜOĞLU
Hipokrat Tıp Dergisi - 2026;6(2):61-69
Amaç Sağlık alanında üretken büyük dil modellerinin (LLM) kullanımı hızla artmaktadır. Ancak çok dilli doğrulukları ve sundukları bilimsel referansların güvenilirliği hakkında kapsamlı veri sınırlıdır. Bu çalışma, üç ücretsiz LLM'nin (ChatGPT, Google Gemini, DeepSeek) Türkçe ve İngilizce gebelik sorularındaki yanıt doğruluğunu ve referans kalitesini karşılaştırmayı amaçladı. Gereç ve Yöntemler Karşılaştırmalı gözlemsel çalışmada, klinikte sık karşılaşılan 14 gebelik sorusu her modele Türkçe ve İngilizce olarak yöneltildi ve güncel bilimsel web (World Wide Web) kaynaklarıyla yanıt vermeleri istendi. Yanıtlar modeli bilmeden kadın hastalıkları ve doğum uzmanları tarafından doğruluk açısından değerlendirildi. Referanslar ayrı bir ekip tarafından güvenilirlik ve bilimsel geçerlilik açısından incelendi. İstatistiksel analiz yapıldı. Bulgular Dil ve model altyapısının performansı anlamlı şekilde etkilediği görüldü. Google Gemini ve DeepSeek İngilizce sorularda Türkçe'ye göre daha yüksek doğruluk gösterdi (p<0.05). ChatGPT'de dil bazlı fark saptanmadı. İngilizce sorularda Gemini ve DeepSeek, ChatGPT'den daha doğruydu (p<0.05); Türkçe sorularda anlamlı fark yoktu. Referans güvenilirliği açısından ChatGPT her iki dilde de en yüksek "mükemmel referans" oranına sahipti (Türkçe %78,5, İngilizce %71,4). Sonuç LLM'ler gebelik hakkında genel bilgi sunabilir; ancak dil yeterliliği ve referans güvenilirliği açısından önemli sınırlılıkları vardır. Klinik karar gerektiren durumlarda tek başına kullanımları uygun değildir. Ana dil odaklı eğitim, referans doğrulama sistemlerinin güçlendirilmesi ve hekim denetiminin entegrasyonu gereklidir.