Alaeddin ACAR, Eray TEKİRDAŞ
Pamukkale Tıp Dergisi - 2026;19(3):488-496
Amaç: Bu çalışma, 2024 Türk Nöroşirürji Derneği Yeterlik Kurulu sınavından seçilen ve görüntü tabanlı soruları da içeren 98 soruda GPT-4o ile GPT o1 pro büyük dil modellerinin yanıt üretme yeteneklerini ve doğruluklarını değerlendirmeyi ve karşılaştırmayı amaçlamaktadır. Gereç ve yöntem: GPT-4o ve GPT o1 pro kullanılarak görüntü tabanlı sorular dahil toplam 98 soruya yanıt elde edildi. Modeller tek seferlik ve üç denemelik yaklaşımlarla test edildi ve hem doğruluk hem de üç deneme boyunca aynı cevabı verme tutarlılığı hesaplandı. Multimodal akıl yürütmeyi değerlendirmek amacıyla metin tabanlı ve görüntü tabanlı sorular karşılaştırıldı. Bulgular: GPT o1 pro tek denemede %92,9 doğruluk sağlarken GPT-4o %71,4'te kalmış, bu fark istatistiksel olarak anlamlı bulunmuştur ( p<0,001). Üç deneme ortalamasında GPT o1 pro %91,8, GPT-4o %72,4 doğruluk göstermiştir ( p<0,001); aynı verilere göre tutarlılık oranları sırasıyla %91,8 ve %78,6'dır ( p=0,009). Yalnız metin sorularında GPT o1 pro %96,3 doğrulukla GPT-4o'nun %72,8'lik performansını açıkça geride bırakmıştır; görüntü tabanlı sorularda ise GPT o1 pro %76,5, GPT-4o %64,7 oranına ulaşmış olup bu fark istatistiksel olarak anlamlı değildir ( p=0,68). Sonuçlar, GPT o1 pro'nun özellikle metin tabanlı sorularda GPT-4o'ya göre belirgin üstünlük gösterdiğini ancak her iki modelin de görüntü tabanlı görevlerde gelişmeye gereksinim duyduğunu ortaya koymaktadır. Sonuç: Her iki model de 2024 Türk Nöroşirurji Derneği Yeterlik Kurulu sınavını başarıyla geçmiştir. GPT o1 pro, GPT-4o'ya kıyasla belirgin şekilde daha yüksek doğruluk ve tutarlılık göstermiş olup, bu durum tıbbi eğitimde düşünce zinciri temelli akıl yürütmenin umut verici bir rolü olabileceğini düşündürmektedir .