Muhammed Emin ZORA
Kocatepe Tıp Dergisi - 2026;27(3):362-369
AMAÇ: Amerikan Anesteziyologlar Derneği (ASA) Fiziksel Durum sınıflaması, preoperatif risk değerlendirmesinde yaygın olarak kullanılmaktadır. Ancak öznel yapısı, uygulayıcılar arasında farklılıklara yol açabilmektedir. Bu çalışmada, büyük dil modeli (LLM) tabanlı yapay zeka sistemlerinin ASA skorlamasında deneyimli bir anesteziyolog ile uyumu değerlendirildi. GEREÇ VE YÖNTEM: ASA sınıflarını (I-V) dengeli şekilde temsil eden 100 simüle hasta vakası, iki uzman anesteziyolog tarafından oluşturuldu. Beş güncel LLM (ChatGPT, Copilot, Grok, Deepseek, Gemini) her bir vaka için ASA sınıfı belirledi. Sonuçlar, 15 yıllık deneyime sahip bir anesteziyoloğun skorları ile karşılaştırıldı. İstatistiksel analizde Friedman ve Wilcoxon signed-rank testleri (Bonferroni düzeltmesi ile) ve Cohen's Kappa katsayıları kullanıldı. BULGULAR: Friedman testi modeller arasında anlamlı farklılık gösterdi (p < 0,001). Copilot, anesteziyoloğun skorları ile en yüksek uyumu sağladı (Kappa = 0,82), onu ChatGPT ve Grok izledi. Deepseek ve Gemini'nin uyumu anlamlı derecede düşüktü (p < 0,001). Hatalı sınıflandırmalar çoğunlukla komşu ASA sınıfları arasında görüldü (özellikle ASA II-III ve ASA III-IV). SONUÇ: Copilot ve ChatGPT gibi bazı LLM tabanlı yapay zeka sistemleri, ASA sınıflamasında uzman görüşü ile yüksek uyum göstermektedir. Bununla birlikte, çalışma simüle vakalara dayanmakta olup sonuçlar hipotez üretici niteliktedir. Klinik kullanıma yönelik çıkarımlar için çok merkezli, gerçek hasta verilerine dayalı ve çoklu uzman değerlendirmelerini içeren ileri çalışmalara ihtiyaç vardır.