Arka Plan:
ChatGPT gibi büyük dil modellerinin (LLM) klinik uygulamalardaki potansiyeli son dönemde büyük ilgi görmektedir. Acil servislerde radyografilerin yanlış yorumlanması tedavi süreçlerini aksatabildiği ve morbiditeyi artırabildiği için kırıkların doğru tespit edilmesi hayati önem taşır. Yakın zamanda geliştirilen GPT-5 ve Google Gemini 2.5 Pro gibi çok modlu (multimodal) sistemler gelişmiş görsel işleme yetenekleri sunsa da, bu modellerin uzman hekimlerle kıyaslandığında tanısal doğrulukları henüz netlik kazanmamıştır.
Yöntemler:
Haziran ve Ağustos 2025 tarihleri arasında Türkiye'de yürütülen bu pilot gözlemci çalışmasında; GPT-5, Gemini 2.5 Pro ve uzman klinisyenlerin (iki acil tıp uzmanı ve iki ortopedi cerrahı) travma radyografilerini yorumlama performansları karşılaştırılmıştır. Radiopaedia veri setinden seçilen, farklı anatomik bölgelere ait 24 kırık/dislokasyon vakası ve 12 normal inceleme olmak üzere toplam 36 vaka; hem patoloji tespiti hem de normal bulguların tanınması açısından değerlendirilmiştir.
Bulgular:
GPT-5, kısıtlı bir tanısal doğruluk (%52,8) ve düşük ayırt edici yetenek (AUC 0,521) sergilemiştir. Buna karşılık Gemini 2.5 Pro, anlamlı derecede yüksek bir doğruluk oranına (%94,4) ve mükemmel bir ayırt edici performansa (AUC 0,958) ulaşmıştır. Gemini 2.5 Pro'nun sonuçları ortopedi cerrahları ile benzerlik göstermiş; acil tıp uzmanlarına kıyasla sayısal olarak daha yüksek olmakla birlikte istatistiksel olarak anlamlı bir fark saptanmamıştır. Gemini 2.5 Pro ve hekimlerin performansında anatomik bölgelere göre anlamlı bir fark gözlemlenmezken, GPT-5 tüm bölgelerde tutarlı bir şekilde düşük performans göstermiştir.
Sonuç:
Bu küçük ve seçilmiş veri setinde Gemini 2.5 Pro, çalışmaya katılan uzman hekimlerinkine benzer bir tanısal doğruluk sergileyerek travma radyografisinde özellikle triyaj ve tarama süreçlerinde destekleyici bir araç olma potansiyeli göstermiştir. GPT-5 ise aynı koşullar altında düşük performans sergilemiştir. Çalışmanın keşifsel (pilot) tasarımı göz önüne alındığında bu bulgular ön veri niteliğinde değerlendirilmelidir; bu sistemlerin klinik uygulamaya entegrasyonu düşünülmeden önce kurumsal veri setlerini, çok yönlü görüntülemeleri ve klinik bağlamı içeren daha geniş kapsamlı prospektif çalışmalara ihtiyaç vardır.
Anahtar Kelimeler: Yapay zeka, Büyük dil modelleri, Gemini 2.5 Pro, GPT-5, Tanısal doğruluk
Background:
Large language models (LLMs) such as ChatGPT have gained attention for their potential clinical applications. Accurate fracture detection in emergency settings is critical, as misinterpretation of radiographs can delay treatment and increase morbidity. Recently developed multimodal systems, including GPT-5 and Google Gemini 2.5 Pro, offer advanced visual processing capabilities, but their diagnostic accuracy compared with expert physicians remains unclear.
Methods:
This pilot observer study, conducted in Turkey between June and August 2025, compared the diagnostic performance of GPT-5, Gemini 2.5 Pro, and expert clinicians (two emergency physicians and two orthopedic surgeons) in interpreting trauma radiographs. Thirty-six cases from Radiopaedia, including 24 with fractures or dislocations and 12 normal studies across multiple anatomical regions, were evaluated for both pathology detection and recognition of normal findings.
Results:
GPT-5 demonstrated limited diagnostic accuracy (52.8%) with poor discriminatory ability (AUC 0.521). In contrast, Gemini 2.5 Pro achieved significantly higher accuracy (94.4%) and excellent discriminatory performance (AUC 0.958). Its results were comparable to those of the orthopedic surgeons and numerically higher than, though not statistically different from, those of the emergency physicians. No significant regional differences in performance were observed for Gemini 2.5 Pro or physicians, whereas GPT-5 consistently underperformed across anatomical regions.
Conclusion:
Within this small, curated dataset, Gemini 2.5 Pro reached a diagnostic accuracy similar to that of the participating specialists, suggesting possible value as a supportive tool for triage and screening in trauma radiography. GPT-5, by contrast, performed poorly under the same conditions. Given the exploratory design, these findings should be regarded as preliminary; larger prospective studies using institutional datasets, multiple imaging views, and clinical context are needed before any clinical integration can be considered.
Keywords: Artificial intelligence, Large language models, Gemini 2.5 Pro, GPT-5, Diagnostic accuracy