Akademik Karşılaştırma

Benchmark Radarı & Liderlik Tablosu

Popüler dil ve akıl yürütme modellerinin MMLU, HumanEval, GSM8K ve TR-Eval Türkçe test başarılarını şeffaf ve güncel olarak karşılaştırın.

🔍
# Model Adı Geliştirici MMLU HumanEval GSM8K GPQA MMMU TR-Eval

Kullanılan Akademik Metrikler Nelerdir?

📚 Genel Bilgi

MMLU (Massive Multitask Language Understanding)

Yapay zekanın beşeri bilimler, sosyal bilimler, matematik, hukuk ve tıp gibi 57 farklı disiplinde gösterdiği genel bilgi ve problem çözme başarısını test eder.

💻 Kodlama

HumanEval (Python Coding Task)

OpenAI tarafından geliştirilen bu metrik, modelin fonksiyon tanımları ve docstring'ler doğrultusunda sıfırdan çalışan Python kodları üretme yeteneğini ölçer.

📐 Matematik

GSM8K (Grade School Math)

İlkokul ve ortaokul düzeyindeki sözel matematik problemlerinin mantıksal zincirleme yöntemiyle (chain-of-thought) adım adım çözülebilme başarısını ölçer.

🧬 Akıl Yürütme

GPQA (Graduate-Level Q&A)

Alanında uzman doktora seviyesindeki araştırmacılar tarafından hazırlanan fizik, kimya ve biyoloji odaklı, aşırı zor akıl yürütme gerektiren soruları içerir.

🎨 Çoklu Mod

MMMU (Multimodal Reasoning)

Yapay zekanın görsel, grafik ve tablolar içeren üniversite seviyesindeki karmaşık çoklu modlu (multimodal) verileri anlama ve akıl yürütme yeteneğini test eder.

🇹🇷 Türkçe

TR-Eval (Türkçe Dil Kapasitesi)

eYapayZeka tarafından özel olarak derlenen; Türkçe dil bilgisi, deyimler, bağlamsal çıkarım, özetleme ve kültürel uyum performansını ölçen radar endeksidir.

Model Yanıt Hızı (tokens/sn)

↑ yüksek daha iyi
Gemini 2.5 Flash155 t/s
Qwen 3 (Lokal RTX 4090)110 t/s
GPT-4.582 t/s
Claude Sonnet 478 t/s
DeepSeek R1 (Reasoning)35 t/s

1M Token Maliyeti ($) - Girdi/Çıktı

↓ düşük daha iyi
GPT-4.5$5.00 / $15.00
Claude Sonnet 4$3.00 / $15.00
Gemini 2.5 Pro$1.25 / $5.00
DeepSeek R1$0.55 / $2.19
Llama 4 / Qwen 3 (Lokal)$0.00 (Sunucu Hariç)

Haftalık AI Radar bültenine katıl

Yeni çıkan modeller, açık kaynak gelişmeleri ve haftanın en iyi araçları her hafta e-postanıza gelsin.