Popüler dil ve akıl yürütme modellerinin MMLU, HumanEval, GSM8K ve TR-Eval Türkçe test başarılarını şeffaf ve güncel olarak karşılaştırın.
| # | Model Adı | Geliştirici | MMLU | HumanEval | GSM8K | GPQA | MMMU | TR-Eval |
|---|
Aradığınız kriterlere uygun benchmark sonucu bulunamadı. Lütfen aramanızı düzeltin.
Yapay zekanın beşeri bilimler, sosyal bilimler, matematik, hukuk ve tıp gibi 57 farklı disiplinde gösterdiği genel bilgi ve problem çözme başarısını test eder.
OpenAI tarafından geliştirilen bu metrik, modelin fonksiyon tanımları ve docstring'ler doğrultusunda sıfırdan çalışan Python kodları üretme yeteneğini ölçer.
İlkokul ve ortaokul düzeyindeki sözel matematik problemlerinin mantıksal zincirleme yöntemiyle (chain-of-thought) adım adım çözülebilme başarısını ölçer.
Alanında uzman doktora seviyesindeki araştırmacılar tarafından hazırlanan fizik, kimya ve biyoloji odaklı, aşırı zor akıl yürütme gerektiren soruları içerir.
Yapay zekanın görsel, grafik ve tablolar içeren üniversite seviyesindeki karmaşık çoklu modlu (multimodal) verileri anlama ve akıl yürütme yeteneğini test eder.
eYapayZeka tarafından özel olarak derlenen; Türkçe dil bilgisi, deyimler, bağlamsal çıkarım, özetleme ve kültürel uyum performansını ölçen radar endeksidir.
Yeni çıkan modeller, açık kaynak gelişmeleri ve haftanın en iyi araçları her hafta e-postanıza gelsin.