VIP 👤
🏠 Ana Sayfa
Benchmarklar
📊 Tüm Benchmarklar 🦖 Dinozor v1 🦖 Dinozor v2 ✅ To-Do List Uygulamaları 🎨 Yaratıcı Serbest Sayfalar 🎯 FSACB - Nihai Gösteri 🌍 Çeviri Benchmarkı
Modeller
🏆 En İyi 10 Model 🆓 Ücretsiz Modeller 📋 Tüm Modeller ⚙️ Kilo Code
Kaynaklar
💬 Prompt Kütüphanesi 📖 YZ Sözlüğü 🔗 Faydalı Bağlantılar 🔌 Yapay Zeka API'leri ve Yönlendiriciler

📡 Rapports en ligne

Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.

Lecture de secours Worker running OK 230/240 modèles traités Suivi du prompt Score prompt moyen 19,7/100

Dernière actualisation : 2026-05-19 18:29:07

Benchmark État Santé Progression Suivi du prompt Score prompt En cours Prochain
dinosaure_v2
dinosaure_tests_v2_3pages
En cours OK 46 / 48
95,8% · réussite 21,7%
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
21,1/100 OpenCode Qwen3.6 Plus OpenCode Qwen3.6 Plus
fsacb
fsacb
En pause OK 46 / 48
95,8% · réussite 32,6%
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
31,5/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
traduction
traduction
En pause OK 46 / 48
95,8% · réussite 0,0%
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
0,0/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
todo_list
to-do-list_v1
En pause OK 46 / 48
95,8% · réussite 2,2%
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
14,3/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
page_libre
page_libre
En pause OK 46 / 48
95,8% · réussite 37,0%
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
31,6/100 — OpenRouter DeepSeek: DeepSeek V4 Flash

Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie

🔬 Bilimsel Metodoloji

Yapay zeka modellerini değerlendirmek için titiz yaklaşımımız

🔬

Standardize Test Protokolü

Her model titiz ve tekrarlanabilir bir metodolojiye göre değerlendirilir

1
📝 Kod Oluşturma

Oluşturulan kodun statik analizi, birim testleri ve algoritmik karmaşıklık değerlendirmesi

Qualité: 95% Performance: 88%
2
🎯 Anlamsal Hassasiyet

Sorular ve bağlam açısından yanıtların ilgiliğinin değerlendirilmesi

Exactitude: 92% Pertinence: 89%
3
⚡ Zamansal Performans

Yanıt sürelerinin, gecikmenin ve yük yönetimi kapasitesinin ölçülmesi

Vitesse: 1.2s Stabilité: 96%
4
🔄 Bağlamsal Tutarlılık

Uzun konuşmalarda ve karmaşık etkileşimlerde bağlamı koruma yeteneği

Mémoire: 85% Consistance: 91%

🏆 Değerlendirme Standartları

✅ Tekrarlanabilirlik Doğrulama için 3+ kez tekrarlanan testler
📊 Nicel Metrikler Nesnel ve karşılaştırılabilir sayısal puanlar
🔍 İnsan Değerlendirmesi Alan uzmanları tarafından doğrulama
📈 Karşılaştırmalı Benchmarking Referans modellere göre göreli analiz