📡 Rapports en ligne
Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.
Dernière actualisation : 2026-05-19 18:29:07
| Benchmark | État | Santé | Progression | Suivi du prompt | Score prompt | En cours | Prochain |
|---|---|---|---|---|---|---|---|
|
dinosaure_v2
dinosaure_tests_v2_3pages
|
En cours | OK |
46 / 48
95,8% · réussite 21,7%
|
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
|
21,1/100 | OpenCode Qwen3.6 Plus | OpenCode Qwen3.6 Plus |
|
fsacb
fsacb
|
En pause | OK |
46 / 48
95,8% · réussite 32,6%
|
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
|
31,5/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
traduction
traduction
|
En pause | OK |
46 / 48
95,8% · réussite 0,0%
|
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
|
0,0/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
todo_list
to-do-list_v1
|
En pause | OK |
46 / 48
95,8% · réussite 2,2%
|
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
|
14,3/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
page_libre
page_libre
|
En pause | OK |
46 / 48
95,8% · réussite 37,0%
|
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
|
31,6/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie
🦖 डायनासोर टेस्ट v1 & v2
कंप्लीट बेंचमार्क: 58 AI मॉडल, गहन क्षमता मूल्यांकन के साथ
🎯 एडवांस्ड बेंचमार्क
AI क्षमताओं के मूल्यांकन के लिए गहन और विशेष टेस्ट
📱 प्रैक्टिकल ऐप्स
व्यावहारिक परीक्षण और फ़ंक्शनल मूल्यांकन के लिए AI-जनरेटेड ऐप्स
🔬 वैज्ञानिक मेथडोलॉजी
AI मॉडलों के मूल्यांकन के लिए हमारा कठोर दृष्टिकोण
स्टैंडर्डाइज़्ड टेस्ट प्रोटोकॉल
हर मॉडल का मूल्यांकन एक कठोर और पुनरुत्पादनीय मेथडोलॉजी से किया जाता है
📝 कोड जनरेशन
जनरेट किए गए कोड का स्टैटिक विश्लेषण, यूनिट टेस्ट और एल्गोरिद्मिक जटिलता का मूल्यांकन
🎯 सेमांटिक सटीकता
प्रश्नों और संदर्भ के अनुसार उत्तरों की प्रासंगिकता का मूल्यांकन
⚡ समय प्रदर्शन
रिस्पॉन्स टाइम, लेटेंसी और समवर्ती लोड संभालने की क्षमता का मापन
🔄 संदर्भ संगति
लंबी बातचीत और जटिल इंटरैक्शन में संदर्भ बनाए रखने की क्षमता