📡 Rapports en ligne
Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.
Lecture de secours
Worker running
OK
230/240 modèles traités
Suivi du prompt
Score prompt moyen 19,7/100
Dernière actualisation : 2026-05-19 18:29:07
| Benchmark | État | Santé | Progression | Suivi du prompt | Score prompt | En cours | Prochain |
|---|---|---|---|---|---|---|---|
|
dinosaure_v2
dinosaure_tests_v2_3pages
|
En cours | OK |
46 / 48
95,8% · réussite 21,7%
|
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
|
21,1/100 | OpenCode Qwen3.6 Plus | OpenCode Qwen3.6 Plus |
|
fsacb
fsacb
|
En pause | OK |
46 / 48
95,8% · réussite 32,6%
|
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
|
31,5/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
traduction
traduction
|
En pause | OK |
46 / 48
95,8% · réussite 0,0%
|
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
|
0,0/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
todo_list
to-do-list_v1
|
En pause | OK |
46 / 48
95,8% · réussite 2,2%
|
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
|
14,3/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
page_libre
page_libre
|
En pause | OK |
46 / 48
95,8% · réussite 37,0%
|
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
|
31,6/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie
🦖 恐龍測試 v1 & v2
完整基準測試:58 個 AI 模型深度能力評估
🎯 進階基準測試
深入專業測試,評估 AI 模型能力
📱 實用應用程式
AI 生成應用程式,用於實際測試與功能評估
🔬 科學方法論
我們嚴謹之 AI 模型評估方法
標準化測試流程
每個模型均依據嚴謹且可重複的方法論進行評估
1
📝 程式碼生成
生成程式碼之靜態分析、單元測試及演算法複雜度評估
Qualité: 95%
Performance: 88%
2
🎯 語意準確度
評估回覆內容與問題及上下文之相關性
Exactitude: 92%
Pertinence: 89%
3
⚡ 時間效能
測量回應時間、延遲及同時處理負載之能力
Vitesse: 1.2s
Stabilité: 96%
4
🔄 上下文連貫性
維持長對話及複雜互動上下文之能力
Mémoire: 85%
Consistance: 91%
🏆 評估標準
可重複性
重複測試 3 次以上進行驗證
量化指標
客觀可比較之數值分數
人類評估
領域專家驗證
對比基準測試
參考模型相對分析