VIP 👤
🏠 Accueil
Benchmarks
📊 Tous les Benchmarks 🦖 Dinosaure v1 🦖 Dinosaure v2 ✅ To-Do List Apps 🎨 Pages Libres 🎯 FSACB - Showcase 🌍 Traduction
Modèles
🏆 Top 10 Modèles 🆓 Modèles Gratuits 📋 Tous les Modèles ⚙️ Modes Kilo Code
Ressources
💬 Prompts IA 📖 Glossaire IA 🔗 Liens Utiles 🔌 API & Routeurs

📡 Rapports en ligne

Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.

Lecture de secours Worker running OK 230/240 modèles traités Suivi du prompt Score prompt moyen 19,7/100

Dernière actualisation : 2026-05-19 18:29:07

Benchmark État Santé Progression Suivi du prompt Score prompt En cours Prochain
dinosaure_v2
dinosaure_tests_v2_3pages
En cours OK 46 / 48
95,8% · réussite 21,7%
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
21,1/100 OpenCode Qwen3.6 Plus OpenCode Qwen3.6 Plus
fsacb
fsacb
En pause OK 46 / 48
95,8% · réussite 32,6%
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
31,5/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
traduction
traduction
En pause OK 46 / 48
95,8% · réussite 0,0%
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
0,0/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
todo_list
to-do-list_v1
En pause OK 46 / 48
95,8% · réussite 2,2%
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
14,3/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
page_libre
page_libre
En pause OK 46 / 48
95,8% · réussite 37,0%
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
31,6/100 — OpenRouter DeepSeek: DeepSeek V4 Flash

Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie

🔬 Méthodologie Scientifique

Notre approche rigoureuse pour l'évaluation des modèles d'intelligence artificielle

🔬

Protocole de Test Standardisé

Chaque modèle est évalué selon une méthodologie rigoureuse et reproductible

1
📝 Génération de Code

Analyse statique du code généré, tests unitaires et évaluation de la complexité algorithmique

Qualité: 95% Performance: 88%
2
🎯 Précision Sémantique

Évaluation de la pertinence des réponses par rapport aux questions posées et au contexte

Exactitude: 92% Pertinence: 89%
3
⚡ Performance Temporelle

Mesure des temps de réponse, latence et capacité à gérer les charges simultanées

Vitesse: 1.2s Stabilité: 96%
4
🔄 Cohérence Contextuelle

Capacité à maintenir le contexte sur les longues conversations et interactions complexes

Mémoire: 85% Consistance: 91%

🏆 Standards d'Évaluation

✅ Reproductibilité Tests répétés 3+ fois pour validation
📊 Métriques Quantitatives Scores numériques objectifs et comparables
🔍 Évaluation Humaine Validation par experts du domaine
📈 Benchmarking Comparatif Analyse relative aux modèles de référence