VIP 👤
🏠 Beranda
Benchmark
📊 Semua Benchmark 🦖 Dinosaurus v1 🦖 Dinosaurus v2 ✅ Aplikasi To-Do List 🎨 Halaman Bebas Kreatif 🎯 FSACB - Showcase Utama 🌍 Benchmark Terjemahan
Model
🏆 Top 10 Model 🆓 Model Gratis 📋 Semua Model ⚙️ Kilo Code
Sumber Daya
💬 Perpustakaan Prompt 📖 Glosarium AI 🔗 Tautan Berguna 🔌 API & Router AI

📡 Rapports en ligne

Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.

Lecture de secours Worker running OK 230/240 modèles traités Suivi du prompt Score prompt moyen 19,7/100

Dernière actualisation : 2026-05-19 18:29:07

Benchmark État Santé Progression Suivi du prompt Score prompt En cours Prochain
dinosaure_v2
dinosaure_tests_v2_3pages
En cours OK 46 / 48
95,8% · réussite 21,7%
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
21,1/100 OpenCode Qwen3.6 Plus OpenCode Qwen3.6 Plus
fsacb
fsacb
En pause OK 46 / 48
95,8% · réussite 32,6%
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
31,5/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
traduction
traduction
En pause OK 46 / 48
95,8% · réussite 0,0%
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
0,0/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
todo_list
to-do-list_v1
En pause OK 46 / 48
95,8% · réussite 2,2%
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
14,3/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
page_libre
page_libre
En pause OK 46 / 48
95,8% · réussite 37,0%
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
31,6/100 — OpenRouter DeepSeek: DeepSeek V4 Flash

Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie

🔬 Metodologi Ilmiah

Pendekatan ketat kami untuk mengevaluasi model kecerdasan buatan

🔬

Protokol Tes Terstandarisasi

Setiap model dievaluasi sesuai dengan metodologi yang ketat dan dapat direproduksi

1
📝 Pembuatan Kode

Analisis statis kode yang dihasilkan, tes unit dan evaluasi kompleksitas algoritma

Qualité: 95% Performance: 88%
2
🎯 Presisi Semantik

Evaluasi relevansi respons terhadap pertanyaan dan konteks

Exactitude: 92% Pertinence: 89%
3
⚡ Performa Temporal

Pengukuran waktu respons, latensi dan kapasitas pengelolaan beban

Vitesse: 1.2s Stabilité: 96%
4
🔄 Koherensi Kontekstual

Kemampuan mempertahankan konteks selama percakapan panjang dan interaksi kompleks

Mémoire: 85% Consistance: 91%

🏆 Standar Evaluasi

✅ Reproduktibilitas Tes diulang 3+ kali untuk validasi
📊 Metrik Kuantitatif Skor numerik yang objektif dan dapat dibandingkan
🔍 Evaluasi Manusia Validasi oleh para ahli di bidangnya
📈 Benchmarking Komparatif Analisis relatif terhadap model referensi