VIP 👤
🏠 Trang chủ
Benchmark
📊 Tất cả benchmark 🦖 Khủng long v1 🦖 Khủng long v2 ✅ Ứng dụng To-Do List 🎨 Trang tự do sáng tạo 🎯 FSACB - Trình diễn cuối cùng 🌍 Benchmark dịch thuật
Mô hình
🏆 Top 10 mô hình 🆓 Mô hình miễn phí 📋 Tất cả mô hình ⚙️ Kilo Code
Tài nguyên
💬 Thư viện prompt 📖 Thuật ngữ AI 🔗 Liên kết hữu ích 🔌 API và bộ định tuyến AI

📡 Rapports en ligne

Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.

Lecture de secours Worker running OK 230/240 modèles traités Suivi du prompt Score prompt moyen 19,7/100

Dernière actualisation : 2026-05-19 18:29:07

Benchmark État Santé Progression Suivi du prompt Score prompt En cours Prochain
dinosaure_v2
dinosaure_tests_v2_3pages
En cours OK 46 / 48
95,8% · réussite 21,7%
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
21,1/100 OpenCode Qwen3.6 Plus OpenCode Qwen3.6 Plus
fsacb
fsacb
En pause OK 46 / 48
95,8% · réussite 32,6%
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
31,5/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
traduction
traduction
En pause OK 46 / 48
95,8% · réussite 0,0%
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
0,0/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
todo_list
to-do-list_v1
En pause OK 46 / 48
95,8% · réussite 2,2%
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
14,3/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
page_libre
page_libre
En pause OK 46 / 48
95,8% · réussite 37,0%
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
31,6/100 — OpenRouter DeepSeek: DeepSeek V4 Flash

Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie

🔬 Phương pháp luận khoa học

Cách tiếp cận nghiêm ngặt của chúng tôi để đánh giá các mô hình AI

🔬

Giao thức thử nghiệm tiêu chuẩn hóa

Mỗi mô hình được đánh giá theo một phương pháp luận nghiêm ngặt và có thể lặp lại

1
📝 Tạo Mã

Phân tích tĩnh mã được tạo, kiểm thử đơn vị và đánh giá độ phức tạp thuật toán

Qualité: 95% Performance: 88%
2
🎯 Độ Chính Xác Ngữ Nghĩa

Đánh giá mức độ liên quan của câu trả lờ đối với câu hỏi và ngữ cảnh

Exactitude: 92% Pertinence: 89%
3
⚡ Hiệu Suất Thờ Gian

Đo thờ gian phản hồi, độ trễ và khả năng quản lý tải

Vitesse: 1.2s Stabilité: 96%
4
🔄 Tính Mạch Lạc Ngữ Cảnh

Khả năng duy trì ngữ cảnh trong các cuộc trò chuyện dài và tương tác phức tạp

Mémoire: 85% Consistance: 91%

🏆 Tiêu Chuẩn Đánh Giá

✅ Tính Tái Tạo Kiểm tra lặp lại 3+ lần để xác thực
📊 Chỉ Số Định Lượng Điểm số số học khách quan và có thể so sánh
🔍 Đánh Giá Con Ngườ Xác thực bởi chuyên gia lĩnh vực
📈 Benchmarking So Sánh Phân tích tương đối so với mô hình tham chiếu