VIP 👤
🏠 홈
벤치마크
📊 모든 벤치마크 🦖 공룡 v1 🦖 공룡 v2 ✅ 할 일 목록 앱 🎨 창의적인 자유 페이지 🎯 FSACB - 궁극의 쇼케이스 🌍 번역 벤치마크
모델
🏆 톱 10 모델 🆓 무료 모델 📋 모든 모델 ⚙️ 킬로 코드 모드
리소스
💬 프롬프트 라이브러리 📖 AI 용어 사전 🔗 유용한 링크 🔌 AI API 및 라우터

📡 Rapports en ligne

Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.

Lecture de secours Worker running OK 230/240 modèles traités Suivi du prompt Score prompt moyen 19,7/100

Dernière actualisation : 2026-05-19 18:29:07

Benchmark État Santé Progression Suivi du prompt Score prompt En cours Prochain
dinosaure_v2
dinosaure_tests_v2_3pages
En cours OK 46 / 48
95,8% · réussite 21,7%
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
21,1/100 OpenCode Qwen3.6 Plus OpenCode Qwen3.6 Plus
fsacb
fsacb
En pause OK 46 / 48
95,8% · réussite 32,6%
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
31,5/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
traduction
traduction
En pause OK 46 / 48
95,8% · réussite 0,0%
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
0,0/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
todo_list
to-do-list_v1
En pause OK 46 / 48
95,8% · réussite 2,2%
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
14,3/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
page_libre
page_libre
En pause OK 46 / 48
95,8% · réussite 37,0%
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
31,6/100 — OpenRouter DeepSeek: DeepSeek V4 Flash

Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie

🔬 과학적 방법론

AI 모델 평가를 위한 엄격한 접근 방식

🔬

표준화된 테스트 프로토콜

각 모델은 엄격하고 재현 가능한 방법론에 따라 평가됩니다

1
📝 코드 생성

생성된 코드의 정적 분석, 단위 테스트 및 알고리즘 복잡성 평가

Qualité: 95% Performance: 88%
2
🎯 의미 정확도

질문 및 컨텍스트에 대한 응답의 관련성 평가

Exactitude: 92% Pertinence: 89%
3
⚡ 시간적 성능

응답 시간, 지연 시간 및 부하 관리 용량 측정

Vitesse: 1.2s Stabilité: 96%
4
🔄 문맥 일관성

긴 대화 및 복잡한 상호 작용에서 컨텍스트를 유지하는 능력

Mémoire: 85% Consistance: 91%

🏆 평가 기준

✅ 재현성 검증을 위해 3회 이상 테스트 반복
📊 정량적 지표 객관적이고 비교 가능한 숫자 점수
🔍 인간 평가 도메인 전문가의 검증
📈 비교 벤치마킹 참조 모델에 대한 상대적 분석