📡 Rapports en ligne
Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.
Dernière actualisation : 2026-05-19 18:29:07
| Benchmark | État | Santé | Progression | Suivi du prompt | Score prompt | En cours | Prochain |
|---|---|---|---|---|---|---|---|
|
dinosaure_v2
dinosaure_tests_v2_3pages
|
En cours | OK |
46 / 48
95,8% · réussite 21,7%
|
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
|
21,1/100 | OpenCode Qwen3.6 Plus | OpenCode Qwen3.6 Plus |
|
fsacb
fsacb
|
En pause | OK |
46 / 48
95,8% · réussite 32,6%
|
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
|
31,5/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
traduction
traduction
|
En pause | OK |
46 / 48
95,8% · réussite 0,0%
|
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
|
0,0/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
todo_list
to-do-list_v1
|
En pause | OK |
46 / 48
95,8% · réussite 2,2%
|
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
|
14,3/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
|
page_libre
page_libre
|
En pause | OK |
46 / 48
95,8% · réussite 37,0%
|
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
|
31,6/100 | — | OpenRouter DeepSeek: DeepSeek V4 Flash |
Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie
🦖 공룡 테스트 v1 & v2
전체 벤치마크: 심층 역량 평가를 통해 테스트된 58개의 AI 모델
🎯 고급 벤치마크
AI 역량 평가를 위한 심층적이고 전문적인 테스트
📱 실용적 애플리케이션
실용 테스트 및 기능 평가를 위한 AI 생성 애플리케이션
🔬 과학적 방법론
AI 모델 평가를 위한 엄격한 접근 방식
표준화된 테스트 프로토콜
각 모델은 엄격하고 재현 가능한 방법론에 따라 평가됩니다
📝 코드 생성
생성된 코드의 정적 분석, 단위 테스트 및 알고리즘 복잡성 평가
🎯 의미 정확도
질문 및 컨텍스트에 대한 응답의 관련성 평가
⚡ 시간적 성능
응답 시간, 지연 시간 및 부하 관리 용량 측정
🔄 문맥 일관성
긴 대화 및 복잡한 상호 작용에서 컨텍스트를 유지하는 능력