VIP 👤
🏠 Início
Avaliações
📊 Todos os Benchmarks 🦖 Dinossauro v1 🦖 Dinossauro v2 ✅ Aplicações To-Do List 🎨 Páginas Livres Criativas 🎯 FSACB - Showcase Definitivo 🌍 Benchmark de Tradução
Modelos
🏆 Top 10 Modelos 🆓 Modelos Gratuitos 📋 Todos os Modelos ⚙️ Kilo Code
Recursos
💬 Biblioteca de Prompts 📖 Glossário de IA 🔗 Links Úteis 🔌 APIs e roteadores

📡 Rapports en ligne

Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.

Lecture de secours Worker running OK 230/240 modèles traités Suivi du prompt Score prompt moyen 19,7/100

Dernière actualisation : 2026-05-19 18:29:07

Benchmark État Santé Progression Suivi du prompt Score prompt En cours Prochain
dinosaure_v2
dinosaure_tests_v2_3pages
En cours OK 46 / 48
95,8% · réussite 21,7%
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
21,1/100 OpenCode Qwen3.6 Plus OpenCode Qwen3.6 Plus
fsacb
fsacb
En pause OK 46 / 48
95,8% · réussite 32,6%
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
31,5/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
traduction
traduction
En pause OK 46 / 48
95,8% · réussite 0,0%
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
0,0/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
todo_list
to-do-list_v1
En pause OK 46 / 48
95,8% · réussite 2,2%
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
14,3/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
page_libre
page_libre
En pause OK 46 / 48
95,8% · réussite 37,0%
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
31,6/100 — OpenRouter DeepSeek: DeepSeek V4 Flash

Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie

🔬 Metodologia Científica

Nossa abordagem rigorosa para avaliar modelos de inteligência artificial

🔬

Protocolo de Teste Padronizado

Cada modelo é avaliado segundo uma metodologia rigorosa e reproduzível

1
📝 Geração de Código

Análise estática do código gerado, testes unitários e avaliação da complexidade algorítmica

Qualité: 95% Performance: 88%
2
🎯 Precisão Semântica

Avaliação da relevância das respostas às perguntas e contexto

Exactitude: 92% Pertinence: 89%
3
⚡ Performance Temporal

Medição dos tempos de resposta, latência e capacidade de gestão de carga

Vitesse: 1.2s Stabilité: 96%
4
🔄 Coerência Contextual

Capacidade de manter o contexto ao longo de conversas longas e interações complexas

Mémoire: 85% Consistance: 91%

🏆 Padrões de Avaliação

✅ Reprodutibilidade Testes repetidos 3+ vezes para validação
📊 Métricas Quantitativas Pontuações numéricas objetivas e comparáveis
🔍 Avaliação Humana Validação por especialistas do domínio
📈 Benchmarking Comparativo Análise relativa a modelos de referência