VIP 👤
🏠 首页
基准测试
📊 所有基准测试 🦖 恐龙 v1 🦖 恐龙 v2 ✅ 待办事项应用 🎨 创意自由页面 🎯 FSACB - 终极展示 🌍 翻译基准测试
模型
🏆 前 10 名模型 🆓 免费模型 📋 所有模型 ⚙️ 🛠️ 千行代码模式
资源
💬 💬 提示库 📖 📖 AI 词汇表 🔗 🔗 有用链接 🔌 AI API 与路由器

📡 Rapports en ligne

Lecture live du moniteur BenchVibe. Le signal de suivi du prompt permet de distinguer une vraie tentative d’un résultat hors sujet ou vide.

Lecture de secours Worker running OK 230/240 modèles traités Suivi du prompt Score prompt moyen 19,7/100

Dernière actualisation : 2026-05-19 18:29:07

Benchmark État Santé Progression Suivi du prompt Score prompt En cours Prochain
dinosaure_v2
dinosaure_tests_v2_3pages
En cours OK 46 / 48
95,8% · réussite 21,7%
Suivi du prompt
10 suivis · 2 partiels · 0 hors sujet · 36 sans sortie
21,1/100 OpenCode Qwen3.6 Plus OpenCode Qwen3.6 Plus
fsacb
fsacb
En pause OK 46 / 48
95,8% · réussite 32,6%
Suivi du prompt
15 suivis · 1 partiels · 0 hors sujet · 32 sans sortie
31,5/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
traduction
traduction
En pause OK 46 / 48
95,8% · réussite 0,0%
Aucune sortie
0 suivis · 0 partiels · 0 hors sujet · 48 sans sortie
0,0/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
todo_list
to-do-list_v1
En pause OK 46 / 48
95,8% · réussite 2,2%
Suivi du prompt
1 suivis · 10 partiels · 0 hors sujet · 37 sans sortie
14,3/100 — OpenRouter DeepSeek: DeepSeek V4 Flash
page_libre
page_libre
En pause OK 46 / 48
95,8% · réussite 37,0%
Suivi du prompt
15 suivis · 2 partiels · 0 hors sujet · 31 sans sortie
31,6/100 — OpenRouter DeepSeek: DeepSeek V4 Flash

Résumé global: 230 traités sur 240 modèles · 41 suivis · 15 tentatives réelles · 184 sans sortie

🔬 科学方法

我们评估人工智能模型的严谨方法

🔬

标准化测试协议

每个模型都按照严谨且可重复的方法进行评估

1
📝 代码生成

生成代码的静态分析、单元测试和算法复杂度评估

Qualité: 95% Performance: 88%
2
🎯 语义精确度

评估回答与问题及上下文的相关性

Exactitude: 92% Pertinence: 89%
3
⚡ 时间性能

测量响应时间、延迟和负载管理能力

Vitesse: 1.2s Stabilité: 96%
4
🔄 上下文连贯性

在长时间对话和复杂交互中保持上下文的能力

Mémoire: 85% Consistance: 91%

🏆 评估标准

✅ 可重复性 重复测试3次以上以进行验证
📊 定量指标 客观且可比较的数字分数
🔍 人工评估 领域专家验证
📈 对比基准测试 与参考模型的相对分析