BenchVibe AI Ecosystem

VIP 👤

🏠 Strona Główna

Benchmarki

📊 Wszystkie benchmarki 🦖 Dinozaur v1 🦖 Dinozaur v2 ✅ Aplikacje To-Do List 🎨 Kreatywne wolne strony 🎯 FSACB - Ostateczny pokaz 🌍 Benchmark tłumaczeń

Modele

🏆 Top 10 modeli 🆓 Darmowe modele 📋 Wszystkie modele ⚙️ Kilo Code

Zasoby

💬 Biblioteka promptów 📖 Słownik AI 🔗 Przydatne linki

📖

Benchmarks et Évaluation

GSM8K

Dataset de 8.5 milliers de problèmes mathématiques textuels de niveau scolaire exigeant un raisonnement multi-étapes, évaluant la capacité des LLM à comprendre des problèmes en langage naturel et à générer des solutions mathématiques cohérentes.

← Wstecz