Avaliação e Métricas
Benchmark MMLU (Massive Multitask Language Understanding)
Benchmark abrangente projetado para medir o conhecimento e as capacidades de compreensão de um LLM em uma ampla gama de 57 tópicos, desde matemática elementar até direito americano e história. Ele avalia a capacidade do modelo de responder a perguntas de múltipla escolha.
← Voltar