Saltar para o conteúdo
Artigos
Benchmarks· 2 min de leitura

Publicamos os números, o método e as datas

Cada resultado na página de benchmarks é uma execução registada: o dataset, a versão, o teto de tokens, o prompt e o dia. Qualquer pessoa pode ir verificar.

É fácil dizer que um modelo é bom. Nós preferimos mostrar em que prova, com que amostra e em que dia — e deixar isso à vista para quem quiser conferir.

O que fica registado em cada corrida

O dataset e a versão, o número de tarefas, o teto de tokens, o prompt de sistema e a data. Nada é escrito à mão: os números da página saem da base de dados, e mudam sozinhos quando há uma corrida nova.

Datasets públicos, e um nosso

AIME 2025, MMLU-Pro, GSM8K, HumanEval, MBPP e IFEval — todos públicos, todos verificáveis. E o NexiBench português, que construímos porque nenhum dos outros mede português europeu.

Uma corrida que não se pôde medir com confiança não é publicada. Fica registada, e fora da página.

As comparações com modelos de outras empresas são medidas por nós sempre que conseguimos correr o modelo deles — mesma prova, mesmo corredor. O que não medimos vem citado, com ligação e data.