Publicamos os números, o método e as datas
Cada resultado na página de benchmarks é uma execução registada: o dataset, a versão, o teto de tokens, o prompt e o dia. Qualquer pessoa pode ir verificar.
É fácil dizer que um modelo é bom. Nós preferimos mostrar em que prova, com que amostra e em que dia — e deixar isso à vista para quem quiser conferir.
O que fica registado em cada corrida
O dataset e a versão, o número de tarefas, o teto de tokens, o prompt de sistema e a data. Nada é escrito à mão: os números da página saem da base de dados, e mudam sozinhos quando há uma corrida nova.
Datasets públicos, e um nosso
AIME 2025, MMLU-Pro, GSM8K, HumanEval, MBPP e IFEval — todos públicos, todos verificáveis. E o NexiBench português, que construímos porque nenhum dos outros mede português europeu.
Uma corrida que não se pôde medir com confiança não é publicada. Fica registada, e fora da página.
As comparações com modelos de outras empresas são medidas por nós sempre que conseguimos correr o modelo deles — mesma prova, mesmo corredor. O que não medimos vem citado, com ligação e data.