Nexi Air · avaliação fechada em 21 de setembro de 2026
Raciocínio máximo.
Resultados à vista.
14 219 tarefas, sete avaliações e raciocínio máximo. Publicamos os acertos e as limitações, com todas as primeiras tentativas no denominador.
Tarefas executadas
Avaliações
Raciocínio
Cobertura completa; execução com falhas. A recuperação atingiu o prazo. Estes são resultados internos do perfil de investigação, não uma certificação independente nem uma medição do modo rápido da app.
| Avaliação | Resultado | Limitações |
|---|---|---|
| AIME 2025 Matemática de competição · 30 problemas | 90% 27 / 30 | 2 respostas cortadas 2 sem avaliação booleana¹ |
| HumanEval Programação · execução de testes Python | 98,17% 161 / 164 | Sem falhas de execução |
| IFEval Seguir instruções · avaliador oficial, prompt estrito | 93,35% 505 / 541 | Sem falhas de execução |
| Português Avaliação interna · não é um benchmark independente | 88,43% 107 / 121 | Sem falhas de execução |
| GSM8K Problemas matemáticos · conjunto completo | 97,42% 1285 / 1319 | Sem falhas de execução |
| Contexto longo Recuperação sintética · amostra de 12 tarefas | 100% 12 / 12 | Sem falhas de execução |
| MMLU-Pro Conhecimento e raciocínio · 12 032 perguntas | 84,38% 10 153 / 12 032 | 58 falhas técnicas 44 respostas cortadas 104 sem avaliação booleana¹ |
¹ Inclui falhas técnicas e cortes; as categorias sobrepõem-se. Apenas respostas corretas e completas contam como acerto. Não calculamos uma média global entre testes diferentes.
O que aconteceu aos pedidos que falharam?
Repetimos os 58 pedidos com erros técnicos: 29 corretos, 17 incorretos, oito cortados e quatro interrompidos pelo prazo. Os resultados acima mantêm as primeiras tentativas. Estas repetições não aumentam a pontuação publicada.
Velocidade na L40S
Ensaios separados, em resposta direta. Não representam a velocidade do raciocínio máximo.
Geração com modelo carregado
46,69 tokens/s
Mediana de dois pedidos completos de prosa; intervalo 44,51–48,87 tokens/s.
Primeiro texto, já carregado
1,36 s
Teste curto de funcionamento: quatro tokens de saída.
Primeiro texto, arranque a frio
303,48 s
Mesmo teste curto. O objetivo de 25 segundos não foi atingido.
Metodologia, fontes e dados
Raciocínio nativo máximo, teto de 65 536 tokens, temperatura 1, top-p 0,95 e semente 20260916. Uma primeira tentativa por tarefa. IFEval usa o avaliador oficial; os 541 hashes de prompts e respostas foram verificados.
A campanha passou por hardware e paralelismo diferentes. Não juntamos as latências de todas as fases. Fotografias e análise de documentos reais não estão abrangidas por estas pontuações. Contexto configurado de 262 144 tokens não significa compreensão garantida de qualquer documento.
Descarregar resultados, condições e hashes (JSON)
Fontes: HumanEval, IFEval, MMLU-Pro. Os dados não incluem conversas de utilizadores nem respostas dos testes.
Arquivo · avaliação de 16 de setembro
Avaliação de 16 de setembro de 2026 · 1268 tarefas
Avaliação anterior do AIR.
Resultados da configuração testada em 16 de setembro. Contamos respostas incorretas, falhas e cortes no limite de saída. Uma resposta certa mas incompleta aparece separadamente.
| Teste | Corretas | Corretas e completas | Cortadas |
|---|---|---|---|
| HumanEval 164 problemas; pass@1, testes Python isolados. Cortadas: 0 | 154/164 93,9% | 154/164 93,9% | 0 |
| IFEval estrito 541 pedidos; avaliador oficial Google, prompts canónicos. Cortadas: 14 | 450/541 83,2% | 441/541 81,5% | 14 |
| GSM8K Amostra de 200 dos 1319 problemas. Cortadas: 1 | 194/200 97% | 194/200 97% | 1 |
| MMLU-Pro Amostra de 200 dos 12032 problemas, abrangendo 14 áreas. Cortadas: 14 | 168/200 84% | 163/200 81,5% | 14 |
| AIME 2025 30 problemas; raciocínio limitado a 2048 tokens. Cortadas: 13 | 15/30 50% | 15/30 50% | 13 |
| Português europeu 121 tarefas internas; avaliador estrito com falsos negativos conhecidos. Cortadas: 0 | 101/121 83,5% | 101/121 83,5% | 0 |
| Recuperação em contexto 12 tarefas, 7448–86097 tokens de entrada; não mede compreensão geral de documentos. Cortadas: 0 | 12/12 100% | 12/12 100% | 0 |
Velocidade com o serviço já ligado
1 pedido
29,7 tokens/s no total
Primeira resposta: 2,1 s de mediana
P95: 2,12 s · 3 pedidos
2 pedidos simultâneos
50,6 tokens/s no total
Primeira resposta: 2,17 s de mediana
P95: 3,96 s · 6 pedidos
4 pedidos simultâneos
74,9 tokens/s no total
Primeira resposta: 3,98 s de mediana
P95: 7,48 s · 12 pedidos
Três lotes por nível de concorrência, 21 respostas completas. O ritmo inclui preparação e fila. Amostra pequena; não é uma garantia de latência.
Limitações que os testes encontraram
- Arranque com o serviço desligado: 344,5 segundos até à primeira resposta, mesmo com cache. O objetivo de 25 segundos não foi atingido.
- Recuperação com 260 065 tokens de entrada: passou, mas a primeira resposta demorou 361,9 segundos. Não prova compreensão de qualquer documento longo.
- O modelo ainda falha comprimentos exatos e alguns formatos de escrita. Fotografias e documentos não fizeram parte destas provas de qualidade.
Metodologia e dados
Uma tentativa por tarefa em cada execução, temperatura 0, semente 20260916. AIME usa raciocínio máximo com orçamento de 2048 tokens; as outras suites usam raciocínio desligado. O teto de saída do produto é 4096 tokens; cada suite pode aplicar um teto inferior. Não escolhemos a melhor de várias respostas.
HumanEval foi reavaliado com os mesmos textos para preservar os auxiliares fornecidos nos problemas. IFEval usa o avaliador oficial e os prompts canónicos. MMLU-Pro usa uma amostra do banco completo; o ensaio anterior limitado a duas áreas não entra nestes números. Português usa avaliação interna, ainda com falsos negativos conhecidos.
Esta avaliação não entra no ranking histórico abaixo: versões, amostras e orçamentos diferem. Não calculamos uma pontuação global entre provas diferentes.
Abaixo: avaliações anteriores dos restantes modelos, com as respetivas datas e condições.
Abaixo: avaliações históricas dos outros modelos, com as respetivas datas e condições. Não são uma comparação direta com esta campanha.
Avaliações anteriores dos restantes modelos.
Cada número vem de uma execução registada — guardamos a data, a versão do dataset, o teto de tokens e o prompt de sistema. Nada aqui é escrito à mão, e uma corrida que não se pôde medir com confiança não é publicada.
Em duas linhas
Um benchmark é um exame igual para todos: as mesmas perguntas, a mesma correção. Serve para comparar modelos sem depender da opinião de ninguém.
Aqui estão os exames que fizemos aos nossos modelos, com o resultado tal como saiu — incluindo o que correu mal. Os números de outras empresas não são nossos: vêm de quem as avalia, com a ligação e a data ao lado para poderes ir confirmar.
Contra os modelos de topo
Nos mesmos benchmarks. Os números deles são publicados por quem os avalia, com ligação e data de consulta — não corremos os modelos de outras empresas. As amostras podem não ser as mesmas, e por isso uma diferença de um ou dois pontos não é um resultado.
MMLU-Pro
Medido por nós: 1000 tarefas · citados: suite completaAs amostras não são iguais: uma diferença de um ou dois pontos entre uma barra nossa e uma citada cabe no erro de amostragem e não é um resultado.
Claude Fable 5 | Anthropic | 91.5% | medido pela Vals AI · suite completa · ±0,28 |
Claude Opus 4.8 | Anthropic | 89.6% | medido pela Vals AI |
Grok 4.6 | xAI | 89.4% | medido pela Vals AI · suite completa · ±0,30 |
Qwen 3.7 Max | Qwen | 89.3% | medido pela Vals AI · suite completa · ±0,30 |
GPT-5.6 Sol | OpenAI | 89.1% | medido pela Vals AI · suite completa · ±0,31 |
Nexi Nova 1raciocínio | NexiChat | 88.3% | 1000 tarefas · 60 por avaliar — 83.0% se contassem como erradas |
Nexi Prime 1 | NexiChat | 81.2% | 1000 tarefas, medido por nós |
Modelos nestas avaliações
O score geral é a média das médias por categoria — assim o peso de cada competência não muda quando se acrescentam suites a uma delas.
Testes destas avaliações
Cada suite pelo nome, com a origem e o número de tarefas. As duas que têm comparação com outras empresas estão lá em cima; estas são as nossas medições.
AIME 2025
Matemáticamath-ai/aime25 (HuggingFace) · 30 tarefas na suite
- Nexi Nova 1100.0%
- Nexi Prime 150.0%
Sem comparação: a Artificial Analysis marcou-o Legacy e a Vals AI deixou de o correr em modelos novos — os melhores ficam todos entre 95% e 99% e o teste deixou de os separar.
MMLU-Pro
ConhecimentoTIGER-Lab/MMLU-Pro (HuggingFace) · 12032 tarefas na suite
- Nexi Nova 188.3%
- Nexi Prime 181.2%
Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.
GSM8K
Matemáticaopenai/gsm8k (HuggingFace) · 1319 tarefas na suite
- Nexi Nova 199.0%
- Nexi Prime 197.0%
Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.
HumanEval
Programaçãoopenai/openai_humaneval (HuggingFace) · 164 tarefas na suite
- Nexi Nova 193.9%
- Nexi Prime 191.5%
MBPP
Programaçãogoogle-research-datasets/mbpp (HuggingFace) · 500 tarefas na suite
- Nexi Nova 192.5%
- Nexi Prime 185.5%
Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.
IFEval
Seguir instruçõesgoogle/IFEval (HuggingFace) · 541 tarefas na suite
- Nexi Nova 184.4%
- Nexi Prime 179.0%
Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.
NexiBench · portuguese
Portuguêsinterno (NexiAgent)
- Nexi Nova 197.5%
- Nexi Prime 195.0%
Contexto longo · agulha no palheiro
Contexto longointerno (NexiAgent) — gerado na corrida, sem dataset
- Nexi Nova 1100.0%
- Nexi Prime 1100.0%
Metodologia das avaliações anteriores
De onde vêm as perguntas, sob que licença, e o que conta como acerto.
O score de cada suite é a percentagem de acerto sobre as tarefas que foi possível avaliar. As que não foi — um formato que o avaliador não reconheceu, um erro do fornecedor — ficam contadas à parte e nunca como erro do modelo.
Uma corrida em que mais de metade das tarefas ficou por avaliar, ou em que mais de 10% foram cortadas no nosso teto de tokens, não é publicada. Um teto que corta as perguntas difíceis mede o teto, não o modelo.
A velocidade é medida durante as corridas, com vários pedidos em paralelo — logo subestima o que uma pessoa sozinha vê. Serve para comparar modelos entre si, não como promessa de latência.
Os números de outras empresas são sempre citados, com ligação e data de consulta. Não corremos os modelos deles: um número nosso sobre o produto de quem compete connosco é uma afirmação que ninguém tem como verificar, e valeria menos do que a fonte que citamos. A barra tramada diz isso à velocidade a que se olha para o gráfico.
Esta comparação não inclui modelos da Google, por decisão de quem faz o produto. Não é uma afirmação sobre eles: alguns pontuam acima dos nossos nas mesmas provas, e quem quiser vê-los encontra-os nas fontes que citamos.
| Suite | Categoria | Origem | Licença | Total oficial |
|---|---|---|---|---|
| AIME 2025 | Matemática | math-ai/aime25 (HuggingFace) | exame público — MAA | 30 |
| MMLU-Pro | Conhecimento | TIGER-Lab/MMLU-Pro (HuggingFace) | MIT | 12032 |
| GSM8K | Matemática | openai/gsm8k (HuggingFace) | MIT | 1319 |
| HumanEval | Programação | openai/openai_humaneval (HuggingFace) | MIT | 164 |
| MBPP | Programação | google-research-datasets/mbpp (HuggingFace) | CC BY 4.0 | 500 |
| IFEval | Seguir instruções | google/IFEval (HuggingFace) | Apache 2.0 | 541 |
| NexiBench · portuguese | Português | interno (NexiAgent) | proprietário — não publicado, para não contaminar treinos | — |
| Contexto longo · agulha no palheiro | Contexto longo | interno (NexiAgent) — gerado na corrida, sem dataset | documento sintético, reconstruível a partir da semente | — |
Ainda por correr
O corredor sabe correr estas, e elas ainda não produziram nenhum número. Ficam aqui declaradas em vez de sairem da lista:
- GPQA Diamond· o dataset é de acesso restrito — é preciso aceitar os termos dos autores numa conta própria
- NexiBench · reasoning· o ficheiro de perguntas ainda não foi escrito
- NexiBench · coding· o ficheiro de perguntas ainda não foi escrito
- NexiBench · math· o ficheiro de perguntas ainda não foi escrito
- NexiBench · knowledge· o ficheiro de perguntas ainda não foi escrito
- NexiBench · instruction-following· o ficheiro de perguntas ainda não foi escrito
Última avaliação: 2026-09-21T22:56:07.474265+00:00. Todos os resultados vêm de execuções registadas.