Saltar para o conteúdo

Nexi Air · avaliação fechada em 21 de setembro de 2026

Raciocínio máximo.
Resultados à vista.

14 219 tarefas, sete avaliações e raciocínio máximo. Publicamos os acertos e as limitações, com todas as primeiras tentativas no denominador.

14 219

Tarefas executadas

7

Avaliações

Máximo

Raciocínio

Cobertura completa; execução com falhas. A recuperação atingiu o prazo. Estes são resultados internos do perfil de investigação, não uma certificação independente nem uma medição do modo rápido da app.

Nexi Air com raciocínio máximo — Corretas e completas, incluindo todas as primeiras tentativas
AvaliaçãoResultadoLimitações
AIME 2025

Matemática de competição · 30 problemas

90%

27 / 30

2 respostas cortadas

2 sem avaliação booleana¹

HumanEval

Programação · execução de testes Python

98,17%

161 / 164

Sem falhas de execução

IFEval

Seguir instruções · avaliador oficial, prompt estrito

93,35%

505 / 541

Sem falhas de execução

Português

Avaliação interna · não é um benchmark independente

88,43%

107 / 121

Sem falhas de execução

GSM8K

Problemas matemáticos · conjunto completo

97,42%

1285 / 1319

Sem falhas de execução

Contexto longo

Recuperação sintética · amostra de 12 tarefas

100%

12 / 12

Sem falhas de execução

MMLU-Pro

Conhecimento e raciocínio · 12 032 perguntas

84,38%

10 153 / 12 032

58 falhas técnicas

44 respostas cortadas

104 sem avaliação booleana¹

¹ Inclui falhas técnicas e cortes; as categorias sobrepõem-se. Apenas respostas corretas e completas contam como acerto. Não calculamos uma média global entre testes diferentes.

O que aconteceu aos pedidos que falharam?

Repetimos os 58 pedidos com erros técnicos: 29 corretos, 17 incorretos, oito cortados e quatro interrompidos pelo prazo. Os resultados acima mantêm as primeiras tentativas. Estas repetições não aumentam a pontuação publicada.

Velocidade na L40S

Ensaios separados, em resposta direta. Não representam a velocidade do raciocínio máximo.

Geração com modelo carregado

46,69 tokens/s

Mediana de dois pedidos completos de prosa; intervalo 44,51–48,87 tokens/s.

Primeiro texto, já carregado

1,36 s

Teste curto de funcionamento: quatro tokens de saída.

Primeiro texto, arranque a frio

303,48 s

Mesmo teste curto. O objetivo de 25 segundos não foi atingido.

Metodologia, fontes e dados

Raciocínio nativo máximo, teto de 65 536 tokens, temperatura 1, top-p 0,95 e semente 20260916. Uma primeira tentativa por tarefa. IFEval usa o avaliador oficial; os 541 hashes de prompts e respostas foram verificados.

A campanha passou por hardware e paralelismo diferentes. Não juntamos as latências de todas as fases. Fotografias e análise de documentos reais não estão abrangidas por estas pontuações. Contexto configurado de 262 144 tokens não significa compreensão garantida de qualquer documento.

Descarregar resultados, condições e hashes (JSON)

Fontes: HumanEval, IFEval, MMLU-Pro. Os dados não incluem conversas de utilizadores nem respostas dos testes.

Arquivo · avaliação de 16 de setembro

Avaliação de 16 de setembro de 2026 · 1268 tarefas

Avaliação anterior do AIR.

Resultados da configuração testada em 16 de setembro. Contamos respostas incorretas, falhas e cortes no limite de saída. Uma resposta certa mas incompleta aparece separadamente.

Qualidade do Nexi Air: respostas corretas e respostas corretas completas
TesteCorretasCorretas e completas
HumanEval

164 problemas; pass@1, testes Python isolados.

Cortadas: 0

154/164
93,9%
154/164
93,9%
IFEval estrito

541 pedidos; avaliador oficial Google, prompts canónicos.

Cortadas: 14

450/541
83,2%
441/541
81,5%
GSM8K

Amostra de 200 dos 1319 problemas.

Cortadas: 1

194/200
97%
194/200
97%
MMLU-Pro

Amostra de 200 dos 12032 problemas, abrangendo 14 áreas.

Cortadas: 14

168/200
84%
163/200
81,5%
AIME 2025

30 problemas; raciocínio limitado a 2048 tokens.

Cortadas: 13

15/30
50%
15/30
50%
Português europeu

121 tarefas internas; avaliador estrito com falsos negativos conhecidos.

Cortadas: 0

101/121
83,5%
101/121
83,5%
Recuperação em contexto

12 tarefas, 7448–86097 tokens de entrada; não mede compreensão geral de documentos.

Cortadas: 0

12/12
100%
12/12
100%

Velocidade com o serviço já ligado

1 pedido

29,7 tokens/s no total

Primeira resposta: 2,1 s de mediana

P95: 2,12 s · 3 pedidos

2 pedidos simultâneos

50,6 tokens/s no total

Primeira resposta: 2,17 s de mediana

P95: 3,96 s · 6 pedidos

4 pedidos simultâneos

74,9 tokens/s no total

Primeira resposta: 3,98 s de mediana

P95: 7,48 s · 12 pedidos

Três lotes por nível de concorrência, 21 respostas completas. O ritmo inclui preparação e fila. Amostra pequena; não é uma garantia de latência.

Limitações que os testes encontraram

  • Arranque com o serviço desligado: 344,5 segundos até à primeira resposta, mesmo com cache. O objetivo de 25 segundos não foi atingido.
  • Recuperação com 260 065 tokens de entrada: passou, mas a primeira resposta demorou 361,9 segundos. Não prova compreensão de qualquer documento longo.
  • O modelo ainda falha comprimentos exatos e alguns formatos de escrita. Fotografias e documentos não fizeram parte destas provas de qualidade.
Metodologia e dados

Uma tentativa por tarefa em cada execução, temperatura 0, semente 20260916. AIME usa raciocínio máximo com orçamento de 2048 tokens; as outras suites usam raciocínio desligado. O teto de saída do produto é 4096 tokens; cada suite pode aplicar um teto inferior. Não escolhemos a melhor de várias respostas.

HumanEval foi reavaliado com os mesmos textos para preservar os auxiliares fornecidos nos problemas. IFEval usa o avaliador oficial e os prompts canónicos. MMLU-Pro usa uma amostra do banco completo; o ensaio anterior limitado a duas áreas não entra nestes números. Português usa avaliação interna, ainda com falsos negativos conhecidos.

Esta avaliação não entra no ranking histórico abaixo: versões, amostras e orçamentos diferem. Não calculamos uma pontuação global entre provas diferentes.

Descarregar resultados e identificação da evidência (JSON)

Referências: HumanEval, IFEval e MMLU-Pro.

Abaixo: avaliações anteriores dos restantes modelos, com as respetivas datas e condições.

Abaixo: avaliações históricas dos outros modelos, com as respetivas datas e condições. Não são uma comparação direta com esta campanha.

Resultados medidos

Avaliações anteriores dos restantes modelos.

Cada número vem de uma execução registada — guardamos a data, a versão do dataset, o teto de tokens e o prompt de sistema. Nada aqui é escrito à mão, e uma corrida que não se pôde medir com confiança não é publicada.

Em duas linhas

Um benchmark é um exame igual para todos: as mesmas perguntas, a mesma correção. Serve para comparar modelos sem depender da opinião de ninguém.

Aqui estão os exames que fizemos aos nossos modelos, com o resultado tal como saiu — incluindo o que correu mal. Os números de outras empresas não são nossos: vêm de quem as avalia, com a ligação e a data ao lado para poderes ir confirmar.

Modelos
2
Suites medidas
8
Corridas publicadas
16
Melhor score geral
93.8
Nexi Nova 1

Contra os modelos de topo

Nos mesmos benchmarks. Os números deles são publicados por quem os avalia, com ligação e data de consulta — não corremos os modelos de outras empresas. As amostras podem não ser as mesmas, e por isso uma diferença de um ou dois pontos não é um resultado.

medido por nóscitado

MMLU-Pro

Medido por nós: 1000 tarefas · citados: suite completa
91.5%
Claude Fable 5
89.6%
Claude Opus 4.8
89.4%
Grok 4.6
89.3%
Qwen 3.7 Max
89.1%
GPT-5.6 Sol
88.3%
Nexi Nova 1
81.2%
Nexi Prime 1

As amostras não são iguais: uma diferença de um ou dois pontos entre uma barra nossa e uma citada cabe no erro de amostragem e não é um resultado.

Claude Fable 5
91.5%medido pela Vals AI · suite completa · ±0,28
Claude Opus 4.8
89.6%medido pela Vals AI
Grok 4.6
89.4%medido pela Vals AI · suite completa · ±0,30
Qwen 3.7 Max
89.3%medido pela Vals AI · suite completa · ±0,30
GPT-5.6 Sol
89.1%medido pela Vals AI · suite completa · ±0,31
Nexi Nova 1raciocínio
88.3%1000 tarefas · 60 por avaliar — 83.0% se contassem como erradas
Nexi Prime 1
81.2%1000 tarefas, medido por nós

Modelos nestas avaliações

O score geral é a média das médias por categoria — assim o peso de cada competência não muda quando se acrescentam suites a uma delas.

Contexto longo100.0
Matemática99.5
Português97.5
Programação93.2
Conhecimento88.3
Seguir instruções84.4
Contexto longo100.0
Matemática73.5
Português95.0
Programação88.5
Conhecimento81.2
Seguir instruções79.0

Testes destas avaliações

Cada suite pelo nome, com a origem e o número de tarefas. As duas que têm comparação com outras empresas estão lá em cima; estas são as nossas medições.

AIME 2025

Matemática

math-ai/aime25 (HuggingFace) · 30 tarefas na suite

  • Nexi Nova 1100.0%
  • Nexi Prime 150.0%

Sem comparação: a Artificial Analysis marcou-o Legacy e a Vals AI deixou de o correr em modelos novos — os melhores ficam todos entre 95% e 99% e o teste deixou de os separar.

MMLU-Pro

Conhecimento

TIGER-Lab/MMLU-Pro (HuggingFace) · 12032 tarefas na suite

  • Nexi Nova 188.3%
  • Nexi Prime 181.2%

Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.

GSM8K

Matemática

openai/gsm8k (HuggingFace) · 1319 tarefas na suite

  • Nexi Nova 199.0%
  • Nexi Prime 197.0%

Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.

HumanEval

Programação

openai/openai_humaneval (HuggingFace) · 164 tarefas na suite

  • Nexi Nova 193.9%
  • Nexi Prime 191.5%

MBPP

Programação

google-research-datasets/mbpp (HuggingFace) · 500 tarefas na suite

  • Nexi Nova 192.5%
  • Nexi Prime 185.5%

Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.

IFEval

Seguir instruções

google/IFEval (HuggingFace) · 541 tarefas na suite

  • Nexi Nova 184.4%
  • Nexi Prime 179.0%

Corremos uma amostra e não a suite inteira — o número de tarefas de cada corrida está na ficha de cada modelo, acima.

NexiBench · portuguese

Português

interno (NexiAgent)

  • Nexi Nova 197.5%
  • Nexi Prime 195.0%

Contexto longo · agulha no palheiro

Contexto longo

interno (NexiAgent) — gerado na corrida, sem dataset

  • Nexi Nova 1100.0%
  • Nexi Prime 1100.0%

Metodologia das avaliações anteriores

De onde vêm as perguntas, sob que licença, e o que conta como acerto.

O score de cada suite é a percentagem de acerto sobre as tarefas que foi possível avaliar. As que não foi — um formato que o avaliador não reconheceu, um erro do fornecedor — ficam contadas à parte e nunca como erro do modelo.

Uma corrida em que mais de metade das tarefas ficou por avaliar, ou em que mais de 10% foram cortadas no nosso teto de tokens, não é publicada. Um teto que corta as perguntas difíceis mede o teto, não o modelo.

A velocidade é medida durante as corridas, com vários pedidos em paralelo — logo subestima o que uma pessoa sozinha vê. Serve para comparar modelos entre si, não como promessa de latência.

Os números de outras empresas são sempre citados, com ligação e data de consulta. Não corremos os modelos deles: um número nosso sobre o produto de quem compete connosco é uma afirmação que ninguém tem como verificar, e valeria menos do que a fonte que citamos. A barra tramada diz isso à velocidade a que se olha para o gráfico.

Esta comparação não inclui modelos da Google, por decisão de quem faz o produto. Não é uma afirmação sobre eles: alguns pontuam acima dos nossos nas mesmas provas, e quem quiser vê-los encontra-os nas fontes que citamos.

SuiteCategoriaOrigemLicençaTotal oficial
AIME 2025Matemáticamath-ai/aime25 (HuggingFace)exame público — MAA30
MMLU-ProConhecimentoTIGER-Lab/MMLU-Pro (HuggingFace)MIT12032
GSM8KMatemáticaopenai/gsm8k (HuggingFace)MIT1319
HumanEvalProgramaçãoopenai/openai_humaneval (HuggingFace)MIT164
MBPPProgramaçãogoogle-research-datasets/mbpp (HuggingFace)CC BY 4.0500
IFEvalSeguir instruçõesgoogle/IFEval (HuggingFace)Apache 2.0541
NexiBench · portuguesePortuguêsinterno (NexiAgent)proprietário — não publicado, para não contaminar treinos—
Contexto longo · agulha no palheiroContexto longointerno (NexiAgent) — gerado na corrida, sem datasetdocumento sintético, reconstruível a partir da semente—

Ainda por correr

O corredor sabe correr estas, e elas ainda não produziram nenhum número. Ficam aqui declaradas em vez de sairem da lista:

  • GPQA Diamond· o dataset é de acesso restrito — é preciso aceitar os termos dos autores numa conta própria
  • NexiBench · reasoning· o ficheiro de perguntas ainda não foi escrito
  • NexiBench · coding· o ficheiro de perguntas ainda não foi escrito
  • NexiBench · math· o ficheiro de perguntas ainda não foi escrito
  • NexiBench · knowledge· o ficheiro de perguntas ainda não foi escrito
  • NexiBench · instruction-following· o ficheiro de perguntas ainda não foi escrito

Última avaliação: 2026-09-21T22:56:07.474265+00:00. Todos os resultados vêm de execuções registadas.