NVIDIA Nemotron 3 Ultra: 550B open, indice 48 e contesto 1M

NVIDIA ha rilasciato Nemotron 3 Ultra, modello MoE open-weights da 550 miliardi di parametri (55 attivi) con architettura ibrida Mamba-Transformer, contesto da 1 milione di token e rilascio completo di pesi, dataset e ricette. Con un punteggio di 48 sull'Intelligence Index di Artificial Analysis è il modello open statunitense più intelligente al lancio.

C. Petrolillo Redazione
5 min di lettura
27 Giugno 2026
Illustrazione a spirale verde su NVIDIA Nemotron 3 Ultra

NVIDIA ha rilasciato il 4 giugno 2026 Nemotron 3 Ultra, il modello più grande e capace della famiglia Nemotron 3. È un modello Mixture-of-Experts (MoE) da 550 miliardi di parametri totali e 55 miliardi attivi per token, costruito su un’architettura ibrida Mamba-Transformer e distribuito con pesi, dataset di addestramento e ricette aperti sotto licenza OpenMDW-1.1. Supporta una finestra di contesto fino a 1 milione di token e, secondo le misurazioni di Artificial Analysis, al lancio è il modello open-weights statunitense più intelligente.

550 miliardi di parametri totali e 55 attivi: l’architettura ibrida Mamba-Transformer

Crediti: NVIDIA

Parlammo di Nemotron 3 qui, ma Nemotron 3 Ultra adotta un’architettura Mamba2-Transformer ibrida con Latent Mixture-of-Experts (LatentMoE): i token vengono proiettati in una dimensione latente più piccola prima dell’instradamento verso gli esperti, una scelta che migliora l’accuratezza per byte di calcolo. Il modello instrada i token attraverso 512 esperti con selezione top-22 e mantiene attivi circa 55 dei 550 miliardi di parametri totali, una sparsità di circa il 10% che è la leva principale dietro la sua velocità.

A differenza dei modelli Nano e Super, Ultra integra livelli di Multi-Token Prediction (MTP) per una generazione più rapida tramite decodifica speculativa nativa. Il pre-addestramento è stato condotto con ricetta NVFP4 su circa 20 mila miliardi di token, con dati fino a settembre 2025; l’addestramento è avvenuto tra dicembre 2025 e aprile 2026 su cluster NVIDIA con Megatron-LM. Il modello supporta l’inglese, altre 11 lingue e 43 linguaggi di programmazione.

Le caratteristiche chiave di Nemotron 3 Ultra

  • Architettura Mixture-of-Experts ibrida Mamba-Attention.
  • LatentMoE per migliorare l’accuratezza.
  • Livelli MTP per un’inferenza più veloce tramite decodifica speculativa nativa.
  • Controllo del budget di ragionamento in fase di inferenza.
  • Pre-addestramento in NVFP4.
  • Post-addestramento con pipeline avanzata che combina Supervised Fine-Tuning (SFT), Reinforcement Learning (RL) e Multi-teacher On-Policy Distillation (MOPD).

Nella MOPD oltre dieci modelli insegnanti specializzati per dominio valutano le risposte del modello studente in una pipeline asincrona e vengono periodicamente riaddestrati a partire dai checkpoint aggiornati dello studente. Poiché NVIDIA ha rilasciato anche i corpus SFT e RL insieme ai pesi, questa parte della pipeline è in misura significativa riproducibile.

Throughput fino a 5,9 volte superiore e contesto da 1 milione di token

Sul setting 8k token in ingresso / 64k in uscita, NVIDIA dichiara per Nemotron 3 Ultra un throughput di inferenza rispettivamente 5,9x, 4,8x e 1,6x superiore a GLM-5.1-754B-A40B, Kimi-K2.6-1T-A32B e Qwen-3.5-397B-17B. Su endpoint pre-rilascio il modello è stato servito a oltre 300-400 token al secondo, più velocemente di gpt-oss-120b pur essendo oltre quattro volte più grande.

La finestra di contesto arriva a 1 milione di token e il modello supera gli altri LLM open di riferimento su RULER a 1M. Va però tenuto presente che il milione di token è il limite architetturale, non una garanzia operativa: diversi provider servono finestre più ridotte per ragioni di costo e latenza, quindi conviene verificare il contesto effettivamente disponibile sull’endpoint scelto prima di progettare pipeline a contesto lungo.

Pesi, dataset e ricette: il rilascio open source completo

NVIDIA distribuisce i checkpoint pre-addestrati, post-addestrati e quantizzati insieme ai dataset usati per l’addestramento.

Checkpoint:

Dataset:

Ricette e report:

0,50 e 2,50 dollari per milione di token su OpenRouter

Su OpenRouter Nemotron 3 Ultra è disponibile a 0,50 dollari per milione di token in ingresso e 2,50 dollari per milione in uscita, con finestra di contesto da 1 milione di token e output massimo di 16.384 token. Il modello è stato pubblicato il 4 giugno 2026 ed è instradato verso due provider. I prezzi effettivi possono variare in base al fornitore e alla configurazione dell’endpoint.

Indice 48 su Artificial Analysis: primo tra gli open-weights statunitensi

Secondo Artificial Analysis, Nemotron 3 Ultra ottiene un punteggio di circa 48 sull’Intelligence Index (47,7 con i pesi NVFP4 raccomandati per l’inferenza, 48,2 in BF16), il valore più alto tra i modelli open-weights statunitensi. Stacca nettamente Gemma 4 31B (39,2), Nemotron 3 Super (36,0) e gpt-oss-120b (33,3), ma resta circa sei punti dietro la frontiera open-weights cinese rappresentata da Kimi K2.6 (53,9).

Nel dettaglio delle valutazioni, il modello raggiunge il 71% su AA-Omniscience Non-Hallucination, indice di una bassa propensione a rispondere quando non conosce la risposta, e un Elo di 1378 su GDPval-AA, in linea con DeepSeek V4 Flash. Su CritPt, benchmark di problemi di fisica a livello di ricerca, si ferma invece al 3%, lo stesso risultato di Nemotron 3 Super. Sul Coding Index, composto da Terminal-Bench Hard e SciCode, Gemma 4 31B resta circa un punto avanti. Al lancio non è disponibile un punteggio di tipo Chatbot Arena: l’Intelligence Index di Artificial Analysis è l’unico benchmark indipendente pubblicato.

Con Nemotron 3 Ultra, NVIDIA porta il proprio modello open-weights di riferimento a una scala da 550 miliardi di parametri, puntando sulla velocità di inferenza e sull’apertura completa di pesi, dati e ricette più che su un nuovo tetto di capacità assoluta.

Fonti citate

  1. NVIDIA Nemotron 3 Ultra , NVIDIA Research, 4 giugno 2026.
  2. NVIDIA Nemotron 3 Ultra Technical Report , NVIDIA, 2026.
  3. Nemotron 3 Ultra – API Pricing & Providers , OpenRouter, 2026.
  4. NVIDIA Nemotron 3 Ultra released: fast, intelligent, and open , Artificial Analysis, 4 giugno 2026.
  5. Nemotron 3 Ultra – Intelligence, Performance & Price Analysis , Artificial Analysis, 2026.
  6. nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 , Hugging Face, 2026.
  7. nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16 , Hugging Face, 2026.
  8. NVIDIA Nemotron Developer Repository , GitHub, 2026.