NVIDIA ha rilasciato il 4 giugno 2026 Nemotron 3 Ultra, il modello più grande e capace della famiglia Nemotron 3. È un modello Mixture-of-Experts (MoE) da 550 miliardi di parametri totali e 55 miliardi attivi per token, costruito su un’architettura ibrida Mamba-Transformer e distribuito con pesi, dataset di addestramento e ricette aperti sotto licenza OpenMDW-1.1. Supporta una finestra di contesto fino a 1 milione di token e, secondo le misurazioni di Artificial Analysis, al lancio è il modello open-weights statunitense più intelligente.
550 miliardi di parametri totali e 55 attivi: l’architettura ibrida Mamba-Transformer

Parlammo di Nemotron 3 qui, ma Nemotron 3 Ultra adotta un’architettura Mamba2-Transformer ibrida con Latent Mixture-of-Experts (LatentMoE): i token vengono proiettati in una dimensione latente più piccola prima dell’instradamento verso gli esperti, una scelta che migliora l’accuratezza per byte di calcolo. Il modello instrada i token attraverso 512 esperti con selezione top-22 e mantiene attivi circa 55 dei 550 miliardi di parametri totali, una sparsità di circa il 10% che è la leva principale dietro la sua velocità.
A differenza dei modelli Nano e Super, Ultra integra livelli di Multi-Token Prediction (MTP) per una generazione più rapida tramite decodifica speculativa nativa. Il pre-addestramento è stato condotto con ricetta NVFP4 su circa 20 mila miliardi di token, con dati fino a settembre 2025; l’addestramento è avvenuto tra dicembre 2025 e aprile 2026 su cluster NVIDIA con Megatron-LM. Il modello supporta l’inglese, altre 11 lingue e 43 linguaggi di programmazione.
Le caratteristiche chiave di Nemotron 3 Ultra
- Architettura Mixture-of-Experts ibrida Mamba-Attention.
- LatentMoE per migliorare l’accuratezza.
- Livelli MTP per un’inferenza più veloce tramite decodifica speculativa nativa.
- Controllo del budget di ragionamento in fase di inferenza.
- Pre-addestramento in NVFP4.
- Post-addestramento con pipeline avanzata che combina Supervised Fine-Tuning (SFT), Reinforcement Learning (RL) e Multi-teacher On-Policy Distillation (MOPD).
Nella MOPD oltre dieci modelli insegnanti specializzati per dominio valutano le risposte del modello studente in una pipeline asincrona e vengono periodicamente riaddestrati a partire dai checkpoint aggiornati dello studente. Poiché NVIDIA ha rilasciato anche i corpus SFT e RL insieme ai pesi, questa parte della pipeline è in misura significativa riproducibile.
Throughput fino a 5,9 volte superiore e contesto da 1 milione di token
Sul setting 8k token in ingresso / 64k in uscita, NVIDIA dichiara per Nemotron 3 Ultra un throughput di inferenza rispettivamente 5,9x, 4,8x e 1,6x superiore a GLM-5.1-754B-A40B, Kimi-K2.6-1T-A32B e Qwen-3.5-397B-17B. Su endpoint pre-rilascio il modello è stato servito a oltre 300-400 token al secondo, più velocemente di gpt-oss-120b pur essendo oltre quattro volte più grande.
La finestra di contesto arriva a 1 milione di token e il modello supera gli altri LLM open di riferimento su RULER a 1M. Va però tenuto presente che il milione di token è il limite architetturale, non una garanzia operativa: diversi provider servono finestre più ridotte per ragioni di costo e latenza, quindi conviene verificare il contesto effettivamente disponibile sull’endpoint scelto prima di progettare pipeline a contesto lungo.
Pesi, dataset e ricette: il rilascio open source completo
NVIDIA distribuisce i checkpoint pre-addestrati, post-addestrati e quantizzati insieme ai dataset usati per l’addestramento.
Checkpoint:
- Nemotron 3 Ultra 550B-A55B NVFP4: modello post-addestrato e quantizzato in NVFP4.
- Nemotron 3 Ultra 550B-A55B BF16: modello post-addestrato.
- Nemotron 3 Ultra 550B-A55B Base BF16: modello base.
- Nemotron 3 Ultra 550B-A55B GenRM: GenRM usato per l’RLHF.
Dataset:
- Nemotron-Pretraining-Code-v3: 173 miliardi di token di codice da GitHub fino al 30 settembre 2025.
- Nemotron-Pretraining-Legal-v1: dataset sintetici per migliorare le capacità legali degli LLM.
- Nemotron-Pretraining-Specialized-v1.2: dataset sintetici per richiamo fattuale, scenari morali e domande generative e a scelta multipla.
- Nemotron-Posttraining-v3: dataset di post-addestramento per capacità agentiche, di ragionamento e generali, usati in SFT e RL.
Ricette e report:
- NVIDIA Nemotron Developer Repository per le ricette di addestramento.
- Technical Report con i dettagli tecnici completi.
0,50 e 2,50 dollari per milione di token su OpenRouter
Su OpenRouter Nemotron 3 Ultra è disponibile a 0,50 dollari per milione di token in ingresso e 2,50 dollari per milione in uscita, con finestra di contesto da 1 milione di token e output massimo di 16.384 token. Il modello è stato pubblicato il 4 giugno 2026 ed è instradato verso due provider. I prezzi effettivi possono variare in base al fornitore e alla configurazione dell’endpoint.
Indice 48 su Artificial Analysis: primo tra gli open-weights statunitensi
Secondo Artificial Analysis, Nemotron 3 Ultra ottiene un punteggio di circa 48 sull’Intelligence Index (47,7 con i pesi NVFP4 raccomandati per l’inferenza, 48,2 in BF16), il valore più alto tra i modelli open-weights statunitensi. Stacca nettamente Gemma 4 31B (39,2), Nemotron 3 Super (36,0) e gpt-oss-120b (33,3), ma resta circa sei punti dietro la frontiera open-weights cinese rappresentata da Kimi K2.6 (53,9).
Nel dettaglio delle valutazioni, il modello raggiunge il 71% su AA-Omniscience Non-Hallucination, indice di una bassa propensione a rispondere quando non conosce la risposta, e un Elo di 1378 su GDPval-AA, in linea con DeepSeek V4 Flash. Su CritPt, benchmark di problemi di fisica a livello di ricerca, si ferma invece al 3%, lo stesso risultato di Nemotron 3 Super. Sul Coding Index, composto da Terminal-Bench Hard e SciCode, Gemma 4 31B resta circa un punto avanti. Al lancio non è disponibile un punteggio di tipo Chatbot Arena: l’Intelligence Index di Artificial Analysis è l’unico benchmark indipendente pubblicato.
Con Nemotron 3 Ultra, NVIDIA porta il proprio modello open-weights di riferimento a una scala da 550 miliardi di parametri, puntando sulla velocità di inferenza e sull’apertura completa di pesi, dati e ricette più che su un nuovo tetto di capacità assoluta.
Fonti citate
- NVIDIA Nemotron 3 Ultra , NVIDIA Research, 4 giugno 2026.
- NVIDIA Nemotron 3 Ultra Technical Report , NVIDIA, 2026.
- Nemotron 3 Ultra – API Pricing & Providers , OpenRouter, 2026.
- NVIDIA Nemotron 3 Ultra released: fast, intelligent, and open , Artificial Analysis, 4 giugno 2026.
- Nemotron 3 Ultra – Intelligence, Performance & Price Analysis , Artificial Analysis, 2026.
- nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 , Hugging Face, 2026.
- nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16 , Hugging Face, 2026.
- NVIDIA Nemotron Developer Repository , GitHub, 2026.
