Il 28 aprile 2026 Nvidia ha rilasciato Nemotron 3 Nano Omni, un modello multimodale aperto che combina capacità di visione, audio e linguaggio in un’unica architettura. Il modello è disponibile su Hugging Face, OpenRouter, build.nvidia.com come microservizio NIM e tramite i partner cloud Nvidia.
Cosa cambia rispetto ai modelli con encoder separati
La maggior parte dei modelli multimodali in produzione orchestrano un encoder visione, uno audio e un LLM testuale, con passaggi di stato tra i tre. La proposta di Omni è di portare le tre capacità in un’unica architettura, eliminando i passaggi e i costi di latenza associati. Nvidia dichiara fino a 9 volte di throughput superiore rispetto ad altri modelli multimodali aperti, su benchmark di intelligenza documentale, comprensione video e audio.
L’architettura sottostante è un 30B-A3B mixture-of-experts con encoder visione e audio dedicati. La medesima famiglia, in versione solo testo, è il Nemotron 3 Nano.
Per quali agenti è pensato
La schedatura dei casi d’uso che Nvidia dichiara è concentrata su scenari agentici concreti:
- computer-use agents: agenti che navigano una GUI grafica e ragionano sul contenuto a schermo, riducendo il numero di chiamate ai modelli;
- interpretazione di documenti, grafici, tabelle e screenshot per assistenza clienti e monitoring di workflow;
- comprensione audio per workflow di sintesi e tagging di registrazioni.
Il filone è coerente con la traiettoria del settore: gli agenti che operano sulla macchina utente vogliono vedere e sentire quello che l’utente vede e sente, e farlo con il minor numero possibile di salti tra modelli specializzati.
Posizionamento commerciale
La logica di rilasciare un modello aperto in questa categoria è doppia. Nvidia può permetterselo perché il proprio business core sono i chip: più modelli aperti girano su GPU Nvidia, più vende silicio. La pubblicazione del modello è quindi marketing per l’ecosistema, oltre che ricerca.
Per i team che stanno costruendo agenti propri, Nemotron 3 Nano Omni è un’opzione open weights con controllo locale, alternativa a Claude/GPT/Gemini. La differenza che conta nei progetti in produzione: la possibilità di hostare il modello dentro il proprio perimetro, con i propri dati, senza dipendenze da provider terzi sull’inferenza.
Fonti
Nvidia Developer, pagina Nemotron 3 Nano Omni, 28 aprile 2026: build.nvidia.com. The Deep View, «Nvidia brings agents closer to real work», 30 aprile 2026.
