NVIDIA ha presentato il GB200 NVL72, un sistema su scala rack che porta le capacità di AI exascale in un unico contenitore. La piattaforma si basa sulla pianificazione a blocchi di Slurm per mantenere alta l'efficienza durante l'addestramento di modelli con trilioni di parametri.
Cosa offre il GB200 NVL72
Il GB200 NVL72 è costruito come un sistema denso e integrato. È progettato per gestire il tipo di carico di calcolo che normalmente richiederebbe più rack o interi cluster. Combinando l'ultima architettura GPU di NVIDIA con memoria ad alta larghezza di banda e interconnessioni veloci, il sistema mira a ridurre il tempo e l'energia necessari per i lavori AI su larga scala.
Non si tratta di un server tradizionale. È un'unità su scala rack, il che significa che l'intero rack agisce come un unico computer gigante. Questo approccio riduce la latenza e semplifica la gestione, ma richiede anche uno scheduler in grado di distribuire il lavoro su centinaia di GPU senza intoppi.
Perché la pianificazione a blocchi di Slurm è importante
Slurm è già un gestore di carichi di lavoro di riferimento per molti centri di calcolo ad alte prestazioni. Il GB200 NVL72 utilizza una variante di Slurm con pianificazione a blocchi, il che significa che i lavori ottengono blocchi dedicati di risorse anziché essere suddivisi in fette temporali su hardware condiviso. Per l'addestramento di modelli con trilioni di parametri, questo è fondamentale. Le sessioni di addestramento possono durare giorni o settimane; una pianificazione a blocchi garantisce che le GPU rimangano sullo stesso lavoro senza interruzioni, evitando costosi cicli di checkpoint e riavvio.
NVIDIA non ha rilasciato benchmark delle prestazioni per il GB200 NVL72 nell'annuncio. Ma l'azienda ha affermato che la combinazione di throughput exascale e pianificazione a blocchi dovrebbe consentire ai ricercatori di addestrare modelli di ordini di grandezza superiori a quelli attuali, senza dover riprogettare i propri flussi di lavoro.
Cosa significa per i laboratori di AI
Oggi, addestrare i modelli linguistici e di visione più grandi richiede supercomputer dedicati. Il GB200 NVL72 riduce questo ingombro. Un singolo rack può offrire ciò che prima richiedeva una stanza piena di server. Ciò potrebbe abbassare la barriera per i laboratori ben finanziati che non vogliono costruire i propri cluster personalizzati.
Ma il sistema non è economico. NVIDIA non ha divulgato il prezzo e l'accesso anticipato sarà probabilmente riservato ai suoi partner cloud e ad alcune istituzioni di ricerca selezionate. La vera domanda è se la pianificazione a blocchi di Slurm possa scalare senza problemi quando decine di questi rack vengono collegati tra loro per lavori ancora più grandi.
NVIDIA prevede di iniziare a spedire il GB200 NVL72 ai clienti nella seconda metà dell'anno. La rapidità con cui i laboratori lo adotteranno e se vedranno i guadagni di efficienza promessi determinerà se l'exascale su scala rack diventerà la nuova norma per l'addestramento AI.




