NVIDIA vend un PC avec 748 Go de RAM
tech

C’est TERRIFIANT : NVIDIA sort un PC avec 748 Go de RAM

3 septembre 2026Lecture 5 min

NVIDIA DGX Station GB300 Grace Blackwell Ultra

L'émergence des modèles d'intelligence artificielle fondés sur le raisonnement complexe et l'extension du temps d'inférence (test-time scaling) a profondément modifié les exigences relatives à l'infrastructure matérielle de calcul. La transition des modèles génératifs légers vers des agents autonomes et des architectures de plusieurs centaines de milliards à un billion de paramètres requiert non seulement un débit d'opérations en virgule flottante exceptionnel, mais également une bande passante et une capacité mémoire d'une ampleur inédite. Afin de répondre aux contraintes de confidentialité, de souveraineté des données et de latence des laboratoires de recherche d'entreprise, NVIDIA a décliné son architecture de centre de données sous forme de station de travail de bureau : la NVIDIA DGX Station GB300. Propulsée par la superpuce de bureau NVIDIA GB300 Grace Blackwell Ultra, cette station transpose la capacité de traitement d'un supercalculateur au sein d'un facteur de forme tour.

1. Architecture Matérielle et Interconnexion du Superchip GB300

La DGX Station GB300 repose sur une architecture intégrée réunissant sur un même module d'interconnexion un processeur central (CPU) et un processeur graphique (GPU) de classe Ultra. Contrairement aux architectures d'interconnexion traditionnelles basées sur le bus PCIe, le superchip GB300 associe un processeur NVIDIA Grace de 72 cœurs ARM Neoverse V2 à un GPU NVIDIA Blackwell Ultra par le biais de l'interface cohérente NVLink-C2C (Chip-to-Chip). Cette liaison bi-directionnelle fournit un débit de 900 Go/s, éliminant les goulots d'étranglement de transfert de données entre le processeur hôte et l'accélérateur.

La puce Blackwell Ultra est fabriquée selon le procédé personnalisé TSMC 4NP à 4 nanomètres. Elle intègre 208 milliards de transistors répartis sur deux puces réticulées interconnectées par une liaison interne sur boîtier opérant à 10 To/s, permettant au système d'agir comme un GPU unifié sans latence inter-puces préjudiciable. L'intégration du contrôleur ConnectX-8 SuperNIC permet d'assurer un accès direct à la mémoire à distance (RDMA) via les réseaux Ethernet Spectrum-X ou InfiniBand Quantum-X800. Cette connectivité à 800 Gbit/s offre la possibilité de coupler deux DGX Stations afin de doubler la capacité mémoire et la puissance de traitement utilisables en grappe.

Composant / ParamètreSpécification Technique Détaillée
Processeur Central (CPU)1x NVIDIA Grace (72 cœurs Arm Neoverse V2)
Processeur Graphique (GPU)1x NVIDIA Blackwell Ultra (Architecture Tensor Core 5e Gen)
Procédé de GravureTSMC 4NP (4 nanomètres personnalisé)
Liaison CPU-GPUNVLink-C2C (Bande passante bi-directionnelle de 900 Go/s)
Réseau Entrées/SortiesConnectX-8 SuperNIC (Débit jusqu'à 800 Gbit/s Ethernet/InfiniBand)
Capacité d'Extension1x Slot PCIe Gen 5 x16, 2x Slots PCIe Gen 5 x16 (électrique x8)
GPU Secondaire OptionnelSupport NVIDIA RTX PRO 6000 Blackwell (96 Go GDDR7)
Unités Décodeurs Média7x NVDEC et 7x nvJPEG intégrés
Consommation Électrique1 600 Watts (Alimentation système globale)

2. Hiérarchie Mémoire et Dynamique d'Exécution Dual-Tier

Le point de rupture architectural majeur de la DGX Station GB300 réside dans la constitution d'un espace mémoire cohérent unifié de 748 Go. Cette architecture mémoire bi-étagée associe une mémoire GPU à très haute vitesse à une mémoire système LPDDR5X de haute densité. L'étage primaire se compose de 252 Go de mémoire HBM3e offrant une bande passante massive de 7,1 To/s, tandis que l'étage secondaire rassemble 496 Go de mémoire LPDDR5X opérant à 396 Go/s.

Étage MémoireCapacitéType de PuceBande Passante PeakRôle Systémique
Étage VRAM GPU252 GoHBM3e7,1 To/sCalculs Tensoriels, KV Cache haut débit, poids actifs
Étage RAM Système496 GoLPDDR5X396 Go/sPoids système, KV Cache secondaire, contexte étendu
Espace Unifié748 Go TotalCoordonné via C2C900 Go/s (C2C)Transfert cohérent direct entre CPU et GPU

La dynamique d'exécution varie considérablement selon la taille du modèle et la répartition des poids au sein de cette hiérarchie. Lorsque les paramètres d'un modèle quantifié (par exemple un modèle de 100 à 200 milliards de paramètres au format FP4 ou FP8) s'insèrent intégralement dans les 252 Go de mémoire HBM3e, le GPU exploite la bande passante maximale de 7,1 To/s, garantissant un débit de génération de jetons optimal.

Si la taille du modèle ou la mémoire vive requise pour le cache Clé-Valeur (KV Cache) excède 252 Go, les données débordent sur la mémoire LPDDR5X système. L'accès aux poids situés sur ce second étage est alors contraint par la bande passante de 900 Go/s du pont NVLink-C2C. Ce goulot d'étranglement intermédiaire réduit le débit de sortie par rapport à une exécution purement HBM3e. Cependant, les modèles à mélange d'experts (Mixture-of-Experts) tirent un avantage stratégique de cette hiérarchie. En configurant le moteur d'exécution pour maintenir les experts actifs au sein de la VRAM HBM3e tout en stockant les experts inactifs ou secondaires dans la mémoire LPDDR5X, la DGX Station GB300 exécute des modèles MoE atteignant un trillion de paramètres avec une pénalité de latence minimale.

3. Matrice de Performance Calculatoire et Moteur Transformateur v2

La puce Blackwell Ultra intègre la deuxième génération du Moteur Transformateur (Transformer Engine) de NVIDIA. Ce sous-système adapte dynamiquement les précisions de calcul au niveau microscopique (formats NVFP4) afin de doubler les capacités de modélisation prises en compte par la mémoire tout en préservant la précision numérique nécessaire aux tâches de raisonnement. En comparaison directe avec la génération standard Blackwell (B200), les cœurs Tensor Blackwell Ultra fournissent une accélération multipliée par deux sur les couches d'attention (Attention-Layer Acceleration) et 1,5 fois plus de FLOPS d'IA sur les opérations denses.

Format de PrécisionDébit Théorique Peak (Sparsité)Débit Dense / Standard
FP4 Tensor Core20 PFLOPS15 PFLOPS
INT8 Tensor Core330 TOPS330 TOPS
FP8 / FP6 Tensor Core10 PFLOPS5 PFLOPS
FP16 / BF16 Tensor Core5 PFLOPS2,5 PFLOPS
TF32 Tensor Core2,5 PFLOPS1,25 PFLOPS
FP32 Vectoriel80 TFLOPS80 TFLOPS
FP64 / FP64 Tensor Core1,3 TFLOPS1,3 TFLOPS

L'implémentation matérielle de la technologie NVIDIA Confidential Computing garantit un chiffrement à la volée sur le bus NVLink et au niveau des entrées/sorties (TEE-I/O), permettant d'exécuter l'entraînement et l'inférence confidentiels sans dégradation mesurable des débits.

4. Benchmarks LLM et Inférence à Grande Échelle

Grâce à sa capacité mémoire unifiée de 748 Go, la DGX Station GB300 est conçue pour exécuter en inférence locale des modèles d'IA atteignant 1 000 milliards (1 trillion) de paramètres au format FP4 ou quantifié, et pour effectuer le fine-tuning (via LoRA / QLoRA) de modèles comportant entre 200 et 400 milliards de paramètres.

Modèle LLM / WorkloadNombre de ParamètresFormat / PrécisionDébit Constaté (Jetons / sec)
Kimi 2.51,1 Trillion (MoE)FP4 / Quantifié40 – 50 tok/s (Débit total station)
Nemotron Ultra550 BillionsQuantifié~35 tok/s (Requête unique, passe à 4-5 req.)
GLM-5.2-REAP504 BillionsFP4 / Quantifié~60 tok/s

Ces métriques démontrent la capacité de la station à maintenir un débit de génération suffisant pour une utilisation fluide en environnement de développement ou de production d'entreprise sans recourir à des fermes de serveurs distantes.

5. Écosystème Constructeurs (OEM) et Déploiement Matériel

Afin de diffuser la station au sein des entreprises, NVIDIA fournit le module de référence GB300 tout en s'appuyant sur un réseau de partenaires OEM (Original Equipment Manufacturers) pour la commercialisation des systèmes complets. Si le bloc processeur/mémoire principal reste strictement identique (GB300 Superchip avec 748 Go de mémoire cohérente), les constructeurs différencient leurs références au niveau du châssis, du niveau acoustique, du refroidissement, du stockage secondaire et des cartes d'extension graphiques.

ConstructeurNom du ModèleParticularités de l'Intégration
ASUSExpertCenter Pro ET900N G3Châssis optimisé pour le silence, double SSD NVMe PCIe 5.0
SupermicroSuper AI Station (ARS-511GD-NB-LCC)Refroidissement liquide à boucle fermée, intégration pour rack/bureau
MSIXpertStation WS300Double connectique réseau 400GbE, stockage extensible
ExxactValence VWS-158270643 / TensorEXOptions avec carte fille RTX PRO 6000 Blackwell additionnelle
GigabyteW775-V10-L01Boîtier tour entreprise, gestion avancée de l'alimentation
DellDell Pro Max avec GB300Intégration logicielle d'entreprise et support d'infrastructure
HPZGX Fury AI StationChâssis renforcé pour stations de travail professionnelles

La station est livrée avec le système d'exploitation DGX OS (basé sur Ubuntu) ou en version Windows d'entreprise ("DGX Station for Windows"). Elle inclut la suite logicielle NVIDIA AI Enterprise, la gestion à distance Out-Of-Band via le contrôleur BMC/Redfish, et autorise le partitionnement GPU Multi-Instance (MIG) jusqu'à 7 instances indépendantes pour isoler les charges de travail d'ingénierie.

6. Analyse Économique, Coût Total de Possession (TCO) et Comparatif Marché

La commercialisation de la DGX Station GB300 s'effectue dans une fourchette tarifaire s'étendant de 80 000 $ à 123 000 $ USD (ou environ 95 000 € à 117 000 £ selon le niveau de taxe et les options de stockage). Pour évaluer la viabilité économique de cet investissement local par rapport aux alternatives du marché, les capacités et coûts comparatifs doivent être analysés rigoureusement.

Option / PlateformeMémoire UtileBande Passante MémoireFourchette de Prix (Indicatif 2026)Cas d'Usage Ciblé
NVIDIA DGX Station (GB300)748 Go Unifié7,1 To/s (HBM3e)80 000 $ à 123 000 $Inférence/Fine-tuning local jusqu'à 1T de paramètres
RTX PRO 6000 Blackwell96 Go GDDR71,79 To/s13 998 $ à 16 000 $Inférence 70B-120B local, modélisation 3D / Simulation
Apple Mac Studio M3 Ultra96 Go à 512 Go819 Go/s5 299 $Inférence légère, prototypage local à faible débit
NVIDIA DGX Spark (GB10)128 Go LPDDR5X273 Go/s4 699 $Développement local CUDA, petits agents
Location Cloud (B200 / B300)Illimitée (Rack)Vitesse HBM native5,29 $ à 17,80 $ / heureCalculs à la demande, rafales de traitement isolées

En prenant une valeur médiane d'achat de 100 000 $, la station équivaut à environ 14 000 heures de calcul sur une instance cloud basée sur un GPU B200/B300 (facturée environ 7 $ par heure). L'acquisition matérielle devient financièrement rentable lorsque le taux d'utilisation de la machine (duty cycle) dépasse 60 % sur une période de 18 à 24 mois (soit environ 19 mois d'utilisation continue), sans compter les économies réalisées sur les frais de transfert réseau (egress fees) et la protection absolue de la propriété intellectuelle de l'entreprise.

7. Analyse Comparative Inter-Générationnelle et Datacenter

Pour situer la DGX Station GB300 au sein de la gamme d'infrastructures IA de NVIDIA, il convient de comparer son architecture aux configurations de centre de données HGX B300, GB300 NVL72 et aux anciennes plateformes Hopper (H100/H200).

Paramètre ArchitecturalDGX Station GB300DGX B300 (Serveur 10U)GB300 NVL72 (Rack-Scale)Hopper H100 / H200 (SXM)
Nombre de GPU1x Blackwell Ultra8x Blackwell Ultra SXM72x Blackwell Ultra1x H100 / H200
Nombre de CPU1x Grace (72 cœurs)2x Intel Xeon 6776P36x Grace (2 592 cœurs)x86 tiers
Mémoire GPU (VRAM)252 Go HBM3e2,1 To HBM3e20 To HBM3e80 Go HBM3 / 141 Go HBM3e
Mémoire Totale Fast748 Go Unifié~2,1 To VRAM37 To (HBM3e + LPDDR5X)80 Go à 141 Go
Performance Peak FP420 PFLOPS (Sparse)144 PFLOPS (Sparse)1 440 PFLOPS (Sparse)Non supporté natif (FP8 max)
Consommation1,6 kW~14 kW~142 kW700 W
RefroidissementAir / Liquide ferméAir / Liquide (Options)Liquide direct 100%Air / Liquide optionnel

À l'échelle des grands centres de données, la plateforme GB300 NVL72 offre un rendement applicatif global (AI factory output) jusqu'à 50 fois supérieur à celui des infrastructures Hopper, avec un gain d'efficience énergétique d'un facteur 5 par megawatt et une latence divisée par 10 sur la génération de jetons par utilisateur. La DGX Station GB300 hérite directement de ces avancées algorithmiques et de ces optimisations de cœurs Tensor à l'échelle d'un nœud individuel.

8. Perspectives et Conclusion

La NVIDIA DGX Station GB300 Grace Blackwell Ultra s'impose comme une référence technique pour le calcul d'IA d'entreprise hors centre de données. En unifiant 748 Go de mémoire cohérente et un sous-système de calcul atteignant 20 PFLOPS FP4 dans une enveloppe thermique de 1 600 Watts, le système franchit le pas nécessaire pour exécuter localement des modèles de raisonnement à un trillion de paramètres.

Bien que le sous-système mémoire dual-tier implique une gestion fine de l'emplacement des poids pour éviter la saturation du pont NVLink-C2C lors du débordement hors VRAM HBM3e, l'architecture s'avère particulièrement adaptée aux modèles Mixture-of-Experts (MoE) et aux contextes longs de haute densité. Pour les organisations nécessitant une autonomie calculatoire totale, un contrôle rigoureux de la confidentialité et une latence prédictible, la DGX Station GB300 représente une solution rentable dès lors que l'infrastructure atteint un taux d'utilisation soutenu

Newsletter Exclusive

Rejoignez
L'investisseur geek.

Soyez le premier informé des nouvelles technologies, IA et des analyses exclusives que je ne partage pas sur YouTube.

Pas de spam. Désinscription en un clic.