AMD Halo Station : une tour à 576 Go de VRAM pour défier NVIDIA
Makertronic Tech · 8 octobre 2026
96 cœurs, jusqu’à 576 Go de mémoire GPU et 2 To de RAM : AMD prépare une station de travail qui rapproche le bureau et le datacenter. Une configuration spectaculaire pour l’IA locale, dont l’intérêt dépend autant de l’organisation de la mémoire que de sa capacité.
Les utilisateurs d’IA locale connaissent bien ce plafond : un modèle plus gros, une conversation plus longue ou plusieurs requêtes simultanées suffisent à saturer la mémoire de leur GPU. Avec la Threadripper Halo Station, AMD propose de changer d’échelle en associant un processeur professionnel à des accélérateurs Instinct.
Le système reste un prototype présenté à l’IFA 2026, avec une disponibilité annoncée pour 2027. Voici ce que ses caractéristiques permettent d’envisager, et les distinctions techniques à comprendre avant de le comparer à NVIDIA. [1]
La fiche technique : du matériel de calcul dans une tour
| Élément | Configuration maximale annoncée |
|---|---|
| Processeur | AMD Ryzen Threadripper PRO 9995WX, Zen 5 |
| Cœurs et threads | 96 cœurs et 192 threads |
| Accélérateurs | 4 × AMD Instinct MI350P |
| Mémoire GPU | 144 Go de HBM3E par accélérateur, soit 576 Go cumulés |
| RAM système | Jusqu’à 2 To de DDR5 RDIMM |
| Bande passante HBM | 4 To/s par accélérateur, soit jusqu’à 16 To/s cumulés |
Sources : spécifications officielles AMD. Les capacités et débits cumulés concernent la configuration à quatre accélérateurs. [1] [2] [3]
Pour situer la capacité, la RTX 5090 possède 32 Go de GDDR7 : 576 Go représentent dix-huit fois ce volume de mémoire. Ce rapport porte sur la capacité totale, pas sur la vitesse d’une application. [4]
Pourquoi autant de VRAM change les possibilités en IA locale
Les poids d’un modèle sont les valeurs numériques apprises pendant son entraînement. Leur stockage dépend du nombre de paramètres et de leur précision. En seize bits, chaque paramètre représente deux octets ; un stockage brut en quatre bits représente un demi-octet. La quantification réduit cette empreinte, avec des effets sur la qualité qui dépendent de la méthode et du modèle. [5]
| Taille du modèle | Précision des poids | Volume brut calculé |
|---|---|---|
| 70 milliards de paramètres | 16 bits | 140 Go |
| 70 milliards de paramètres | 4 bits | 35 Go |
| 200 milliards de paramètres | 16 bits | 400 Go |
| 1 000 milliards de paramètres | 4 bits | 500 Go |
Calculs en unités décimales pour les poids seuls, avant métadonnées de quantification et mémoire d’exécution. Il ne s’agit pas de consommations mesurées.
À ces poids s’ajoutent les données de travail et le cache KV, qui conserve des informations utiles sur les tokens déjà traités. Suivant l’architecture et la stratégie de cache, un contexte plus long peut augmenter les besoins mémoire. Les conversations simultanées consomment également des ressources. [6]
Cette marge supplémentaire pourrait donc servir à accueillir de plus gros modèles, à conserver plusieurs modèles spécialisés disponibles ou à répondre à davantage de requêtes. Imaginez, par exemple, un assistant de programmation et un service d’analyse documentaire utilisés par une petite équipe : la capacité nécessaire dépasse vite celle d’une seule session de discussion.
Le Threadripper apporte les connexions nécessaires
Le Threadripper PRO 9995WX réunit 96 cœurs Zen 5, 192 threads, 384 Mo de cache L3 et un boost maximal de 5,4 GHz. Sa plateforme dispose de huit canaux DDR5 et 128 lignes PCIe 5.0. [2]
Cela compte pour alimenter une configuration multi-GPU : quatre cartes reliées chacune en x16 mobilisent déjà 64 lignes PCIe. Le CPU peut aussi préparer les données et gérer les services autour des modèles. Son intérêt tient donc à l’ensemble de la plateforme, pas uniquement à son nombre de cœurs.
HBM3E et CDNA 4 : les deux atouts des Instinct
Les MI350P reposent sur CDNA 4, une architecture destinée au calcul. Chacun intègre notamment 128 unités de calcul et 512 unités matricielles. Ces dernières accélèrent les opérations sur des tableaux de nombres, essentielles dans les réseaux neuronaux. [3]
La HBM3E utilise des piles de mémoire proches des puces de calcul et une interface très large. AMD décrit le MI350P avec quatre piles HBM3E, 144 Go et un débit local théorique de 4 To/s. [7] La capacité aide à accueillir les données ; la bande passante aide à les fournir aux unités de calcul.
La fiche annonce également un pic de 4,6 pétaFLOPS matriciels en MXFP4 par carte, soit 18,4 pétaFLOPS cumulés pour quatre cartes. Ces pics théoriques dépendent du format numérique et ne permettent pas, à eux seuls, de déduire un débit en tokens par seconde. [3]
Le point décisif : 576 Go répartis entre plusieurs GPU
Chaque MI350P conserve ses propres 144 Go. Un modèle qui dépasse cette capacité demande une répartition adaptée. Le parallélisme de tenseurs peut, par exemple, partager certaines opérations entre plusieurs accélérateurs, qui doivent ensuite échanger leurs résultats. Ces communications pèsent dans la vitesse obtenue. [8]
Les 2,6 To annoncés additionnent la mémoire GPU et la RAM CPU. Ils ne forment pas 2,6 To de HBM utilisables à la vitesse d’une mémoire GPU locale. De même, les 16,4 To/s annoncés additionnent les débits de plusieurs ensembles mémoire. [1]
Le placement des données et la répartition du calcul deviennent donc centraux. Une équipe pourra chercher à répartir un gros modèle, ou à affecter des modèles différents aux cartes. Le scénario choisi doit guider l’évaluation du matériel et du logiciel.
Face à la NVIDIA DGX Station : capacité et cohérence
La DGX Station GB300 propose une autre organisation : un CPU Grace et un GPU Blackwell Ultra, reliés par NVLink-C2C à 900 Go/s. NVIDIA annonce 252 Go de HBM3E côté GPU et 496 Go de LPDDR5X côté CPU, soit 748 Go de mémoire cohérente. [9]
| Caractéristique | AMD Halo Station maximale | NVIDIA DGX Station GB300 |
|---|---|---|
| CPU | 96 cœurs x86 | 72 cœurs Arm |
| Accélérateurs IA principaux | 4 × MI350P | 1 × Blackwell Ultra |
| Mémoire GPU | 4 × 144 Go | 252 Go |
| Mémoire CPU | Jusqu’à 2 To | 496 Go |
| Organisation | HBM par GPU et RAM CPU distinctes | Mémoire CPU/GPU cohérente via NVLink-C2C |
AMD affiche davantage de capacité dans cette configuration. NVIDIA met en avant la cohérence et sa liaison CPU/GPU. Les 748 Go de NVIDIA ne sont pas tous de la HBM non plus. Pour départager les machines, il faudra examiner les modèles, les échanges et les résultats d’inférence, plutôt que le seul total de gigaoctets. [9]
ROCm, consommation et disponibilité : ce qu’il reste à évaluer
AMD s’appuie sur ROCm. Les MI350P figurent dans le matériel pris en charge, avec un écosystème comprenant PyTorch et des moteurs comme vLLM. La compatibilité précise dépend toutefois des versions, des bibliothèques et de la configuration utilisée. [10]
Le format tour ne supprime pas les contraintes électriques. Le MI350P possède un plafond de 600 W par carte, configurable à 450 W. Quatre cartes réglées à 600 W représenteraient 2 400 W pour les GPU seuls, auxquels s’ajoutent les autres composants. Ce calcul porte sur les enveloppes publiées ; la consommation de la station complète devra être mesurée. [3]
Au 8 octobre 2026, AMD annonce 2027 et ne publie pas de prix de la Halo Station sur sa page officielle. Le tarif, les configurations proposées et les performances sur des modèles réels détermineront son intérêt économique. [1]
Une nouvelle échelle pour l’IA locale
La Halo Station attire l’attention parce qu’elle rapproche du poste de travail des capacités qu’on associe aux infrastructures de calcul. Son intérêt potentiel est concret : davantage de place pour les modèles, leur contexte et plusieurs services locaux.
À mon sens, la question la plus intéressante sera celle du résultat obtenu pour une équipe donnée : quels outils pourra-t-elle faire fonctionner, avec quelle réactivité, et à quel coût total ? Ce sont ces réponses qui transformeront les chiffres spectaculaires en véritable avantage.
Et vous : avec autant de mémoire GPU, choisiriez-vous un modèle plus gros ou plusieurs modèles spécialisés ? Quel usage vous donnerait envie de garder cette puissance en local ?
Mon analyse complète en vidéo
Je détaille la machine et la comparaison AMD/NVIDIA dans cette vidéo de Makertronic Tech :
Sources
- AMD — Threadripper Halo Station : configuration maximale, prototype et disponibilité.
- AMD — Ryzen Threadripper PRO 9995WX : CPU, DDR5 et PCIe.
- AMD — Instinct MI350P : mémoire, calcul et puissance électrique.
- NVIDIA — RTX 5090 : capacité GDDR7.
- Hugging Face — quantification des poids.
- Hugging Face — stratégies de cache KV.
- AMD ROCm — architecture MI350 et HBM3E.
- Hugging Face — parallélisme de tenseurs.
- NVIDIA — DGX Station GB300.
- AMD ROCm 10.1 — matériel et écosystème pris en charge.
