AMD Halo station specifications
tech

AMD DÉVOILE UNE TOUR À 576 Go DE VRAM : la Threadripper Halo Station !

8 octobre 2026Lecture 5 min

AMD Halo Station : une tour à 576 Go de VRAM pour défier NVIDIA

Makertronic Tech · 8 octobre 2026

96 cœurs, jusqu’à 576 Go de mémoire GPU et 2 To de RAM : AMD prépare une station de travail qui rapproche le bureau et le datacenter. Une configuration spectaculaire pour l’IA locale, dont l’intérêt dépend autant de l’organisation de la mémoire que de sa capacité.

Les utilisateurs d’IA locale connaissent bien ce plafond : un modèle plus gros, une conversation plus longue ou plusieurs requêtes simultanées suffisent à saturer la mémoire de leur GPU. Avec la Threadripper Halo Station, AMD propose de changer d’échelle en associant un processeur professionnel à des accélérateurs Instinct.

Le système reste un prototype présenté à l’IFA 2026, avec une disponibilité annoncée pour 2027. Voici ce que ses caractéristiques permettent d’envisager, et les distinctions techniques à comprendre avant de le comparer à NVIDIA. [1]

La fiche technique : du matériel de calcul dans une tour

ÉlémentConfiguration maximale annoncée
ProcesseurAMD Ryzen Threadripper PRO 9995WX, Zen 5
Cœurs et threads96 cœurs et 192 threads
Accélérateurs4 × AMD Instinct MI350P
Mémoire GPU144 Go de HBM3E par accélérateur, soit 576 Go cumulés
RAM systèmeJusqu’à 2 To de DDR5 RDIMM
Bande passante HBM4 To/s par accélérateur, soit jusqu’à 16 To/s cumulés

Sources : spécifications officielles AMD. Les capacités et débits cumulés concernent la configuration à quatre accélérateurs. [1] [2] [3]

Pour situer la capacité, la RTX 5090 possède 32 Go de GDDR7 : 576 Go représentent dix-huit fois ce volume de mémoire. Ce rapport porte sur la capacité totale, pas sur la vitesse d’une application. [4]

Pourquoi autant de VRAM change les possibilités en IA locale

Les poids d’un modèle sont les valeurs numériques apprises pendant son entraînement. Leur stockage dépend du nombre de paramètres et de leur précision. En seize bits, chaque paramètre représente deux octets ; un stockage brut en quatre bits représente un demi-octet. La quantification réduit cette empreinte, avec des effets sur la qualité qui dépendent de la méthode et du modèle. [5]

Taille du modèlePrécision des poidsVolume brut calculé
70 milliards de paramètres16 bits140 Go
70 milliards de paramètres4 bits35 Go
200 milliards de paramètres16 bits400 Go
1 000 milliards de paramètres4 bits500 Go

Calculs en unités décimales pour les poids seuls, avant métadonnées de quantification et mémoire d’exécution. Il ne s’agit pas de consommations mesurées.

À ces poids s’ajoutent les données de travail et le cache KV, qui conserve des informations utiles sur les tokens déjà traités. Suivant l’architecture et la stratégie de cache, un contexte plus long peut augmenter les besoins mémoire. Les conversations simultanées consomment également des ressources. [6]

Cette marge supplémentaire pourrait donc servir à accueillir de plus gros modèles, à conserver plusieurs modèles spécialisés disponibles ou à répondre à davantage de requêtes. Imaginez, par exemple, un assistant de programmation et un service d’analyse documentaire utilisés par une petite équipe : la capacité nécessaire dépasse vite celle d’une seule session de discussion.

Le Threadripper apporte les connexions nécessaires

Le Threadripper PRO 9995WX réunit 96 cœurs Zen 5, 192 threads, 384 Mo de cache L3 et un boost maximal de 5,4 GHz. Sa plateforme dispose de huit canaux DDR5 et 128 lignes PCIe 5.0. [2]

Cela compte pour alimenter une configuration multi-GPU : quatre cartes reliées chacune en x16 mobilisent déjà 64 lignes PCIe. Le CPU peut aussi préparer les données et gérer les services autour des modèles. Son intérêt tient donc à l’ensemble de la plateforme, pas uniquement à son nombre de cœurs.

HBM3E et CDNA 4 : les deux atouts des Instinct

Les MI350P reposent sur CDNA 4, une architecture destinée au calcul. Chacun intègre notamment 128 unités de calcul et 512 unités matricielles. Ces dernières accélèrent les opérations sur des tableaux de nombres, essentielles dans les réseaux neuronaux. [3]

La HBM3E utilise des piles de mémoire proches des puces de calcul et une interface très large. AMD décrit le MI350P avec quatre piles HBM3E, 144 Go et un débit local théorique de 4 To/s. [7] La capacité aide à accueillir les données ; la bande passante aide à les fournir aux unités de calcul.

La fiche annonce également un pic de 4,6 pétaFLOPS matriciels en MXFP4 par carte, soit 18,4 pétaFLOPS cumulés pour quatre cartes. Ces pics théoriques dépendent du format numérique et ne permettent pas, à eux seuls, de déduire un débit en tokens par seconde. [3]

Le point décisif : 576 Go répartis entre plusieurs GPU

Chaque MI350P conserve ses propres 144 Go. Un modèle qui dépasse cette capacité demande une répartition adaptée. Le parallélisme de tenseurs peut, par exemple, partager certaines opérations entre plusieurs accélérateurs, qui doivent ensuite échanger leurs résultats. Ces communications pèsent dans la vitesse obtenue. [8]

Les 2,6 To annoncés additionnent la mémoire GPU et la RAM CPU. Ils ne forment pas 2,6 To de HBM utilisables à la vitesse d’une mémoire GPU locale. De même, les 16,4 To/s annoncés additionnent les débits de plusieurs ensembles mémoire. [1]

Le placement des données et la répartition du calcul deviennent donc centraux. Une équipe pourra chercher à répartir un gros modèle, ou à affecter des modèles différents aux cartes. Le scénario choisi doit guider l’évaluation du matériel et du logiciel.

Face à la NVIDIA DGX Station : capacité et cohérence

La DGX Station GB300 propose une autre organisation : un CPU Grace et un GPU Blackwell Ultra, reliés par NVLink-C2C à 900 Go/s. NVIDIA annonce 252 Go de HBM3E côté GPU et 496 Go de LPDDR5X côté CPU, soit 748 Go de mémoire cohérente. [9]

CaractéristiqueAMD Halo Station maximaleNVIDIA DGX Station GB300
CPU96 cœurs x8672 cœurs Arm
Accélérateurs IA principaux4 × MI350P1 × Blackwell Ultra
Mémoire GPU4 × 144 Go252 Go
Mémoire CPUJusqu’à 2 To496 Go
OrganisationHBM par GPU et RAM CPU distinctesMémoire CPU/GPU cohérente via NVLink-C2C

AMD affiche davantage de capacité dans cette configuration. NVIDIA met en avant la cohérence et sa liaison CPU/GPU. Les 748 Go de NVIDIA ne sont pas tous de la HBM non plus. Pour départager les machines, il faudra examiner les modèles, les échanges et les résultats d’inférence, plutôt que le seul total de gigaoctets. [9]

ROCm, consommation et disponibilité : ce qu’il reste à évaluer

AMD s’appuie sur ROCm. Les MI350P figurent dans le matériel pris en charge, avec un écosystème comprenant PyTorch et des moteurs comme vLLM. La compatibilité précise dépend toutefois des versions, des bibliothèques et de la configuration utilisée. [10]

Le format tour ne supprime pas les contraintes électriques. Le MI350P possède un plafond de 600 W par carte, configurable à 450 W. Quatre cartes réglées à 600 W représenteraient 2 400 W pour les GPU seuls, auxquels s’ajoutent les autres composants. Ce calcul porte sur les enveloppes publiées ; la consommation de la station complète devra être mesurée. [3]

Au 8 octobre 2026, AMD annonce 2027 et ne publie pas de prix de la Halo Station sur sa page officielle. Le tarif, les configurations proposées et les performances sur des modèles réels détermineront son intérêt économique. [1]

Une nouvelle échelle pour l’IA locale

La Halo Station attire l’attention parce qu’elle rapproche du poste de travail des capacités qu’on associe aux infrastructures de calcul. Son intérêt potentiel est concret : davantage de place pour les modèles, leur contexte et plusieurs services locaux.

À mon sens, la question la plus intéressante sera celle du résultat obtenu pour une équipe donnée : quels outils pourra-t-elle faire fonctionner, avec quelle réactivité, et à quel coût total ? Ce sont ces réponses qui transformeront les chiffres spectaculaires en véritable avantage.

Et vous : avec autant de mémoire GPU, choisiriez-vous un modèle plus gros ou plusieurs modèles spécialisés ? Quel usage vous donnerait envie de garder cette puissance en local ?

Mon analyse complète en vidéo

Je détaille la machine et la comparaison AMD/NVIDIA dans cette vidéo de Makertronic Tech :

Regarder la vidéo sur YouTube

Sources

  1. AMD — Threadripper Halo Station : configuration maximale, prototype et disponibilité.
  2. AMD — Ryzen Threadripper PRO 9995WX : CPU, DDR5 et PCIe.
  3. AMD — Instinct MI350P : mémoire, calcul et puissance électrique.
  4. NVIDIA — RTX 5090 : capacité GDDR7.
  5. Hugging Face — quantification des poids.
  6. Hugging Face — stratégies de cache KV.
  7. AMD ROCm — architecture MI350 et HBM3E.
  8. Hugging Face — parallélisme de tenseurs.
  9. NVIDIA — DGX Station GB300.
  10. AMD ROCm 10.1 — matériel et écosystème pris en charge.
Newsletter Exclusive

Rejoignez
L'investisseur geek.

Soyez le premier informé des nouvelles technologies, IA et des analyses exclusives que je ne partage pas sur YouTube.

Pas de spam. Désinscription en un clic.