Microsoft Supercarges Azure ML avec Nvidia H200 VMS

/fr/images/Azure-Machine-Learning.png

Lisez notre page de divulgation pour savoir comment pouvez-vous aider Windows Insight à soutenir l’équipe éditoriale. En savoir plus

Les lecteurs aident à prendre en charge Windows Insight. Nous pouvons obtenir une commission si vous achetez via nos liens.

Microsoft prend l’apprentissage automatique Azure un encoche avec son dernier ajout, les machines virtuelles ND H200 V5.

Comme le note Microsoft, ces machines virtuelles sont alimentées par les GPU de base du tenseur H200 de NVIDIA et sont conçues pour gérer les charges de travail des IA les plus lourdes, de la formation de modèles de langage massifs. Cela les aide à servir une inférence à haut débit à grande échelle.

Il convient de noter que le ND H200 V5 contient huit GPU H200, offrant une mémoire combinée de 1 128 Go de mémoire HBM3E à large bande passante. C’est un énorme bond de 76% par rapport à la génération H100 précédente.

En d’autres termes, le pool de mémoire massif signifie des modèles plus grands, des fenêtres de contexte plus long et des tailles de lots plus grandes peuvent désormais fonctionner avec moins de compromis. Microsoft affirme que cette configuration réduit également la communication cross-gpu, la réduction des frais généraux de formation et l’efficacité augmentant.

En continuant, Nvidia NvLink fournit 900 Go / s par GPU à l’intérieur d’une machine virtuelle, permettant une formation parallèle rapide sur les huit GPU. Entre les machines virtuelles, chaque nœud est équipé de 3,2 To / s de bande passante Infiniband, complétée par GPuDirect RDMA pour la communication GPU à GPU à faible latence.

Cette conception rend la mise à l’échelle sur des centaines de nœuds plus lisses et plus prévisibles, aidant finalement les équipes à passer des expériences à la production avec moins de barrages routiers.

Du côté du logiciel, ND H200 V5 fentes directement dans les flux de travail Azure ML existants, les cadres de support comme Pytorch, TensorFlow et Jax. Les conteneurs optimisés, la formation distribuée via le NCCL et l’approvisionnement direct sur la CLI garantissent que les équipes de science des données peuvent démarrer rapidement.

Les références précoces suggèrent jusqu’à 35% un meilleur débit pour une inférence du modèle importante par rapport aux configurations précédentes, en particulier pour des modèles comme LLAMA 3.1 405B. Microsoft note que les simulations haute performance et les charges de travail scientifiques sont également bénéficiant de la combinaison de la bande passante de la mémoire et de la densité de calcul.

Avec la prise en charge des clusters de mise à l’échelle automatique, les utilisateurs d’Azure ML peuvent faire tourner n’importe quoi d’une seule machine virtuelle ND H200 à des centaines de nœuds, ne payant que ce qu’ils utilisent. En bref, ce n’est pas seulement une bosse matérielle, mais une mise à niveau complète visant à alimenter la prochaine vague d’innovation d’IA.

  • ️⃣ Lien source:

avec son dernier ajout, ND H200 V5 Machines virtuelles V5, nvidia’s,