Redéfinir les exigences de stockage pour le calcul haute performance (HPC) optimisé par l’AI

L’AI transforme le calcul haute performance (HPC) en un écosystème où le stockage est moteur de performance, d’évolutivité et d’efficacité des coûts. Les architectures modernes sont essentielles pour maximiser l’utilisation des GPU et accélérer les analyses.
10 min de lecture
Manpreet Singh
Manpreet Singh
Gestionnaire de produit, HCBU
10 min de lecture
Calcul haute performance activé par l’AI

Les environnements de calcul haute performance (HPC) ont traditionnellement été optimisés pour les simulations à grande échelle, l’analyse technique et la modélisation scientifique. Les architectures de stockage dans ces environnements étaient conçues principalement pour des charges de travail prévisibles, orientées par lots, caractérisées par des opérations d’enregistrement et de redémarrage intensives en écriture.

La convergence de l’ et du HPC a fondamentalement transformé ce modèle. Le HPC avec AI va bien au-delà du simple « HPC plus ». Les plateformes HPC modernes prennent désormais en charge l’entraînement de modèles d’apprentissage profond, les simulations pilotées par les données, les jumeaux numériques et les flux de travail intégrant simulation et AI. Cette évolution représente une transformation majeure des modes d’accès aux données, des attentes en matière de performance, des exigences d’évolutivité et des dynamiques de coûts.

Les systèmes de stockage conçus pour l’enregistrement d’état et les opérations d’E/S par lots ne parviennent de plus en plus à soutenir les chaînes AI qui exigent un accès continu aux données à haut débit et faible latence, à très grande échelle.

Selon des recherches récentes dans l’industrie, le marché mondial du stockage HPC devrait croître pour atteindre environ 22,7 milliards USD d’ici 20331, reflétant un taux de croissance annuel solide à mesure que les plateformes de stockage évoluent pour répondre à des besoins de performance et d’échelle croissants.

Dans cette nouvelle réalité, le stockage n’est plus un composant d’arrière-plan passif. Il influence directement l’utilisation des GPU, le débit d’entraînement, le délai d’obtention des analyses et l’économie globale de la plateforme. Les organisations qui continuent de s’appuyer sur des conceptions de stockage HPC traditionnelles risquent de sous-utiliser des accélérateurs coûteux et de ralentir l’innovation.

Forces qui transforment le stockage HPC

Une seule évolution technologique ne suffit pas à transformer le stockage HPC. Il s’agit du résultat de multiples changements structurels dans la façon dont les données sont générées, traitées et consommées par les plateformes AI-HPC modernes.

Voici quelques-unes des grandes tendances qui redéfinissent les attentes en matière de stockage :

  1. Transition de plateformes centrées sur le calcul à des plateformes axées sur les données : Les environnements HPC traditionnels visaient à maximiser l’utilisation des CPU et la bande passante d’interconnexion. Le stockage servait principalement à l’enregistrement d’état et à l’archivage. Les plateformes HPC avec AI sont fondamentalement axées sur les données. Les chaînes AI ingèrent, prétraitent et diffusent en continu les données vers les GPU. La performance de l’entraînement est maintenant étroitement liée à l’efficacité du stockage.
  2. La métadonnée devient le goulot d’étranglement : Les charges AI opèrent souvent sur d’immenses collections de petits fichiers : images, fragments génomiques, sorties de capteurs et ensembles de caractéristiques. Ces charges génèrent des millions d’opérations sur les métadonnées par seconde. Dans de nombreux systèmes HPC hérités, les services de métadonnées étaient dimensionnés prudemment. Sous des charges AI, les serveurs de métadonnées deviennent saturés bien avant que les seuils de bande passante ne soient atteints.
  3. Coût caché de chemins de données inefficaces : À mesure que la densité de GPU par nœud augmente, les chemins d’E/S traditionnels médiatisés par le CPU deviennent des contraintes visibles. Plusieurs copies mémoire et traductions de protocoles ajoutent de la latence et consomment du temps CPU. Des technologies comme GPUDirect Storage et les fabrics compatibles RDMA sont désormais nécessaires pour éliminer ces inefficacités.
  4. Le stockage hiérarchisé et désagrégé devient la norme : L’économie du stockage flash et les limites d’évolutivité des disques NVMe locaux favorisent l’adoption d’architectures désagrégées avec NVMe over Fabrics. Le placement manuel des données n’est pas viable à cette échelle. L’automatisation et la hiérarchisation basée sur des politiques deviennent obligatoires.
  5. Montée des usages hybrides et collaboratifs du HPC : Les plateformes HPC modernes dépassent maintenant le cadre d’un seul centre de données. La collaboration en recherche et le bursting dans le cloud nécessitent un accès fluide à des ensembles de données partagés. L’architecture de stockage doit désormais prendre en charge l’intégration hybride, une gouvernance cohérente et la mobilité sécurisée des données.

Transformer la complexité en capacités

Reconnaître les défis n’est qu’une première étape. Les organisations doivent désormais traduire ces constats en stratégies concrètes de modernisation. Il est essentiel pour les entreprises d’adopter certaines mesures architecturales, opérationnelles et de gouvernance qui leur permettront de bâtir des plateformes de stockage AI‑HPC résilientes et évolutives.

  1. Élaborer une stratégie de stockage centrée sur les données : Les organisations doivent commencer par classifier les charges de travail en fonction de l’intensité des E/S, de la taille des jeux de données, de la fréquence de réutilisation, de l’empreinte des métadonnées et des besoins de concurrence. Faire correspondre les exigences de stockage aux étapes des chaînes AI‑HPC permet une hiérarchisation et une planification des capacités éclairées.
  2. Concevoir la performance grâce à la hiérarchisation pilotée par des politiques : Une plateforme AI-HPC moderne devrait mettre en œuvre un modèle de hiérarchisation automatisé couvrant NVMe, les systèmes de fichiers parallèles, le stockage objet et les niveaux d’archivage. Une gestion automatisée du cycle de vie des données assure un placement optimal en tout temps.
  3. Éliminer les goulots d’étranglement sur le chemin des données : Pour éviter des pertes de performance cachées, il faut réduire au minimum l’intervention des CPU et optimiser la topologie PCIe et des fabrics. Les E/S directes vers les GPU améliorent le débit et l’utilisation des accélérateurs.
  4. Considérer les métadonnées comme un service de plateforme : Les métadonnées doivent être conçues comme un service indépendant et évolutif grâce à une architecture distribuée et une surveillance proactive.
  5. Appliquer la gouvernance et l’intelligence à la gestion des données : La gestion des versions de jeux de données, la traçabilité et les politiques de rétention préviennent la croissance incontrôlée.
  6. Intégrer le stockage aux ordonnanceurs et aux chaînes AI : L’intégration avec SLURM, Kubernetes et les cadres MLOps permet une planification tenant compte des données.

Comment HCLTech aide à bâtir des plateformes AI‑HPC prêtes pour l’avenir

La modernisation technologique exige des partenaires expérimentés qui maîtrisent à la fois l’ingénierie HPC et les opérations d’envergure d’entreprise. HCLTech accompagne les organisations dans la conception, le déploiement et la gestion à long terme de plateformes de stockage AI‑HPC.

  1. Architecture et conseil de bout en bout
    • Caractérisation des charges de travail et des E/S
    • Conception des niveaux et des métadonnées
    • Planification d’architectures hybrides
  2. Services intégrés de construction et d’exploitation
    • Déploiement de systèmes de fichiers parallèles et de fabrics NVMe-oF
    • Ingénierie de la fiabilité et de la performance
  3. HPC hybride et compatible cloud
    • Intégration sécurisée et mobilité des données
    • Modèles de bursting et de collaboration
  4. Intégration et gouvernance de l’écosystème
    • Alignement OEM et ISV
    • Standardisation des plateformes
  5. Opérations pilotées par l’AI
    • Observabilité unifiée
    • Chatbots GenAI pour les opérations

Business Impact

La modernisation du stockage HPC n’est pas une opération purement technique. Elle influence directement les résultats d’affaires, la rapidité de la recherche et le positionnement concurrentiel. Voici certains des avantages concrets que retirent les organisations qui investissent dans les plateformes de stockage AI‑HPC de nouvelle génération.

  • Amélioration de la performance – Taux d’utilisation soutenu des GPU plus élevé et délai plus court pour obtenir des analyses.
  • Efficacité des coûts – Coût par expérience réduit et investissements d’infrastructure optimisés.
  • Excellence opérationnelle – Moins d’interruptions, opérations automatisées et gouvernance renforcée.
  • Agilité stratégique – Déploiement rapide de nouvelles charges de travail et évolutivité à long terme.

Perspectives : Le stockage, vecteur stratégique pour l’AI-HPC

Alors que l’AI devient inséparable du calcul haute performance, le stockage continuera de déterminer l’efficacité des plateformes. L’AI a transformé le HPC en un écosystème axé sur les données et les accélérateurs. Les systèmes de stockage conçus pour des charges centrées sur l’enregistrement d’état ne suffisent plus. Les organisations tournées vers l’avenir traiteront le stockage comme une plateforme stratégique – capable d’échelonner les métadonnées, d’optimiser les chemins de données, de s’intégrer aux couches d’orchestration et d’aligner les coûts sur la valeur. Avec la bonne architecture, une gouvernance adaptée et le bon modèle opérationnel, les entreprises peuvent libérer le plein potentiel du HPC activé par l’AI et maintenir un avantage concurrentiel en matière d’innovation axée sur les données.

Grâce à ses compétences de bout en bout en HPC, HCLTech peut jouer un rôle critique pour permettre aux organisations d’accéder à des plateformes de stockage AI-HPC de nouvelle génération, optimisées pour la performance, la résilience et l’évolutivité à long terme. De l’évaluation des charges jusqu’à la conception d’architectures hiérarchisées, au déploiement de NVMe-oF, à l’optimisation des métadonnées, à l’intégration hybride et aux opérations pilotées par l’AI, HCLTech propose un cadre unifié de modernisation qui permet aux clients de pérenniser leurs investissements HPC.

Partager sur
DFS Cloud hybride Blogues Redéfinir les exigences de stockage pour le calcul haute performance (HPC) optimisé par l’AI