À mesure que les centres de données AI prennent de l’ampleur, la conception des semi-conducteurs fait face à plusieurs contraintes simultanées. Pour Satish Premanathan, vice-président chez HCLTech, le défi débute par la puissance et la densité thermique, mais s’étend rapidement à la mémoire, à l’interconnexion, à l’encapsulation et à la fiabilité.
Premanathan indique que les semi-conducteurs destinés aux centres de données AI peuvent maintenant consommer une puissance qui aurait été difficile à envisager pour les générations précédentes d’informatique.
« La première contrainte est généralement la consommation d’énergie », précise-t-il. « Fini le temps où ces semi-conducteurs [puces] fonctionnaient à moins de 25 watts. Aujourd’hui, nous parlons plutôt d’un kilowatt. »
Cette augmentation modifie à la fois la conception des puces et des systèmes qui les entourent.
L’énergie devient une contrainte de conception
À mesure que la consommation d’énergie augmente, les concepteurs doivent gérer le profil de puissance des semi-conducteurs de façon beaucoup plus rigoureuse.
Premanathan note que les techniques de conception à faible consommation sont de plus en plus pertinentes au sein du centre de données. Plutôt que de considérer la consommation d’énergie comme une préoccupation secondaire, la gestion de l’énergie fait désormais partie intégrante de l’architecture principale.
Le système d’alimentation s’est également complexifié. Les semi-conducteurs AI à haute performance fonctionnent à basse tension tout en exigeant un courant très élevé, imposant des exigences techniques complexes sur la façon dont l’alimentation est acheminée jusqu’au dispositif.
À l’échelle du système, cela signifie des architectures d’alimentation plus avancées et une meilleure coordination entre le semi-conducteur et l’infrastructure qui le prend en charge.
Le refroidissement se rapproche du semi-conducteur
Plus de puissance signifie également plus de chaleur.
« Le profil thermique des semi-conducteurs devient très élevé, donc les méthodes de refroidissement adoptées doivent s’assurer que le semi-conducteur reste suffisamment refroidi pour maintenir sa fiabilité », dit Premanathan.
Cela entraîne une transition, en s’éloignant de la seule utilisation de dissipateurs thermiques traditionnels et du refroidissement par air. Le refroidissement liquide devient de plus en plus important, alors que les exploitants de centres de données cherchent comment maintenir les systèmes AI à haute densité dans une enveloppe thermique adéquate.
Premanathan établit aussi un lien entre la gestion thermique et la fiabilité. Les semi-conducteurs AI doivent fonctionner sous de fortes contraintes thermiques pendant des années, ce qui met davantage l’accent sur les essais de fiabilité lors de la conception et de la validation.
La mémoire et les interconnexions gagnent en complexité
L’alimentation et le refroidissement ne sont qu’une partie du défi.
Les charges de travail AI requièrent également une bande passante mémoire très élevée. Premanathan cite la généralisation de la mémoire à large bande passante (HBM), car les concepteurs tentent d’acheminer suffisamment de données vers et depuis la couche de calcul.
Parallèlement, l’architecture d’interconnexion devient plus exigeante.
Les données à haute vitesse doivent circuler à travers le semi-conducteur, les grappes et entre les composants. Premanathan mentionne les générations plus rapides de PCI Express, les trames Ethernet haute vitesse et des interconnexions de plus en plus complexes comme faisant partie de cette évolution.
Il met également en avant les interconnexions optiques et celles basées sur la photonique silicium comme moyen de réduire l’énergie requise pour déplacer les données, dans le but de minimiser la consommation d’énergie par gigabit transféré.
Cela rend le problème de conception plus large que le simple processeur. Calcul, mémoire et connectivité doivent évoluer ensemble.
L’encapsulation avancée fait partie de l’architecture
Le dernier défi est l’encapsulation.
Premanathan indique que les techniques avancées d’encapsulation sont déjà intégrées dans les semi-conducteurs AI des centres de données de la génération actuelle et deviendront encore plus importantes à mesure que les conceptions migreront vers les chiplets.
Alors que la loi de Moore ralentie, les systèmes de plus en plus complexes ne peuvent plus tout intégrer sur une seule puce monolithique. Séparer la conception en plusieurs chiplets génère de nouveaux besoins quant à la façon de connecter et d’encapsuler ces composants.
« Lorsque vous divisez en plusieurs chiplets, vous n’avez d’autre choix que d’utiliser une encapsulation 2,5D ou 3D », explique Premanathan.
Le défi se complique lorsque des empilements HBM et des interconnexions optiques sont intégrés au même système. Premanathan souligne aussi l’apparition des optiques co-encapsulées comme un autre facteur influençant la conception du boîtier.
La mise à l’essai doit évoluer en parallèle avec l’encapsulation.
Combiner plusieurs chiplets, empilements de mémoire et autres composants rend la validation du système intégré plus difficile et peut entraîner des enjeux de rendement. Il en résulte que l’architecture du boîtier et les stratégies de tests avancées pour l’encapsulation sont devenues des éléments clés de l’économie globale des semi-conducteurs.
Un problème de conception à l’échelle du système
La prochaine génération de semi-conducteurs AI pour centres de données ne peut être optimisée isolément.
- La gestion de l’énergie a un impact sur la conception thermique
- Les limites thermiques influencent la fiabilité
- Les choix de mémoire et d’interconnexion influent sur la performance et l’efficacité énergétique
- Les architectures à chiplets créent de nouveaux besoins en encapsulation et en tests
Ensemble, ces contraintes transforment le développement des semi-conducteurs en un problème d’ingénierie étroitement intégré au niveau du système.
Rassembler ces domaines d’ingénierie accroît aussi la valeur de partenaires stratégiques capables d’intervenir à tous les niveaux — semi-conducteurs, systèmes, infrastructure et opérations — afin d’aider les organisations à gérer la complexité et à accélérer l’innovation à grande échelle.
Pour les centres de données AI, la mise à l’échelle du calcul dépendra de la rapidité des puces, mais aussi de l’efficacité de l’intégration de l’alimentation, du refroidissement, de la mémoire, de la connectivité et de l’encapsulation.




