
Huawei lance OceanStor M900, une solution de stockage à mémoire contextuelle, pour accélérer l'inférence IA dans les centres de données hyperscale
SHANGHAI, 17 septembre 2026 /PRNewswire/ -- Lors de la conférence HUAWEI CONNECT 2026, David Wang, vice-président du conseil d'administration et président tournant de Huawei, a officiellement présenté la solution de stockage à mémoire contextuelle OceanStor M900 lors de son discours d'ouverture. Conçu pour l'inférence IA dans les centres de données hyperscale, ce produit dote les SuperPoDs d'un espace mémoire entièrement partagé offrant une capacité de l'ordre du pétaoctet et des performances de l'ordre du téraoctet par seconde. Cela marque une évolution de l'infrastructure d'IA, qui passe d'un modèle axé sur le calcul à une collaboration étroite entre le calcul, le réseau et le stockage. Cela permettra de libérer toute la puissance de calcul des SuperPoDs.
L'année 2026 a été marquée par une transition accélérée de l'IA, passant des avancées technologiques à une mise en œuvre à grande échelle. Les applications d'IA ont évolué, passant des chatbots à des agents capables d'accomplir de manière autonome des tâches complexes. Ces agents sont largement utilisés dans des secteurs stratégiques, marquant ainsi le début de l'ère de l'IA agentique.
À mesure que les grands modèles atteignent des ordres de grandeur de 10 000 milliards de paramètres, les SuperPoDs s'imposent comme le choix optimal en matière d'infrastructure d'IA. Les grands modèles courants prennent déjà en charge des fenêtres de contexte dépassant le million de tokens ; l'inférence à plusieurs tours et les tâches complexes sont désormais la norme, et le volume de données générées par le cache KV lors de l'inférence ne cesse d'augmenter. Ces tendances ont poussé la mémoire intégrée et la DRAM au-delà de leurs limites en termes de capacité et de rapport qualité-prix. Il est désormais communément admis dans le secteur qu'il convient de mettre en place un système de stockage à plusieurs niveaux qui coordonne la mémoire intégrée, la DRAM et les SSD afin de créer un espace mémoire entièrement partagé doté d'une capacité considérable.
Huawei a lancé la solution de stockage de mémoire contextuelle OceanStor M900 afin de surmonter les goulots d'étranglement liés à la capacité de mémoire dans les contextes très longs et les inférences à plusieurs itérations. OceanStor M900 utilise le réseau UnifiedBus pour mettre en place un cache KV global à plusieurs niveaux offrant une capacité de l'ordre du pétaoctet, avec des connexions en un seul saut. Cela permet d'exploiter pleinement le potentiel de puissance de calcul des SuperPoDss et d'accélérer l'inférence IA dans les centres de données hyperscale. La solution de stockage en mémoire contextuelle OceanStor M900 présente trois fonctionnalités clés :
Repousser les limites de capacité pour optimiser l'IA à grande échelle grâce à la mémoire massive
Grâce au réseau d'interconnexion haut débit UnifiedBus, le cache KV permet une mise en commun et un partage globaux avec un système de stockage à plusieurs niveaux. Le cache KV des SuperPoDs passe de la mémoire intégrée et de la DRAM aux SSD, ce qui permet à un seul cluster d'offrir une capacité de 64 Po. La capacité de cache KV disponible par NPU passe de quelques gigaoctets à plusieurs téraoctets, ce qui permet de stocker, de partager et de réutiliser davantage de contexte. Cela améliore considérablement le taux de réussite du cache KV.
Améliorer les performances d'inférence pour exploiter pleinement la puissance de calcul
L'OceanStor M900 est la première architecture du secteur à intégrer le processeur, le contrôleur réseau et le contrôleur NAND. Il offre une sémantique KV native permettant une connexion en un seul saut entre la NPU du SuperPoDs et les SSD. Cela évite toute conversion de protocole et tout transfert par le processeur, ce qui réduit considérablement la latence d'accès, qui passe de quelques millisecondes à 60 microsecondes, soit une réduction de 90 %.. Un seul cluster offre une bande passante d'accès agrégée de 40 To/s, soit 1,5 fois celle des solutions concurrentes. Dans les scénarios classiques de programmation d'IA, cette architecture double le débit de jetons du cluster d'inférence et réduit de moitié le temps nécessaire pour obtenir le premier jeton, transformant ainsi la puissance de calcul en productivité.
Réduire les coûts des jetons afin de favoriser une adoption économique rentable de l'IA à grande échelle
L'OceanStor M900 utilise la première technologie de stockage adaptative tenant compte des clés-valeurs (KV) du secteur, qui prédit les cycles de vie du cache KV en fonction de la valeur des données et répartit intelligemment celles-ci entre les différents supports de stockage. Cette technologie permet d'atteindre jusqu'à 24 écriture par jour (DWPD), ce qui multiplie par 16 la durée de vie des SSD et garantit sa stabilité pendant trois ans. En réduisant les coûts liés au remplacement des supports et à l'exploitation et à la maintenance, cette solution diminue les coûts à long terme des infrastructures d'inférence IA à grande échelle et favorise une adoption plus rapide de l'IA.
À mesure que l'IA s'étend aux principaux systèmes de production dans tous les secteurs d'activité, son infrastructure évolue, passant d'un modèle axé sur le calcul vers une collaboration plus étroite entre le calcul, le réseau et le stockage. Le stockage en mémoire contextuelle sera essentiel pour améliorer en permanence la capacité et l'efficacité d'accès aux caches KV d'inférence à très grande échelle.
Share this article