Huawei apresenta o OceanStor M900, armazenamento de memória de contexto que acelera a inferência de IA em data centers de hiperescala
XANGAI, 17 de setembro de 2026 /PRNewswire/ -- No HUAWEI CONNECT 2026, David Wang, vice-presidente do conselho de administração e presidente rotativo da Huawei, apresentou oficialmente o OceanStor M900 Context Memory Storage durante sua palestra. Projetado para a inferência de IA em data centers de hiperescala, o produto oferece aos SuperPoDs um espaço de memória totalmente compartilhado, com capacidade em escala de petabytes e desempenho na ordem de terabytes por segundo. Isso marca uma mudança na infraestrutura de IA, de um modelo centrado na computação para uma colaboração profunda entre computação, rede e armazenamento. Isso ajudará a liberar o poder computacional dos SuperPoDs.
Em 2026, testemunhamos a transição acelerada da IA, de avanços tecnológicos para implementação em larga escala. As aplicações de IA evoluíram de chatbots para agentes capazes de executar tarefas complexas de forma autônoma. Esses agentes são amplamente adotados em setores críticos, marcando o início da era da IA ativa.
À medida que os modelos de grande porte chegam à escala de 10 trilhões de parâmetros, os SuperPoDs estão se tornando a escolha ideal para a infraestrutura de IA. Os principais modelos de grande porte já suportam janelas de contexto que ultrapassam um milhão de tokens. A inferência em múltiplas etapas e as tarefas complexas tornaram-se a norma, e os dados de cache KV gerados durante a inferência continuam crescendo. Essas tendências levaram a memória on-chip e a DRAM além de seus limites de capacidade e custo-benefício. Tornou-se consenso na indústria construir um sistema de armazenamento em múltiplas camadas que coordene memória on-chip, DRAM e SSDs para criar um espaço de memória totalmente compartilhado, com capacidade massiva.
A Huawei apresentou o OceanStor M900 Context Memory Storage para superar os gargalos de capacidade de memória em contextos ultralongos e na inferência em múltiplas etapas. O OceanStor M900 utiliza a rede UnifiedBus para construir um cache KV global de vários níveis, em escala de petabytes, com conexões de um único salto. Isso libera todo o potencial computacional dos SuperPoDs e acelera a inferência de IA em data centers de hiperescala. O armazenamento de memória contextual OceanStor M900 possui três recursos principais:
Rompendo as barreiras de capacidade para impulsionar a IA em larga escala com memória massiva
Alimentado pela rede de interconexão UnifiedBus de alta velocidade, o cache KV permite o agrupamento e compartilhamento global com armazenamento em camadas. O cache KV dos SuperPoDs foi expandido da memória on-chip e da DRAM para SSDs, permitindo que um único cluster ofereça 64 PB de capacidade. A capacidade de cache KV disponível por NPU foi ampliada de gigabytes para terabytes, permitindo armazenar, compartilhar e reutilizar mais contexto. Isso aumenta significativamente a taxa de acerto do cache KV.
Aumentando o desempenho da inferência e libera todo o potencial computacional
O OceanStor M900 é a primeira arquitetura do setor a integrar a CPU, a unidade de controle de rede e a unidade de controle NAND. Ele fornece semântica KV nativa para permitir uma conexão de um único salto entre a NPU do SuperPoD e os SSDs. Isso elimina a necessidade de conversão de protocolo e encaminhamento pela CPU, reduzindo a latência de acesso de milissegundos para 60 microssegundos, uma redução de 90%. Um único cluster oferece 40 TB/s de largura de banda de acesso agregada, 1,5 vez maior que a de soluções similares. Em cenários típicos de programação de IA, essa arquitetura dobra a taxa de transferência de tokens do cluster de inferência e reduz pela metade o tempo até o primeiro token, convertendo poder computacional em produtividade.
Reduzindo o custo por token para viabilizar a adoção econômica da IA em larga escala
O OceanStor M900 utiliza a primeira tecnologia de armazenamento adaptativo com reconhecimento de KV do setor, que prevê os ciclos de vida do cache KV com base no valor dos dados e os distribui de forma inteligente entre as mídias de armazenamento. Esta tecnologia permite até 24 gravações de unidade por dia (DWPD), prolongando a resistência do SSD em 16 vezes e garantindo estabilidade por três anos. Ao reduzir os custos de substituição de mídia e de operação e manutenção, a tecnologia diminui os custos de longo prazo da infraestrutura de inferência de IA em larga escala e acelera a adoção da IA.
À medida que a IA se expande para os principais sistemas de produção em diversos setores, a infraestrutura de IA está evoluindo de um modelo centrado na computação para uma colaboração mais estreita entre computação, rede e armazenamento. O armazenamento de memória de contexto será essencial para aprimorar continuamente a capacidade e a eficiência de acesso dos caches KV de inferência em hiperescala.
FONTE Huawei
Partilhar este artigo