La carrera por la inteligencia artificial suele medirse en chips. Más GPU, más NPU, más FLOPS.
Pero a medida que los modelos crecen y empiezan a operar como agentes capaces de mantener conversaciones largas, consultar documentos y ejecutar secuencias de tareas, aparece otro problema: dónde guardar y cómo mover toda la memoria temporal que necesitan mientras trabajan.
Huawei presentó en HUAWEI CONNECT 2026 dos piezas pensadas para atacar ese cuello de botella: el Atlas 960E SuperPoD, orientado a entrenamiento e inferencia de modelos de hasta 10 billones de parámetros, y OceanStor M900, un sistema de almacenamiento de contexto que puede alcanzar 64 petabytes por clúster.
Atlas 960E puede escalar hasta 4.096 NPU
El Atlas 960E SuperPoD utiliza la interconexión UnifiedBus y el motor óptico Hi-ONE de Huawei. Según la compañía, un único SuperPoD puede escalar hasta 4.096 NPU y entregar 8 EFLOPS en precisión FP8 o 16 EFLOPS en FP4.
Huawei sostiene además que la arquitectura evita utilizar decenas de miles de módulos ópticos 800G que serían necesarios en una configuración tradicional y que eso reduce el consumo eléctrico en más de 550 kW.
La disponibilidad declarada por la empresa es de 99,8%. Son cifras del fabricante y deben entenderse dentro de las condiciones de diseño y prueba comunicadas por Huawei.
El problema aparece cuando la IA necesita recordar demasiado
Durante la inferencia, los modelos generan una estructura conocida como KV cache. En términos simples, es una memoria temporal que permite reutilizar información ya procesada en vez de recalcular todo desde cero.
Mientras más largo es el contexto y más turnos mantiene un agente, mayor puede ser esa memoria. El desafío es que la memoria más rápida y cercana a los procesadores es cara y limitada.
Ahí entra OceanStor M900.
OceanStor M900 extiende el contexto desde memoria rápida hacia SSD
Huawei diseñó OceanStor M900 para extender parte de esa KV cache hacia almacenamiento SSD conectado a alta velocidad. La compañía afirma que un único clúster puede alcanzar 64 PB de capacidad y un ancho de banda agregado de 40 TB/s.
La arquitectura integra CPU, controlador de red y controlador NAND para permitir un acceso de un solo salto entre las NPU y los SSD.
Según Huawei, eso reduce la latencia de acceso hasta 60 microsegundos, cerca de 90% menos que una arquitectura convencional utilizada como comparación por la empresa.
Por qué la memoria puede transformarse en el próximo cuello de botella
Un modelo puede tener enorme capacidad de cómputo disponible y aun así quedar esperando datos. Ese tiempo muerto importa especialmente en cargas de inferencia donde miles de usuarios o agentes consultan información de forma simultánea.
Huawei sostiene que, en escenarios habituales de programación con IA, OceanStor M900 puede duplicar el throughput de tokens y reducir a la mitad el tiempo hasta el primer token. Nuevamente, son métricas declaradas por el fabricante y no una garantía aplicable a cualquier modelo o infraestructura.
Más contexto no significa necesariamente una IA mejor
Que un sistema pueda almacenar cantidades gigantescas de contexto no resuelve por sí solo todos los problemas de los modelos.
La utilidad real depende de cómo la aplicación selecciona, organiza y recupera la información relevante.
Una memoria enorme puede ser inútil si el agente no sabe qué buscar o si recupera información equivocada. Pero la infraestructura sí determina cuánto contexto puede mantenerse disponible sin disparar costos o tiempos de respuesta.
Huawei también está abriendo CANN
El anuncio incluye un componente de software. Huawei informó que CANN, su plataforma para el ecosistema Ascend, pasó a un modelo de desarrollo abierto y continuo impulsado por la comunidad.
Eso forma parte de la estrategia de la compañía para competir no solamente con hardware, sino también con un ecosistema que pueda ejecutar modelos y aplicaciones sobre su infraestructura.
La carrera de la IA empieza a ser una carrera de sistemas completos
Durante años la discusión estuvo concentrada en quién tenía el acelerador más rápido. Ahora la escala obliga a mirar el sistema completo: procesadores, red, memoria, almacenamiento, refrigeración y software.
Atlas 960E y OceanStor M900 representan exactamente esa transición.
El desafío ya no es únicamente hacer más operaciones por segundo.
También es mantener suficiente contexto disponible para que miles de agentes puedan trabajar sin pasar buena parte del tiempo esperando datos.
Te puede interesar
La IA está encareciendo la RAM: por qué 2026 puede ser un mal año para actualizar tu PC gamer
La demanda de servidores de inteligencia artificial está absorbiendo capacidad de memoria y mantiene la DRAM bajo presión. Si tu PC todavía tiene suficiente RAM, 2026 puede ser un mejor momento para mejorar monitor, refrigeración, periféricos o ergonomía antes que pagar precios elevados por más memoria.
Los agentes de IA necesitan identidad y permisos propios: el nuevo problema que NTT DATA y Palo Alto quieren resolver
NTT DATA y Palo Alto Networks ampliaron su alianza para proteger entornos donde agentes de IA pueden acceder a datos y ejecutar acciones. La seguridad empieza a tratar a estos sistemas como nuevas identidades digitales con privilegios, registros y límites propios.
Tras los temporales en Coquimbo, más de 700 celulares y baterías buscan resolver un problema básico: seguir conectados
Entel y Desafío Levantemos Chile desplegaron un COE móvil por Canela, Illapel y Salamanca y contemplan entregar más de 700 celulares y baterías portátiles. Durante las lluvias, la demanda por mensajería de emergencia creció con fuerza en la región.
Un gemelo digital chileno promete detectar fugas mineras en menos de dos minutos: así funciona Pipeline-RTO
SPF Ingeniería desarrolló Pipeline-RTO, una plataforma que combina modelos físicos, inteligencia artificial y datos operacionales para monitorear ductos mineros. La empresa afirma que ya ha sido aplicada en más de cinco grandes faenas chilenas.
Confianza en la IA: el 97,2% de los usuarios corrige sus recomendaciones al menos algunas veces
Un estudio de IDC patrocinado por SAS muestra que casi todos los usuarios corrigen o anulan recomendaciones de IA en algún momento. La falta de explicabilidad aparece como una de las principales razones y la confianza cae aún más cuando los sistemas actúan con mayor autonomía.
Este dron puede volar a oscuras “tocando” las paredes y necesita solo 34 KB de memoria
Investigadores de TU Delft desarrollaron un sistema táctil inspirado en los bigotes de los roedores. El dron puede evitar obstáculos, seguir superficies y explorar espacios cerrados sin depender de cámaras ni GPS.

Average Rating