Read Time:3 Minute

La carrera por la inteligencia artificial suele medirse en chips. Más GPU, más NPU, más FLOPS.

Pero a medida que los modelos crecen y empiezan a operar como agentes capaces de mantener conversaciones largas, consultar documentos y ejecutar secuencias de tareas, aparece otro problema: dónde guardar y cómo mover toda la memoria temporal que necesitan mientras trabajan.

Huawei presentó en HUAWEI CONNECT 2026 dos piezas pensadas para atacar ese cuello de botella: el Atlas 960E SuperPoD, orientado a entrenamiento e inferencia de modelos de hasta 10 billones de parámetros, y OceanStor M900, un sistema de almacenamiento de contexto que puede alcanzar 64 petabytes por clúster.

Atlas 960E puede escalar hasta 4.096 NPU

El Atlas 960E SuperPoD utiliza la interconexión UnifiedBus y el motor óptico Hi-ONE de Huawei. Según la compañía, un único SuperPoD puede escalar hasta 4.096 NPU y entregar 8 EFLOPS en precisión FP8 o 16 EFLOPS en FP4.

Huawei sostiene además que la arquitectura evita utilizar decenas de miles de módulos ópticos 800G que serían necesarios en una configuración tradicional y que eso reduce el consumo eléctrico en más de 550 kW.

La disponibilidad declarada por la empresa es de 99,8%. Son cifras del fabricante y deben entenderse dentro de las condiciones de diseño y prueba comunicadas por Huawei.

El problema aparece cuando la IA necesita recordar demasiado

Durante la inferencia, los modelos generan una estructura conocida como KV cache. En términos simples, es una memoria temporal que permite reutilizar información ya procesada en vez de recalcular todo desde cero.

Te puede interesar  Gemini hackeó tres empresas reales por error: el problema no fue que la IA “escapara”

Mientras más largo es el contexto y más turnos mantiene un agente, mayor puede ser esa memoria. El desafío es que la memoria más rápida y cercana a los procesadores es cara y limitada.

Ahí entra OceanStor M900.

OceanStor M900 extiende el contexto desde memoria rápida hacia SSD

Huawei diseñó OceanStor M900 para extender parte de esa KV cache hacia almacenamiento SSD conectado a alta velocidad. La compañía afirma que un único clúster puede alcanzar 64 PB de capacidad y un ancho de banda agregado de 40 TB/s.

La arquitectura integra CPU, controlador de red y controlador NAND para permitir un acceso de un solo salto entre las NPU y los SSD.

Según Huawei, eso reduce la latencia de acceso hasta 60 microsegundos, cerca de 90% menos que una arquitectura convencional utilizada como comparación por la empresa.

Por qué la memoria puede transformarse en el próximo cuello de botella

Un modelo puede tener enorme capacidad de cómputo disponible y aun así quedar esperando datos. Ese tiempo muerto importa especialmente en cargas de inferencia donde miles de usuarios o agentes consultan información de forma simultánea.

Huawei sostiene que, en escenarios habituales de programación con IA, OceanStor M900 puede duplicar el throughput de tokens y reducir a la mitad el tiempo hasta el primer token. Nuevamente, son métricas declaradas por el fabricante y no una garantía aplicable a cualquier modelo o infraestructura.

Te puede interesar  Los agentes de IA necesitan identidad y permisos propios: el nuevo problema que NTT DATA y Palo Alto quieren resolver

Más contexto no significa necesariamente una IA mejor

Que un sistema pueda almacenar cantidades gigantescas de contexto no resuelve por sí solo todos los problemas de los modelos.

La utilidad real depende de cómo la aplicación selecciona, organiza y recupera la información relevante.

Una memoria enorme puede ser inútil si el agente no sabe qué buscar o si recupera información equivocada. Pero la infraestructura sí determina cuánto contexto puede mantenerse disponible sin disparar costos o tiempos de respuesta.

Huawei también está abriendo CANN

El anuncio incluye un componente de software. Huawei informó que CANN, su plataforma para el ecosistema Ascend, pasó a un modelo de desarrollo abierto y continuo impulsado por la comunidad.

Eso forma parte de la estrategia de la compañía para competir no solamente con hardware, sino también con un ecosistema que pueda ejecutar modelos y aplicaciones sobre su infraestructura.

La carrera de la IA empieza a ser una carrera de sistemas completos

Durante años la discusión estuvo concentrada en quién tenía el acelerador más rápido. Ahora la escala obliga a mirar el sistema completo: procesadores, red, memoria, almacenamiento, refrigeración y software.

Atlas 960E y OceanStor M900 representan exactamente esa transición.

El desafío ya no es únicamente hacer más operaciones por segundo.

También es mantener suficiente contexto disponible para que miles de agentes puedan trabajar sin pasar buena parte del tiempo esperando datos.

Average Rating

5 Star
0%
4 Star
0%
3 Star
0%
2 Star
0%
1 Star
0%

Agregar un comentario

Tu dirección de correo electrónico no será publicada. Los campos requeridos están marcados *

NTT DATA y Palo Alto Networks anuncian alianza para seguridad de inteligencia artificial Previous post Los agentes de IA necesitan identidad y permisos propios: el nuevo problema que NTT DATA y Palo Alto quieren resolver
La ciencia detrás de un buen perfil en apps de citas: cuánto importan realmente la foto, la bio y lo que cuentas Next post La ciencia detrás de un buen perfil en apps de citas: cuánto importan realmente la foto, la bio y lo que cuentas
Ads Blocker Image Powered by Code Help Pro

¡Ayúdanos!

Los anuncios nos permiten mantener este proyecto vivo. Ayúdanos desactivando tu bloqueador de anuncios y danos una mano.

Powered By
100% Free SEO Tools - Tool Kits PRO