AMD y Cerebras se alían para disparar hasta 5 veces la eficiencia de la inferencia de IA

 AMD y Cerebras se alían para disparar hasta 5 veces la eficiencia de la inferencia de IA

Mientras la carrera de la IA se centra en quién entrena el modelo más grande, otra batalla igual de decisiva se libra en la infraestructura que lo ejecuta después: la inferencia. AMD y Cerebras acaban de anunciar una alianza técnica que promete acelerarla hasta 5 veces por vatio.

Una arquitectura «desagregada»: cada chip hace lo suyo

El anuncio, hecho durante el evento Advancing AI 2026 de AMD, combina dos piezas de hardware con fortalezas distintas en un único flujo de trabajo:

  • AMD Helios (racks con GPUs Instinct): procesa el prompt inicial y las ventanas de contexto largas, donde el volumen y el rendimiento por lote mandan.
  • Cerebras Wafer-Scale Engine: genera los tokens de salida en tiempo real, priorizando la latencia mínima frente al volumen.

Según las mediciones de AMD Performance Labs y Cerebras con el modelo Kimi 2.6 de 1 billón de parámetros, esta división del trabajo ofrece hasta 5 veces más tokens por segundo y por vatio que una configuración basada solo en Cerebras, tal y como detallan la sala de prensa de AMD y el comunicado de Cerebras.

Infografía de la arquitectura de inferencia desagregada de AMD y Cerebras anunciada en julio de 2026: AMD Helios procesa el prompt por throughput, Cerebras Wafer-Scale Engine genera los tokens con latencia mínima, con un resultado de hasta 5 veces más tokens por segundo y por vatio, disponible en Cerebras Cloud en la segunda mitad de 2026

Por qué ahora: la inferencia se ha partido en dos mercados

La clave del anuncio es reconocer que ya no existe «un» tipo de carga de inferencia. Hay tareas masivas por lotes que priorizan el volumen, y hay aplicaciones en tiempo real —copilotos de código, agentes autónomos, robótica— que no toleran ni un segundo de retraso.

La inferencia de IA se está convirtiendo en una de las mayores oportunidades de infraestructura dentro de la IA, y su creciente diversidad exige un enfoque más flexible.

Esa es la idea que trasladó la consejera delegada de AMD, Lisa Su, al presentar el acuerdo: en lugar de forzar un solo chip a hacerlo todo, dividir el problema entre dos arquitecturas especializadas. El consejero delegado de Cerebras, Andrew Feldman, coincidió al señalar que la demanda de inferencia ultrarrápida crece a un ritmo sin precedentes, según recoge el análisis de Yahoo Finance.

Cerebras desplegará los racks AMD Helios en sus propios centros de datos, y la solución conjunta llegará primero a través de Cerebras Cloud en la segunda mitad de 2026.

Toque Personal: la factura energética también es una decisión de negocio

Cuando hablamos de IA en pymes solemos fijarnos en el precio por token, pero hay un coste que casi nadie mira: la energía necesaria para servir cada respuesta. Este acuerdo es un recordatorio de que la eficiencia energética de la inferencia acabará bajando —tarde o temprano— al precio que pagas por usar cualquier asistente de IA.

Tres lecturas prácticas para un negocio que depende de herramientas de IA:

  • La bajada de precios por token no es magia: viene de mejoras de hardware como esta, y suele tardar meses en trasladarse al usuario final.
  • La ventaja de Nvidia ya no es incuestionable: alianzas como esta entre AMD y Cerebras, o la que AMD firmó apenas un día antes con Anthropic, buscan romper su dominio en el mercado de chips de IA.
  • Si tu producto usa IA en tiempo real (chat, voz, agentes), la latencia del proveedor que elijas seguirá siendo, durante 2026, un factor de decisión tan importante como el precio.

¿Se rompe el monopolio de Nvidia en la inferencia?

Ninguna alianza aislada tumba a un líder que domina la mayoría del mercado de chips de IA, pero la acumulación de acuerdos como este sugiere que 2026 será el año en que la inferencia —no solo el entrenamiento— se convierta en el verdadero campo de batalla del hardware. ¿Crees que estas alianzas conseguirán abaratar de verdad el acceso a la IA para las pequeñas empresas, o el ahorro se quedará solo en los grandes centros de datos? Te leo en los comentarios.

Simplifica con IA

https://negociosoptimizados.com

Simplifica con IA es el equipo editorial de Negocios Optimizados, especializado en inteligencia artificial aplicada a negocios y tecnología. Con más de 5 años cubriendo la industria tech, analizamos los avances más relevantes en IA, automatización empresarial y transformación digital. Nuestro enfoque combina experiencia técnica en machine learning, desarrollo de software y estrategia empresarial para ofrecer análisis prácticos y accionables. Publicamos diariamente las noticias de IA más impactantes y su impacto real en empresas y profesionales.

Quizás te interese...

Dejar un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Transformación Digital en Empresas

Suscríbete al newsletter y obtén acceso gratuito a herramientas y guías diseñadas para impulsar tu negocio

Herramienta para convertir, optimizar y geolocalizar imágenes online. Guía completa para optimizar tu negocio en Google. Recopilación de +50 prompts de ChatGPT en español, ideales para marketing digital, SEO, programación, creación de imágenes y redes sociales.

Regalo en Newsletter
Optimización de imágenes
Grupo Negocios Facebook
Telegram