En un comunicado, Multiverse Computing ha anunciado este miércoles una colaboración con Qualcomm Technologies para llevar modelos de IA «altamente eficientes» a centros de datos, de modo que los modelos de inteligencia artificial de la compañía con sede en San Sebastián estarán especializados para las plataformas Qualcomm Dragonfly AI200 y AI250.
La empresa ha destacado que esta colaboración «combina el ‘hardware’ de aceleración de IA de Qualcomm Technologies con la tecnología de optimización de modelos de Multiverse Computing para ofrecer a los operadores de centros de datos una forma de ejecutar cargas de trabajo de IA a gran escala con mayor rendimiento y menor consumo energético».
Para los operadores de centros de datos, «el beneficio directo es una mayor capacidad con el mismo hardware», han añadido. Además, han explicado que «al optimizar los modelos de IA antes de que se ejecuten en los aceleradores Qualcomm Dragonfly AI200 y AI250», Multiverse Computing «reduce la huella de cómputo y memoria que requiere cada modelo», lo cual «libera margen en los despliegues existentes, y permite a los operadores atender más solicitudes de inferencia, ejecutar más modelos de forma simultánea o escalar sus servicios de IA sin añadir nuevos aceleradores ni ampliar la infraestructura del centro de datos».
Tal como subraya, estas «mejoras de eficiencia» se demostraron en directo durante MWC Barcelona 2026, donde Multiverse Computing y Qualcomm Technologies presentaron un modelo de lenguaje de gran tamaño (LLM) de código abierto y comprimido, ejecutándose sobre el acelerador Qualcomm Cloud AI100 Ultra.
En un caso de uso de generación de informes médicos de emergencia en tiempo real, la demostración del modelo comprimido «logró tiempos de respuesta hasta un 93% más rápidos y un rendimiento hasta un 44% superior respecto al modelo base sin comprimir, además de reducir el uso de memoria hasta en un 45% y el consumo energético hasta en un 21%, sin pérdida de precisión», han destacado desde Multiverse Computing.
En una segunda demostración, un chatbot de generación aumentada por recuperación (RAG, por sus siglas en inglés) desplegado ‘on-premise’ para consultar documentos financieros confidenciales «funcionó hasta un 35% más rápido y ofreció un rendimiento hasta un 54% superior, además de reducir el uso de memoria hasta en un 45% y el consumo energético hasta en un 14%, de nuevo sin pérdida de precisión».
Se espera que las aplicaciones que se ejecuten sobre los nuevos aceleradores Qualcomm Dragonfly AI200 y AI250 ofrezcan resultados de referencia «aún mejores», han finalizado.

