Nueva plataforma de NVIDIA alcanza 3.400 tokens por segundo con un modelo de lenguaje de gran tamaño

La empresa NVIDIA aceleró el trabajo de la inteligencia artificial hasta un nivel en el que las tareas complejas se ejecutan casi sin latencia. El nuevo acelerador NVIDIA Groq 3 LPX para el procesamiento de solicitudes de IA entró en producción completa y mostró una velocidad récord de generación de texto en pruebas con el modelo Gemma 4 31B.
NVIDIA Groq 3 LPX es una extensión de la plataforma Vera Rubin NVL72 y está pensado para sistemas con agentes de IA que ejecutan cadenas de acciones de forma autónoma: escriben código, analizan archivos, llaman a herramientas y verifican resultados. Para esos sistemas, la velocidad con la que se genera cada nuevo fragmento de texto influye directamente en el tiempo total de ejecución.
En pruebas independientes de Artificial Analysis, el acelerador NVIDIA Groq 3 LPX alcanzó una velocidad de 3400 tokens por segundo al trabajar con el modelo Gemma 4 31B y un contexto de 100 000 tokens. NVIDIA declaró que el resultado fue el más alto entre las plataformas verificadas para este modelo. La compañía también sostiene que el sistema responde cuatro veces más rápido en comparación con la solución competitiva más cercana.
A diferencia de los sistemas clásicos, donde la atención principal se centra en el entrenamiento de modelos, Groq 3 LPX está orientado a la etapa de procesamiento de solicitudes. El acelerador ayuda a obtener respuestas más rápido de modelos ya entrenados, algo especialmente importante en aplicaciones donde la IA debe realizar muchas operaciones secuenciales sin pausas notables.
«El procesamiento de solicitudes se está convirtiendo en el principal motor del crecimiento de la IA. La plataforma Vera Rubin continúa desarrollando la computación para la era de los agentes de IA, ofreciendo generación de texto ultrarrápida y nuevas posibilidades de escalado», declaró el director ejecutivo de NVIDIA Jensen Huang.
El primer proveedor en la nube que incorporará NVIDIA Groq 3 LPX en su infraestructura de producción será Nebius. La compañía añadirá los aceleradores a la plataforma Nebius Token Factory para que los desarrolladores accedan a la alta velocidad de generación mediante la interfaz de software existente sin migrar a una infraestructura nueva.
Tras Nebius, uno de los primeros proveedores que planea utilizar la nueva plataforma será la empresa Groq. NVIDIA espera que Groq 3 LPX ayude a las empresas en la nube a crear servicios más rápidos para usuarios corporativos y desarrolladores.
El nuevo sistema forma parte del ecosistema Vera Rubin, que agrupa varios componentes especializados para la infraestructura de IA. La plataforma incluye aceleradores, procesadores centrales Vera, dispositivos de red y sistemas de almacenamiento de NVIDIA. La compañía afirma que esa arquitectura mejora el rendimiento de sistemas de IA multicomponente y reduce la latencia cuando varios agentes trabajan simultáneamente.