NVIDIA coloca Groq 3 LPX em produção completa
Nebius vai usar os racks para oferecer inferência mais rápida e premium a agentes de IA altamente interativos
A NVIDIA informou que os racks de inferência Groq 3 LPX estão em produção completa e serão implantados na Token Factory da Nebius para uso comercial ainda este ano.
A empresa citou um benchmark da Artificial Analysis que registrou 3.400 tokens de saída por segundo no modelo Gemma 4 31B com contexto de 100.000 tokens — número que a NVIDIA apresenta como recorde, mas que é reportado pelo fornecedor e precisa de verificação independente.
Cada rack LPX contém 256 chips Groq 3 e foi projetado para acelerar a fase de decodificação ou geração de tokens dos modelos. A NVIDIA posiciona esses racks como um complemento específico para essa carga de trabalho às suas plataformas Vera Rubin e às GPUs, e não como substituto.
Segundo a NVIDIA, a geração de tokens mais rápida permitirá que provedores de nuvem ofereçam camadas de serviço de baixa latência com preço mais alto e torne tarefas agenticas — como codificação em múltiplas etapas e uso de ferramentas em tempo real — mais responsivas para os usuários.
O lançamento acontece após a compra, por US$20 bilhões, dos ativos da Groq pela NVIDIA, e entra num mercado competitivo que inclui a parceria da AMD com a Cerebras e o modo Ultrafast da OpenAI. Testes com clientes reais e benchmarks independentes deverão influenciar a adoção.