NVIDIA inicia produção em massa do Groq 3 LPX para acelerar agentes de IA de baixa latência

Racks de inferência registram 3.400 tokens/s em teste; parceiros em nuvem e a SpaceXAI já planejam implantações.

Ontem, 21:53

A NVIDIA anunciou que os racks de inferência Groq 3 LPX entraram em produção plena e que benchmarks de fornecedores registraram 3.400 tokens por segundo em uma execução de longo contexto com o modelo Gemma 4 31B.

Publicidade · Cloudways
Hospede na Cloudways com desconto de 30% por 3 meses
Cupom: CODEBR30X3

Os aceleradores Groq 3 LPX vêm em racks LPX com SRAM no chip e são apresentados como uma solução focada em latência, para complementar as GPUs Rubin e as CPUs Vera da NVIDIA, acelerando a etapa de decodificação — a geração de tokens — em cargas de trabalho agentic.

A provedora de nuvem Nebius foi citada como a primeira adotante, planejando oferecer o Groq 3 LPX por meio do Nebius Token Factory para dar aos desenvolvedores serviços de agentes mais rápidos e responsivos.

A NVIDIA divulgou alegações de eficiência do sistema Vera Rubin NVL72 de até 30x maior throughput por megawatt e até 35x menor custo por token em comparação com sistemas anteriores; esses números vêm de medições da própria empresa e de parceiros.

A SpaceXAI comprometeu‑se com implantação em larga escala das CPUs Vera e do Vera Rubin na Terra e informou planos de adaptar uma versão Vera Rubin NVL72 otimizada para espaço a bordo do satélite Starmind, com lançamento previsto para o 4.º trimestre de 2027. Segundo a NVIDIA e parceiros, essa adaptação exigirá trabalhos extras em energia, dissipação de calor e confiabilidade.

Resumo produzido a partir de 14 fontes em 8 veículos · Powered by Anchooor
Publicidade · Cloudways
Hospede na Cloudways com desconto de 30% por 3 meses
Ver oferta