Een chip voor snelheid
Inferentie is het deel van AI dat plaatsvindt nadat een model is getraind, wanneer het daadwerkelijk een verzoek verwerkt en een reactie genereert. Voor veel toepassingen is die snelheid het verschil tussen een tool die responsief aanvoelt en een die traag aanvoelt. De Groq 3 LPX richt zich op het topsegment van dat spectrum, waar elke milliseconde telt.
Volledige productie betekent dat het ontwerp definitief is en dat de units op grote schaal worden gefabriceerd. Dat brengt de chip van een testfase naar iets dat klanten daadwerkelijk kunnen bestellen. NVIDIA heeft nog niet bekendgemaakt wanneer systemen met de Groq 3 LPX worden geleverd, of welke datacenterpartners als eerste aan de beurt zijn.



