Компания NVIDIA ускорила работу искусственного интеллекта до уровня, при котором сложные задачи выполняются почти без задержек. Новый ускоритель NVIDIA Groq 3 LPX для обработки запросов ИИ вышел в полноценное производство и показал рекордную скорость генерации текста в тестах с моделью Gemma 4 31B.
NVIDIA Groq 3 LPX стал расширением платформы Vera Rubin NVL72 и предназначен для систем с ИИ-агентами, которые самостоятельно выполняют цепочки действий: пишут код, анализируют файлы, вызывают инструменты и проверяют результаты. Для таких систем скорость, с которой генерируется каждый новый фрагмент текста, напрямую влияет на время выполнения задачи.
В независимом тестировании Artificial Analysis ускоритель NVIDIA Groq 3 LPX достиг скорости 3400 токенов в секунду при работе с моделью Gemma 4 31B и контекстом на 100 000 токенов. NVIDIA заявила, что результат стал самым высоким среди проверенных платформ для этой модели. Компания также утверждает, что система реагирует в четыре раза быстрее по сравнению с ближайшим конкурентным решением.
В отличие от классических систем, где основное внимание уделяется обучению моделей, Groq 3 LPX ориентирован на этап обработки запросов. Ускоритель помогает быстрее получать ответы от уже обученных моделей, что особенно важно для приложений, где ИИ должен выполнять много последовательных операций без заметных пауз.
«Обработка запросов становится главным двигателем роста ИИ. Платформа Vera Rubin продолжает развивать вычисления для эпохи ИИ-агентов, обеспечивая сверхбыструю генерацию текста и новые возможности для масштабирования», – заявил глава NVIDIA Дженсен Хуанг .
Первым облачным провайдером, который внедрит NVIDIA Groq 3 LPX в рабочую инфраструктуру, станет Nebius . Компания добавит ускорители в платформу Nebius Token Factory, чтобы разработчики получили доступ к высокой скорости генерации через существующий программный интерфейс без перехода на новую инфраструктуру.
После Nebius одним из первых поставщиков, который планирует использовать новую платформу, станет компания Groq . NVIDIA рассчитывает, что Groq 3 LPX поможет облачным компаниям создавать более быстрые сервисы для корпоративных пользователей и разработчиков.
Новая система входит в экосистему Vera Rubin, которая объединяет несколько специализированных компонентов для ИИ-инфраструктуры. В состав платформы входят ускорители, центральные процессоры Vera, сетевые устройства и системы хранения NVIDIA. Компания заявляет, что такая архитектура повышает производительность многокомпонентных ИИ-систем и снижает задержки при работе нескольких агентов одновременно.