CoreWeave первой выводит в продакшен NVIDIA Vera Rubin NVL72: Devin ускорил генерацию кода в 4,8 раза
На CoreWeave Fully Connected объявлена доступность NVIDIA Vera Rubin NVL72 с сетью Spectrum-X 102.4T Ethernet. Первым продакшен-клиентом стала Cognition с ИИ-инженером Devin: на реальных задачах разработки ПО пропускная способность токенов выросла до 4,8 раза против GB200 NVL72. Также анонсированы CPU NVIDIA Vera для агентов и платформа CoreWeave Forge.

Первоисточник: blogs.nvidia.com
Что объявила CoreWeave на Fully Connected
На конференции CoreWeave Fully Connected в Сан-Франциско CoreWeave объявила о доступности систем NVIDIA Vera Rubin NVL72 с сетью Spectrum-X 102.4T Ethernet в облаке CoreWeave Cloud. Компания называет себя одним из первых облачных провайдеров, передающих эту платформу клиентам. Одновременно анонсированы CPU NVIDIA Vera — первый CPU, созданный для ИИ-агентов, — и платформа CoreWeave Forge для обучения, оценки и улучшения моделей и агентов на ускорителях NVIDIA.
Вице-президент NVIDIA по гиперскейлу и высокопроизводительным вычислениям Иан Бак подчеркнул, что ускорители NVIDIA приносят пользу на протяжении поколений: GPU V100 в CoreWeave продолжают обслуживать нагрузки клиентов почти десять лет после запуска Volta, даже когда CoreWeave выводит Vera Rubin NVL72 в продакшен. По его словам, это и есть сила платформы NVIDIA — инфраструктура, которая окупается годами, и гибкость размещения нужного GPU под нужную нагрузку.
NVIDIA Vera Rubin NVL72 в продакшене: конфигурация и сеть Spectrum-X 102.4T Ethernet
CoreWeave объявила о доступности NVIDIA Vera Rubin NVL72 в CoreWeave Cloud. Ранние клиенты получают доступ к производительности полнофункциональной платформы «ИИ-фабрики» NVIDIA. Продакшен-кластер Vera Rubin для Cognition был поднят за считаные дни — как результат совместной разработки NVIDIA и CoreWeave по всему стеку, от инфраструктуры до обслуживаемых токенов.
- Управление мощностями доступно через CoreWeave Kubernetes Service.
- Также задействованы SUNK, CoreWeave Mission Control, CoreWeave Sandboxes и CoreWeave Inference.
- Сеть построена на Spectrum-X 102.4T Ethernet.
Cognition и Devin: первый продакшен-клиент на Vera Rubin
Первым клиентом, запустившим продакшен-нагрузки на Vera Rubin, стала Cognition — прикладная ИИ-лаборатория, создавшая ИИ-инженера Devin. Cognition выполняет на CoreWeave обучение, обучение с подкреплением и продакшен-инференс для Devin. Компания масштабировалась до тысяч GPU на CoreWeave за девять месяцев, обеспечивая инференс-нагрузки Cognition.
В начале месяца CoreWeave получила первые продакшен-стойки Vera Rubin NVL72. Вскоре после этого Cognition протестировала инференс-производительность Vera Rubin относительно базовой линии GB200 NVL72 на реальной нагрузке разработки ПО.
Тест на реальной нагрузке: 4,8x рост пропускной способности токенов против GB200 NVL72
Для генерации нагрузки Cognition выбрала подмножество задач из FrontierCode и развернула ИИ-агентов для их решения. В ранних тестах Vera Rubin NVL72 показала до 4,8-кратного увеличения общей пропускной способности токенов для инференс-нагрузок SWE-2 по сравнению с GB200 NVL72.
| Платформа | Нагрузка | Результат |
|---|---|---|
| NVIDIA Vera Rubin NVL72 | SWE-2 инференс (задачи FrontierCode) | до 4,8x роста общей пропускной способности токенов |
| GB200 NVL72 | SWE-2 инференс (задачи FrontierCode) | базовая линия |
Что это значит для генерации кода и многошагового reasoning
Для Devin эти результаты означают более быструю генерацию кода в реальном времени и более отзывчивый многошаговый reasoning. Силас Альберти из команды основателей Cognition отметил, что агентное программирование — сложная нагрузка: длинные контексты, высокая конкурентность и объёмы токенов, где стоимость токена определяет, что можно выпускать. По его словам, наличие всего этого на одной платформе с инженерами NVIDIA и CoreWeave, которые решают сложные задачи вместе с ними, значит больше, чем любая отдельная спецификация.
CPU NVIDIA Vera: 128 CPU и 11 264 ядра в стойке для агентных сред
Агентный ИИ давит на инфраструктуру с двух сторон: обслуживание агентов требует низколатентных вычислений в масштабе, а улучшение через пост-обучение — тысяч изолированных сред, работающих одновременно. NVIDIA Vera CPU создан специально для агентных нагрузок. Ключевая метрика — сколько изолированных агентных сред можно запустить одновременно и насколько стабильно и производительно каждая из них работает при росте их числа.
Развёртывание Vera у CoreWeave даёт 128 CPU и 11 264 ядра в одной стойке — этого достаточно для более чем 11 000 одновременных сред по одному ядру на каждую. С CoreWeave Sandboxes эти среды аппаратно изолированы и работают рядом с поддерживающими их обучающими задачами, а коммутаторы Spectrum-X Ethernet и DPU BlueField-4 обеспечивают безопасную высокопроизводительную связь агентов с низкой задержкой.
Ускорение старта агентных песочниц и результаты Terminal-Bench
В тестах CoreWeave добилась более чем 3-кратного ускорения запуска агентных песочниц на CPU NVIDIA Vera, ускоряя и масштабируя свои песочницы — слой исполнения для обучения с подкреплением (RL), использования инструментов агентами и оценки моделей, позволяющий ИИ-командам запускать код в изолированных средах на CoreWeave. На Terminal-Bench CoreWeave зафиксировала 1,7-кратный прирост производительности на Vera CPU по всем пройденным задачам.
CoreWeave Forge: единая среда обучения, оценки и улучшения моделей и агентов
Модели и агенты улучшаются в цикле: продакшен-поведение информирует следующий обучающий прогон, а каждая оценка оттачивает следующую версию. Исторически этот цикл был разбит между инструментами разных вендоров, и на каждой передаче сигнал терялся. CoreWeave Forge объединяет Weights & Biases, экспертизу по пост-обучению от OpenPipe и открытый проект ноутбуков marimo в одной связанной среде для непрерывного улучшения моделей и агентов. Она остаётся открытой для моделей, фреймворков и облаков.
CoreWeave ARIA, Agent Lens и Sandboxes: что стало общедоступным
- CoreWeave ARIA — теперь общедоступна: помогает учиться, исследовать, писать код и итерировать по циклу ИИ, анализируя прогоны, предлагая эксперименты и изменения кода с сохранением в GitHub и возвращая практические доказательства: что вызвало изменение и какие эксперименты запускать дальше.
- CoreWeave Agent Lens — новый сервис: превращает наблюдаемость продакшен-агентов в непрерывное улучшение и понятные инсайты. Улучшает обнаружение сбоев на 20% и исправляет проблемы вдвое дешевле, превращая десятки миллионов продакшен-трасс агентов в инсайты для исправлений.
- CoreWeave Sandboxes — теперь общедоступны: позволяют запускать агентов, вызовы инструментов, RL и оценки в изолированных CPU- или GPU-средах, на serverless-инфраструктуре или на той, где уже идёт обучение, давая свежую изолированную среду для каждого вызова инструмента, RL-прогона или оценки.
Serverless RL и RL Rollouts на базе NVIDIA Dynamo
Пост-обучение улучшает качество модели и снижает задержки и затраты, используя собственные продакшен-сигналы пользователей, без необходимости в обучающем кластере. Serverless supervised fine-tuning и serverless RL позволяют экспериментировать с собственными рецептами обучения. Serverless RL обучается в 1,4 раза быстрее и на 40% дешевле, чем самостоятельно управляемая конфигурация.
NVIDIA Dynamo — открытый фреймворк инференса для ИИ-фабрик — обеспечивает работу управляемого инференс-сервиса CoreWeave, а также RL Rollouts, которые сейчас в приватном превью. RL Rollouts загружает новые чекпоинты в живое развёртывание во время его работы, так что обучение с подкреплением продолжается без переразвёртываний, а пост-обучение получает ту же эффективность инференса, что и продакшен.
Клиенты и отрасли: Canva, Capital One, MasterClass, Ennoble Care
Среди первых компаний, строящих на Forge, — Canva, Capital One и MasterClass. Открытые модели NVIDIA Nemotron дают командам на Forge прямой путь к кастомизации и развёртыванию reasoning- и мультимодальных моделей для агентных сценариев.
В здравоохранении Ennoble Care — провайдер помощи на дому, обслуживающий около 50 000 пациентов с высокими потребностями по программе Medicare в 15 штатах, — выбрал CoreWeave для клинического ИИ-инференса. Компания будет использовать зарезервированные мощности GPU NVIDIA RTX PRO 6000 в CoreWeave Kubernetes Service для масштабирования ИИ-агентов для клинической документации, поддержки решений и автоматизации бэк-офиса.
Платформа NVIDIA и CoreWeave: от прототипа к продакшену
ИИ-лаборатории, AI-native компании и глобальные предприятия используют совместно разработанную платформу NVIDIA и CoreWeave, чтобы быстрее переходить от прототипа к продакшену. CoreWeave показывает рекордные результаты MLPerf в каждом раунде обучения и инференса. Это единственный облачный провайдер с платиновым рейтингом в SemiAnalysis ClusterMAX 1.0, 2.0 и 3.0, и он обслуживает девять из десяти ведущих ИИ-лабораторий. Вместе NVIDIA и CoreWeave дают клиентам платформу для превращения экспериментальных агентов в продакшен-системы, которые пишут ПО, поддерживают клиницистов и делают полезную работу в реальном мире.
Что такое NVIDIA Vera Rubin NVL72 в облаке CoreWeave?
Это система NVIDIA Vera Rubin NVL72 с сетью Spectrum-X 102.4T Ethernet, доступная в CoreWeave Cloud. CoreWeave называет себя одним из первых облачных провайдеров, передающих платформу клиентам; управление мощностями идёт через CoreWeave Kubernetes Service, SUNK, Mission Control, Sandboxes и Inference.
Насколько быстрее Devin работает на Vera Rubin NVL72?
В ранних тестах Cognition на реальной нагрузке разработки ПО (задачи из FrontierCode, инференс SWE-2) Vera Rubin NVL72 показала до 4,8-кратного роста общей пропускной способности токенов по сравнению с GB200 NVL72. Для Devin это означает более быструю генерацию кода и более отзывчивый многошаговый reasoning.
Что даёт CPU NVIDIA Vera для агентных сред?
Развёртывание Vera у CoreWeave даёт 128 CPU и 11 264 ядра в одной стойке — достаточно для более чем 11 000 одновременных сред по одному ядру. В тестах CoreWeave получила более чем 3-кратное ускорение запуска агентных песочниц и 1,7-кратный прирост на Terminal-Bench по всем пройденным задачам.
Что входит в CoreWeave Forge?
Forge объединяет Weights & Biases, экспертизу по пост-обучению от OpenPipe и открытый проект marimo в одной среде. В неё входят общедоступные ARIA и Sandboxes, новый Agent Lens, serverless supervised fine-tuning и serverless RL, а также RL Rollouts на базе NVIDIA Dynamo в приватном превью.