NVIDIA представила процессор Vera с 88 Arm-ядрами для ИИ-агентов
NVIDIA раскрыла подробности серверного процессора Vera, который станет центральной частью платформы Vera Rubin. Чип получил 88 собственных Arm-ядер Olympus и создавался не как универсальная замена обычным серверным CPU, а прежде всего для современных ИИ-нагрузок.
Главная цель архитектуры — ускорить работу ИИ-агентов и других задач, где процессору приходится постоянно переключаться между большим количеством ветвлений, зависимых операций и обращений к памяти.
В основе Vera лежат новые ядра Olympus
Каждое ядро Olympus использует архитектуру ARMv9.2 и спроектировано NVIDIA специально для будущих ИИ-систем. Компания сделала ставку не только на высокую частоту, но и на увеличение количества инструкций, которые процессор способен выполнять за один такт.
Для этого ядро получило широкий конвейер, глубокое внеочередное выполнение, улучшенное предсказание ветвлений и развитую подсистему памяти. Декодер может обрабатывать до 10 инструкций за такт, а блок выборки — передавать из кеша L1 до 16 инструкций за такт.
Такая конструкция полезна для ИИ-агентов, интерпретаторов, компиляторов и графовой аналитики, где код часто меняет направление выполнения.
NVIDIA изменила подход к многопоточности
Вместо обычной технологии SMT, при которой два потока одновременно конкурируют за одни и те же ресурсы ядра, NVIDIA реализовала собственную пространственную многопоточность Spatial Multithreading.
Ресурсы Olympus можно разделить между двумя аппаратными потоками. В одном режиме почти все возможности ядра отдаются основному потоку, чтобы получить максимальную однопоточную производительность. В другом ядро обслуживает два более изолированных потока и повышает общую плотность вычислений.
В ядре есть восемь простых целочисленных ALU, дополнительные блоки для сложной арифметики и шесть 128-битных SVE2-блоков с поддержкой FP8.
Процессор получил крупную кеш-подсистему
Одной из главных проблем ИИ-агентов является не только скорость вычислений, но и ожидание данных. Поэтому NVIDIA заметно усилила кеширование.
На каждое ядро приходится 64 Кбайт кеша L1 для инструкций, 96 Кбайт L1 для данных и 2 Мбайт кеша L2. Весь процессор дополнительно имеет 164 Мбайт общего кеша L3.
Ядра, память и интерфейсы объединяет когерентная внутренняя шина SCF с пропускной способностью 3,4 Тбайт/с. Это почти втрое больше пропускной способности внешней памяти.
Vera работает с LPDDR5X-9600 через восемь каналов. Максимальный объем памяти достигает 1,5 Тбайт, а суммарная пропускная способность — 1,2 Тбайт/с.
Vera рассчитан на тесную работу с GPU
Процессор создавался как часть общей платформы, поэтому большое внимание уделено соединению с ускорителями. Интерфейс NVLink-C2C обеспечивает до 1,8 Тбайт/с в дуплексном режиме и позволяет объединять компоненты с единым адресным пространством.
Кроме того, Vera получил 88 линий PCIe 6.4 и поддержку CXL 3.1. В двухсокетной системе число линий может достигать 176.
CXL позволяет подключать дополнительную память и гибче распределять ее между компонентами крупных ИИ-систем.
NVIDIA сравнила Olympus с AMD Zen 5
Для демонстрации архитектуры NVIDIA сравнила свои ядра с серверным процессором AMD EPYC 9755 на базе Zen 5. В четырех агентных нагрузках компания заявляет до 1,9 раза более высокий показатель IPC у Olympus в однопоточном режиме.
Также заявлено до 2,3 раза больше предсказаний ветвлений за цикл и до 2,4 раза больше операций выборки инструкций за такт. Vera, по данным NVIDIA, обеспечивает вдвое меньшие задержки между ядрами, на 40% меньшую задержку доступа к памяти под полной нагрузкой и почти в четыре раза большую пропускную способность памяти на ядро.
Показатели получены в тестах NVIDIA, поэтому окончательные выводы потребуют независимых сравнений. AMD уже обещает, что следующее поколение EPYC Venice будет быстрее Vera.
Vera показывает, как меняется роль центрального процессора в ИИ-серверах. CPU здесь нужен не только для обслуживания системы вокруг GPU: NVIDIA пытается оптимизировать его под те части агентных задач, где важны быстрые ветвления, работа с памятью и высокая производительность одного потока.
