На Hot Chips 2026 NVIDIA раскрыла архитектуру Vera уже не как набор красивых характеристик, а как довольно цельную инженерную систему. В центре здесь не рекордное число ядер само по себе, а попытка решить знакомую проблему серверного CPU: один процесс может ждать данные, другой требует высокой пропускной способности, а десятки параллельных задач начинают мешать друг другу. Olympus должен сделать это поведение более предсказуемым, а Vera собрать вокруг него память и межсоединения так, чтобы задержка отдельных операций не терялась под нагрузкой.

Vera получила 88 собственных Arm-ядер Olympus и рассчитана на 176 аппаратных потоков за счёт NVIDIA Spatial Multithreading. Чип использует несколько кристаллов на одном interposer, восемь 128-битных контроллеров LPDDR5X, второе поколение Scalable Coherency Fabric, NVLink-C2C и современный набор линий ввода-вывода. На уровне идеи это CPU не столько для максимального количества потоков в классических серверных задачах, сколько для быстрого выполнения большого числа неоднородных действий, которые постоянно возникают вокруг AI-моделей.

Olympus делает ставку на широкий pipeline и высокую производительность одного потока

Архитектурная логика Vera начинается с Olympus. Это первая собственная процессорная архитектура NVIDIA для серверного CPU после Grace, где компания использовала готовое Arm-решение. Olympus построен на Arm v9.2-A и спроектирован с заметным приоритетом на single-thread performance. Внутри используются широкий frontend, 10-wide decode, крупный блок предсказания ветвлений и глубокое внеочередное исполнение.

10-wide decode особенно показателен. Процессор может декодировать до десяти инструкций за такт на соответствующем участке frontend, после чего задача переходит к сложной системе планирования и исполнению. Но широкое декодирование само по себе не гарантирует ускорения. Если программа часто ошибается в переходах или простаивает из-за памяти, свободные исполнительные ресурсы не превращаются автоматически в полезную работу. Поэтому Olympus получил не только широкий decode, но и серьёзный упор на предсказание поведения программы. NVIDIA отдельно указывает на neural branch predictor и глубокое out-of-order исполнение как на элементы, рассчитанные на нерегулярный и ветвящийся код.

Для обычного серверного приложения это означает знакомую вещь: чем быстрее конкретный поток проходит свою последовательность инструкций, тем меньше времени занимает операция, которую нельзя эффективно разложить на сотни независимых потоков. Для agentic AI это особенно заметно. Запрос агента может породить запуск инструмента, выполнение кода, обработку результата, обращение к данным и новый шаг принятия решения. Каждая такая стадия может быть сравнительно короткой, но цепочка получается длинной и чувствительной к задержкам.

Именно поэтому сравнивать Vera только по количеству ядер было бы неправильно. 88 ядер выглядят внушительно, но смысл Olympus раскрывается в сочетании ширины ядра, предсказания ветвлений, кэширования и поведения двух потоков на одном ядре.

Spatial Multithreading разделяет ресурсы вместо обычной борьбы потоков

Самая необычная часть Vera связана с многопоточностью. NVIDIA называет её Spatial Multithreading, и здесь принцип отличается от привычного SMT. В классическом SMT два аппаратных потока одного ядра конкурируют за значительную часть внутренних ресурсов процессора. Это позволяет лучше загрузить ядро, когда один поток не способен использовать все его возможности, но у такого подхода есть обратная сторона: активность одного потока может ухудшать характеристики другого.

В Vera ресурсы ядра статически разделяются между двумя потоками. Условно это можно представить как две рабочие зоны внутри одного физического ядра. При этом данные и состояние, связанные с кэшами и общей инфраструктурой, не оказываются полностью изолированными. Такая схема позволяет сохранить преимущества одновременной работы двух потоков, но уменьшить непредсказуемую конкуренцию за ключевые ресурсы.

На Hot Chips NVIDIA показала этот эффект на тестах SPEC CPU 2017 intrate. В презентации рассматривался так называемый noisy neighbor effect: сначала измеряется производительность одного потока, затем рядом запускается второй поток. Для обычной схемы многопоточности рост нагрузки может заметно менять скорость первого потока. Идея Spatial Multithreading состоит в том, чтобы сделать такую деградацию более контролируемой.

Это важная разница именно для серверной среды. Если CPU обслуживает тысячи небольших задач, оператору важна не только максимальная скорость в идеальных условиях. Намного важнее, насколько предсказуемо будет вести себя задача, когда рядом уже работают другие процессы.

Представить ситуацию можно достаточно просто. Один поток компилирует небольшой фрагмент кода, второй выполняет Python-операцию, третий процесс обслуживает запрос к данным, а ещё один запускает короткий sandbox. Для таких сценариев средняя загрузка процессора может выглядеть вполне нормально, но отдельная задача способна внезапно получить больше задержки из-за конкуренции за ресурсы. Spatial Multithreading пытается уменьшить именно эту проблему.

Высокая скорость одного потока нужна агентам из-за цепочек коротких операций

У agentic AI есть архитектурная особенность, которую легко потерять за разговорами о GPU. Модель может генерировать решение, но дальше начинается работа CPU. Нужно запустить программу, обработать инструментальный вызов, обратиться к файлам или базе данных, подготовить следующий шаг, проверить результат и передать его обратно в вычислительный контур.

В одном большом параллельном расчёте такие операции можно было бы рассматривать как небольшую часть общей работы. В агентном pipeline ситуация другая. Последовательность действий содержит зависимости, и следующая операция часто начинается только после завершения предыдущей. Ускорение одной стадии сокращает время всей цепочки, если именно она находится на критическом пути.

NVIDIA поэтому делает акцент на производительности одного потока и на предсказуемой задержке. В материалах компании Vera позиционируется для компиляции, выполнения кода, Python runtime, аналитики, orchestration и других CPU-зависимых операций. В заявленных результатах для трёх agentic-сценариев NVIDIA указывает ускорение до 1,8 раза относительно современных x86 CPU, причём показатели для отдельных задач различаются.

Здесь есть важная оговорка. Agentic workload пока нельзя свести к одному универсальному тесту вроде классического SPEC. Поведение агента зависит от модели, инструментов, структуры запросов, размера данных и количества последовательных шагов. Поэтому цифры 1,5-1,8 раза разумнее воспринимать как результаты конкретных сценариев, а не как универсальный коэффициент ускорения любого программного обеспечения.

С практической точки зрения архитектура Vera интересна другим. NVIDIA пытается уменьшить время CPU-участков в том месте, где GPU уже не может продолжать работу самостоятельно. Чем быстрее CPU проходит такие участки, тем меньше ожидание между отдельными действиями agentic pipeline.

Восемь контроллеров LPDDR5X дают Vera необычную для сервера память

Второй крупный архитектурный выбор касается памяти. Vera использует восемь 128-битных контроллеров LPDDR5X. На уровне платформы это позволяет получить до 1,2 ТБ/с пропускной способности и до 1,5 ТБ памяти при использовании восьми SOCAMM2 модулей.

Здесь интересно не только число 1,2 ТБ/с. Для серверного CPU гораздо важнее сочетание пропускной способности, ёмкости и энергопотребления. Традиционная серверная память RDIMM удобна своей масштабируемостью и сервисными возможностями, но при большом количестве каналов она становится заметной частью энергетического бюджета системы. NVIDIA выбрала LPDDR5X именно как более энергоэффективный вариант и связала её с модульным форм-фактором SOCAMM2. По данным, представленным на Hot Chips, полностью загруженная память Vera потребляет примерно 30-40 Вт.

Для процессора с 88 крупными ядрами это имеет прямой смысл. Если ядро способно быстро выполнять инструкции, но регулярно ждёт данные, дополнительные вычислительные блоки не решают проблему. Высокая пропускная способность памяти позволяет обслуживать больше обращений одновременно и снижает вероятность того, что вычислительная часть будет простаивать.

У LPDDR5X есть и другой эффект. Она помогает увеличить bandwidth per core. NVIDIA заявляет до двух раз большей общей пропускной способности и до трёх раз большей пропускной способности на ядро по сравнению с ведущими x86 CPU с DDR5 в своих сравнениях. Это особенно интересно для задач, где несколько потоков одновременно ходят по большим и плохо локализованным структурам данных.

Кэш и Scalable Coherency Fabric связывают 88 ядер в единый вычислительный массив

Между ядрами и памятью находится второе поколение NVIDIA Scalable Coherency Fabric. Оно связывает ядра, кэш, память, I/O и NVLink-C2C внутри вычислительной части Vera. В системе используется крупный общий кэш, а внутренняя fabric рассчитана на высокую пропускную способность.

В Vera интересна и компоновка нескольких кремниевых компонентов. На представленном модуле NVIDIA показаны отдельные элементы для вычислений, памяти и I/O, объединённые в одну систему. В результате производитель может распределять разные функции между отдельными кусками кремния, не превращая весь процессор в один огромный монолит.

Для agentic-нагрузок важно то, что происходит внутри системы после попадания данных на CPU. Небольшая задача может быстро перемещаться между разными структурами данных, а несколько параллельных процессов могут обращаться к общей памяти. В такой ситуации coherency fabric становится не просто служебной связкой, а одним из главных элементов производительности.

В NVIDIA заявляют до 3,4 ТБ/с двунаправленной пропускной способности SCF. Система объединяет ядра и кэш так, чтобы они получали согласованный доступ к данным даже при высокой загрузке CPU. Такой подход хорошо сочетается с общей концепцией Vera: вместо максимального количества отдельных блоков компания старается контролировать путь данных внутри вычислительного пространства.

Отдельное значение имеет графовый prefetcher. Он нужен не для красивого увеличения теоретической производительности, а для конкретной проблемы нерегулярного доступа к памяти. Когда программа перемещается по связанным структурам данных, обычный последовательный prefetch работает хуже. Предсказать следующий адрес сложнее, поэтому CPU чаще сталкивается с ожиданием памяти.

Для agentic-программ это вполне естественный сценарий. Код инструментов, таблицы, графовые структуры, метаданные и различные runtime-объекты не обязательно располагаются в памяти последовательно. Чем лучше процессор угадывает следующий нужный блок, тем меньше пауза между отдельными инструкциями.

NVLink-C2C превращает Vera в часть связки с Rubin GPU

Vera не задумывалась как изолированный серверный процессор. Она рассчитана на работу рядом с ускорителями NVIDIA Rubin, поэтому между CPU и GPU используется когерентный NVLink-C2C.

Заявленная пропускная способность достигает 1,8 ТБ/с между Vera и GPU. В результате CPU и GPU могут работать с общим согласованным пространством данных, что особенно важно для систем, где CPU выполняет orchestration, обработку данных и подготовку операций, а GPU занимается основной модельной нагрузкой.

Для agentic pipeline это можно представить как связку двух разных типов вычислений. GPU быстро выполняет большие параллельные операции модели. CPU обслуживает то, что плохо укладывается в такой шаблон: запуск кода, системную логику, обработку инструментов, управление окружениями и последовательные участки.

Чем быстрее проходит передача между этими частями, тем меньше вероятность, что ускоритель окажется в ожидании следующего задания. Поэтому NVLink-C2C в Vera имеет не просто роль быстрого интерфейса. Он является частью общей схемы сокращения задержки между CPU- и GPU-участками.

PCIe и CXL расширяют Vera за пределы самой CPU подсистемы

Vera получает 96 линий PCIe/CXL, что позволяет строить вокруг процессора полноценную серверную инфраструктуру с подключением ускорителей, сетевых устройств и других компонентов.

Для обычного сервера количество линий PCIe уже давно является одним из ограничителей конфигурации. В AI-инфраструктуре это становится ещё заметнее. Процессору приходится работать не только с памятью и GPU, но и с сетью, накопителями, DPU, ускорителями и устройствами, которые участвуют в передаче данных.

CXL добавляет к этой схеме возможности когерентного подключения памяти и устройств. В случае Vera это соответствует общей архитектурной идее: CPU должен быть не просто вычислительным блоком, а центральным узлом, который быстро обрабатывает данные и управляет большим количеством внешних компонентов.

При этом основная ставка всё равно сделана не на расширение I/O ради самого I/O. Оно нужно для того, чтобы 88 ядер и широкая память не существовали в изоляции. В реальном AI-сервере производительность определяется всей цепочкой, а не одним показателем CPU.

Почему Spatial Multithreading особенно интересен при высокой загрузке

Разница между Spatial Multithreading и классическим SMT лучше всего проявляется не в рекламной таблице характеристик, а в поведении системы под нагрузкой.

Условное классическое SMT говорит: если второй поток может использовать простаивающие ресурсы ядра, пусть использует их. Это эффективный способ повысить общую загрузку. Но если два потока одновременно захотят одни и те же ресурсы, возникает конкуренция.

Spatial Multithreading исходит из другой логики. Ресурсы распределяются между потоками заранее, поэтому один поток не должен бесконтрольно забирать то, что требуется соседнему. Цена такой схемы очевидна: нельзя так же свободно перераспределять весь ресурс ядра между потоками. Зато появляется более стабильная характеристика задержки.

Для agentic AI эта сделка выглядит логично. Если сервер одновременно выполняет огромное количество sandbox-сред, каждая из которых периодически просыпается, выполняет небольшой фрагмент работы и снова ждёт, предсказуемость может быть полезнее максимальной эффективности одного идеально подобранного потока.

Получается интересный компромисс. Vera не отказывается от двух потоков на ядро. Она меняет сам принцип их сосуществования. Вместо постоянной борьбы за общие ресурсы используется пространственное разделение с возможностью обмена данными через общую инфраструктуру.

Сильная сторона Vera раскрывается не в одном блоке, а в связке всей архитектуры

Если разложить Vera на отдельные компоненты, почти каждый из них выглядит знакомо. Широкое Arm-ядро, предсказание ветвлений, out-of-order исполнение, кэш, высокоскоростная память, когерентная связь с GPU и PCIe/CXL давно существуют по отдельности.

Новизна появляется при объединении этих элементов вокруг одной цели. Olympus пытается ускорить один поток. Spatial Multithreading пытается сохранить предсказуемость при двух потоках. LPDDR5X обеспечивает высокий bandwidth при ограниченном энергопотреблении. SCF связывает ядра и память внутри вычислительной системы. NVLink-C2C сокращает путь между CPU и GPU.

Именно эта комбинация делает Vera интересной как архитектурный эксперимент. NVIDIA фактически пытается подстроить серверный CPU под новую структуру программной нагрузки, где GPU отвечает за крупную модельную работу, а CPU постоянно обрабатывает множество небольших, зависимых и часто нерегулярных задач.

В такой системе один очень быстрый поток иногда ценнее нескольких дополнительных потоков, которые просто делят между собой ограниченный ресурс. Но полностью отказаться от многопоточности тоже нельзя, потому что количество параллельных окружений может быть огромным. Spatial Multithreading становится способом совместить эти требования.

Что означает Vera для задержки agentic pipeline

Главный эффект архитектуры можно представить через критический путь agentic pipeline. Допустим, агенту нужно выполнить несколько последовательных действий. Модель сформировала команду, CPU запускает инструмент, инструмент обращается к данным, затем результат возвращается в runtime, где принимается решение о следующем шаге.

GPU может выполнять основную модель очень быстро, но если между двумя большими вычислениями возникает несколько CPU-операций, именно они становятся видимыми паузами для пользователя.

Ускорение каждой отдельной CPU-операции сокращает эти паузы. А более предсказуемая работа двух потоков снижает вероятность того, что одна перегруженная часть системы внезапно увеличит задержку другой. Высокая пропускная способность памяти уменьшает ожидание данных, а NVLink-C2C сокращает стоимость обмена с ускорителем.

Это не означает, что Vera автоматически ускорит любой agentic workload в 1,8 раза. Архитектура имеет смысл там, где CPU действительно находится на критическом пути. Если приложение ограничено GPU, сетью или внешней базой данных, быстрый CPU сам по себе не устранит этот узел.

Но если узким местом являются компиляция, Python, анализ кода, sandbox execution и orchestration, архитектура Vera попадает точно в проблему. NVIDIA сама приводит ускорение до 1,8 раза для выбранных agentic-сценариев, а материалы по Olympus отдельно подчёркивают высокую производительность одного потока и снижение задержек в нерегулярном коде.

Vera в итоге выглядит не как попытка построить ещё один универсальный CPU с максимальным количеством потоков. Это более конкретный проект: 88 широких Olympus-ядер, пространственное разделение двух потоков, 1,2 ТБ/с LPDDR5X, большой общий кэш, быстрый внутренний fabric и прямой когерентный путь к GPU. На Hot Chips 2026 NVIDIA показала, что все эти решения связаны одной задачей: сделать CPU-часть AI-инфраструктуры быстрее и предсказуемее там, где короткие последовательные операции начинают определять скорость всей цепочки.

Именно поэтому главный вопрос вокруг Vera теперь не сводится к тому, насколько быстро работает отдельное ядро. Гораздо интереснее, насколько хорошо Olympus будет сокращать суммарное время выполнения реального agentic pipeline, когда тысячи таких операций одновременно проходят через сервер. Если заявленная архитектурная модель подтвердит себя на широком наборе практических задач, ставка NVIDIA на специализированную организацию CPU окажется одним из заметных направлений развития серверных процессоров для AI-инфраструктуры.