Qortora · Search · Indexed page

servernews.ruFetched 2026-08-15T03:52:44Z

NVIDIA Vera: 88 «олимпийских» Arm-ядер для ИИ-агентов

Arm-процессоры NVIDIA Vera, специально разработанные для агентных ИИ-нагрузок, получили 88 кастомных ядер Olympus с поддержкой необычной многопоточности и улучшенной архитектурой, 164 Мбайт L3-кеша, монолитный кристалл, а также контроллеры LPDDR5X-9600, NVLink-C2C и PCIe 6.4

Open original source · Full cached text

NVIDIA Vera: 88 «олимпийских» Arm-ядер для ИИ-агентов NVIDIA Vera: 88 «олимпийских» Arm-ядер для ИИ-агентов 10.08.2026 [08:00], Владимир Мироненко Arm-процессоры NVIDIA Vera, специально разработанные для агентных ИИ-нагрузок, получили 88 кастомных ядер Olympus с поддержкой необычной многопоточности и улучшенной архитектурой, 164 Мбайт L3-кеша, монолитный кристалл, а также контроллеры LPDDR5X-9600, NVLink-C2C и PCIe 6.4 arm cpu nvidia vera Ядро NVIDIA Olympus с ISA ARMv9.2 было разработано в рамках экстремального совместного проектирования для платформы Vera Rubin, охватывающей CPU, GPU, сети, хранилища, подсистемы памяти и ПО, что позволило оптимизировать ИИ-фабрику в целом. Ядро Olympus разработано для ускорения нерегулярных, ресурсоёмких (с большим количеством ветвлений) и чувствительных к задержкам процессов, которые всё больше определяют сквозную производительность ИИ-платформы целиком. В особенности при работе с нагрузками ИИ-агентов, которых становится всё больше. Источник изображений: NVIDIA Ядро Olympus ориентировано на максимизацию количества исполняемых инструкций за такт (IPC) для высококонкурентных рабочих нагрузок ИИ. Оно сочетает в себе высокую производительность в однопоточном режиме, большую ширину конвейера, глубокое внеочередное выполнение и передовые технологии ускорения работы памяти для эффективного выполнения агентного ИИ, обучения с подкреплением, анализа данных и крупномасштабных программных рабочих нагрузок. Ядро включает оптимизированный предсказатель ветвлений, «умный» планировщик, оптимизированные для векторных задач исполнительные блоки и оптимизированную с точки зрения снижения задержек кеш-подсистему. Среды выполнения агентов, интерпретаторы, компиляторы, графовая аналитика и фреймворки обработки данных нередко сочетают большой объём инструкций с частыми изменениями потока управления. Для решения этих проблем в Olympus предусмотрены расширенное предсказание ветвлений, высокоскоростная выборка инструкций и декодер шириной в 10 инструкций. Olympus включает нейронный предсказатель ветвлений, способный с высокой точностью оценивать две ветки за такт. Блок выборки может передавать из L1-кеша до 16 инструкций за такт (128 байт) в очередь декодирования длиной 48 инструкций, которая отдаёт декодеру до 10 fuse-инструкций. Агентные задачи часто включают длинные, зависимые от результатов исполнения предыдущих инструкций цепочки команд, включая интерпретацию кода, обход объектов (traversing), управление состоянием во время исполнения и навигацию по графоподобным структурам данных. При этом производительность зависит не только от скорости выборки инструкций, но и от способности обнаруживать независимые участки исполняемого кода. Ядро Olympus разработано для выявления и ускорения этого скрытого параллелизма. Расширенный механизм переименования и аллокации сочетается с большим буфером переупорядочивания и обширным объёмом физических регистров, что позволяет увеличить глубину внеочередного исполнения. Возможности устранения зависимостей, включая переименование, прогнозирование значений и ускорение критических путей исполнения, помогают уменьшить задержки в работе из-за слишком большого количества указателей в коде, сериализованных операций с памятью и длинных цепочек зависимостей. Вместе эти функции повышают производительность исполнения команд, улучшают IPC и повышают скорость однопоточных вычислений в условиях нерегулярных ветвлений кода, характерных для агентов, сред обучения с подкреплением и современной ИИ-инфраструктуры. Как отметил ServeTheHome, NVIDIA не раскрывает размер важнейшего буфера переупорядочивания. Также не раскрывается размер регистровых файлов, используемых для переименования. Вместе с тем сообщается, что ядро CPU способно переименовывать до 10 микроопераций за цикл, не отставая от декодера. Также примечательно, что NVIDIA использует переименование памяти (по аналогии с переименованием регистров) — метод, который применяется в последних разработках AMD. Согласно NVIDIA, это позволяет Olympus выполнять зависимые инструкции (store-to-load) ещё до завершения загрузки (load), если взаимосвязь данных может быть предсказана или заранее определена. Кроме того, Olympus выявляет стабильно повторяющиеся последовательности инструкций и последовательные же данные, что расширяет возможности спекулятивного исполнения, позволяя заранее предугадывать результат вычислений (он всё равно потом проверяется). Дополнительно ядро старается избегать ненужных перемещений данных. По словам NVIDIA, всё это повышает IPC, что и нужно агентным нагрузкам, тогда как традиционные серверные x86-процессоры полагаются на более высокие тактовые частоты для повышения однопоточного быстродействия. Динамический планировщик Olympus управляет широким набором исполнительных блоков для целочисленных и векторных операций, ветвления, криптографических операций, загрузки и выгрузки данных, поддерживаемых широким бэкэндом и глубоким внеочередным выполнением. Эта сбалансированная конструкция помогает Olympus эффективно обрабатывать нагрузки с большим количеством ветвлений, производить векторизованную обработку данных, предварительную обработку ИИ, шифрование, сжатие, аналитику и другие требовательные к памяти (memory-intensive) рабочие нагрузки. Для рабочих нагрузок агентов, которые часто являются импульсными, событийными и перемежающимися с фоновой системной активностью, важна многопоточность, но не совсем типичная. Вместо традиционной одновременной многопоточности (SMT), которая может привести к конкуренции за блок предсказания ветвлений, декодер, исполнительные блоки, кеш и память, в результате чего активность одного потока может снижать производительность другого, NVIDIA использует т.н. пространственную многопоточность (Spatial Multithreading). NVIDIA SMT позволяет разделить ресурсы ядра между двумя аппаратными потоками, что даёт Olympus возможность работать как высокопроизводительному однопоточному ядру, когда требуется максимальная производительность на поток (соседний поток обрабатывает только операции управления), или в режиме двух изолированных потоков, когда требуется более высокая плотность. Это повышает утилизацию ресурсов и даёт более предсказуемое поведение под нагрузкой в части задержки и пропускной способности. Каждое ядро Olympus имеет довольно большой набор исполнительных блоков. Так, имеется восемь простых ALU для целочисленных арифметических операций и ветвлений, но в дополнение пара ALU поддерживает обработку сложных арифметических операций (умножение/деление), а ещё пара — CRC, сдвиг и т.д. Базовые операции ALU выполняются за один цикл, в то время как умножение может быть выполнено всего за два цикла, а деление — за 5–20 циклов в завис…