Intel раскрыла архитектуру Crescent Island на Hot Chips 2026, и главным сюрпризом здесь оказалась не попытка догнать самые мощные ускорители по пиковым FLOPS. Компания выбрала другой путь. Crescent Island создаётся как inference-ориентированный PCIe-ускоритель для agentic AI, где важны не только вычислительные блоки, но и стоимость обработки токенов, объём памяти, задержка и возможность установить карту в обычный сервер с воздушным охлаждением.

Внутри находятся 32 Xe3P Xe Core и 256 XMX-движков, а подсистема памяти построена вокруг LPDDR5X. Референсная конфигурация Intel получает 160 ГБ, тогда как конструкции ODM могут масштабировать объём до 480 ГБ. Заявленный предел мощности для PCIe-карты составляет 350 Вт, охлаждение воздушное, интерфейс подключения PCIe Gen5 x16. Такой набор параметров выглядит необычно на фоне ускорителей, где HBM становится почти обязательной частью высокопроизводительной AI-платформы.

Главный вопрос Crescent Island поэтому звучит иначе: достаточно ли более медленной памяти, если её намного больше, а сама карта потребляет 350 Вт? Ответ зависит от характера инференса. Для больших моделей, длинного контекста и множества одновременных агентных сессий объём памяти может оказаться более жёстким ограничением, чем пиковая пропускная способность.

32 Xe3P ядра и 256 XMX создают вычислительную основу ускорителя

Crescent Island состоит из четырёх Xe3P-срезов, в каждом из которых находится по восемь Xe Core. Всего получается 32 ядра. На каждое ядро приходится восемь Xe Vector Engines и восемь XMX matrix engines, поэтому полный GPU получает 256 векторных и 256 матричных исполнительных блоков.

Такое устройство показывает, для чего Intel проектировала Crescent Island. Это не универсальный GPU, которому одинаково важны обучение нейросетей, научные расчёты и графические задачи. В архитектуре сделан акцент на наиболее вычислительно насыщенные этапы инференса. XMX используется как основной механизм матричных операций, а поддержка широкого набора числовых форматов позволяет выбирать представление данных под конкретную нагрузку.

Для AI-инференса особенно интересен переход к низкой точности. Xe3P поддерживает FP4 и MXFP4, а архитектура охватывает диапазон вплоть до FP64. Для языковых моделей это позволяет уменьшать объём данных и стоимость вычислений там, где применение высокой точности не даёт соответствующего выигрыша в качестве. Одновременно FP64 оставляет ускорителю возможность работать с задачами, которым требуется значительно более высокая точность.

XMX в Crescent Island получил 16-deep systolic array. Это важная деталь, поскольку глубина матричного массива определяет то, как архитектура выполняет цепочки операций над матрицами. Вместе с изменениями в кэшах и регистрах этот блок рассчитан на то, чтобы вычислительные ресурсы меньше простаивали из-за перемещения данных.

Intel поэтому говорит не просто о количестве XMX. Вся архитектура Xe3P подстраивается под inference workload, где эффективность определяется не одной теоретической цифрой, а тем, насколько долго ускоритель способен поддерживать полезную загрузку.

32 МБ L2 помогают сократить давление на медленную внешнюю память

Одно из ключевых изменений Crescent Island находится в memory hierarchy. GPU получает 32 МБ унифицированного L2, а на уровне Xe Core увеличены локальные ресурсы, включая 1 МБ GRF и 512 КБ L1 на ядро. Это не случайный набор цифр. При использовании LPDDR5X кэш становится особенно важным, потому что внешняя память имеет более низкую пропускную способность, чем HBM.

В ускорителе с HBM можно позволить себе значительно более широкий канал к памяти и чаще обращаться к большим объёмам данных без настолько сильного падения пропускной способности. LPDDR5X устроена иначе. Она выигрывает по энергопотреблению и плотности, но не может конкурировать с HBM по абсолютной bandwidth.

Поэтому Crescent Island фактически делает ставку на иерархию. Данные, к которым вычислительные блоки обращаются чаще всего, должны как можно дольше оставаться ближе к ним. L1 обслуживает локальную работу ядра, общий L2 снижает число обращений к LPDDR5X, а большая внешняя память хранит веса, KV-cache и состояние множества сессий.

Для inference это особенно актуально при длинном контексте. KV-cache растёт вместе с объёмом обработанной последовательности и количеством параллельных запросов. Если памяти мало, приходится делить модель или состояние между несколькими ускорителями. Тогда появляются дополнительные обмены данными, а сама система становится сложнее.

480 ГБ в таком сценарии важны не как рекламная цифра, а как возможность держать больше данных внутри одной карты. Именно этот аспект Intel связывает с поддержкой крупных моделей, длинных контекстов и большего количества параллельных AI-агентов.

LPDDR5X против HBM даёт Crescent Island другой баланс памяти

Сравнение LPDDR5X и HBM нельзя сводить к вопросу "что быстрее". Для AI-ускорителя важны минимум четыре характеристики: пропускная способность, ёмкость, энергопотребление и стоимость платформы.

HBM остаётся лидером по bandwidth. В современных высокопроизводительных AI-системах несколько стеков HBM обеспечивают огромный поток данных между вычислительными блоками и памятью. Это особенно полезно для задач, где матричные ускорители постоянно потребляют большие массивы данных.

LPDDR5X предлагает другую комбинацию. Она рассчитана на высокую плотность размещения и низкое энергопотребление, поэтому Intel может установить большой объём памяти на сравнительно экономичной 350-ваттной карте. На референсном варианте используется 160 ГБ, а ODM-конфигурации могут доходить до 480 ГБ.

Получается два разных сценария.

HBM выгоднее там, где вычислительные блоки способны постоянно потреблять огромную bandwidth и стоимость памяти оправдывается максимальной производительностью. LPDDR5X становится интереснее там, где модель или KV-cache просто должны поместиться в память, а задача не требует экстремальной скорости обмена каждым байтом.

Для Crescent Island второй сценарий является базовым. Intel позиционирует ускоритель для inference, а не для обучения, и отдельно подчёркивает работу с memory-intensive AI workloads. Компания хочет получить больше токенов на единицу энергии и упростить развёртывание в существующих воздушно охлаждаемых системах.

При этом у такого подхода есть очевидная цена. Большой объём LPDDR5X не превращается автоматически в высокую скорость генерации. Если рабочая нагрузка упирается именно в bandwidth, HBM-платформа с более широким каналом может получить значительное преимущество. Crescent Island поэтому логичнее оценивать не по объёму памяти отдельно, а по отношению "ёмкость плюс пропускная способность плюс мощность".

350 Вт и воздушное охлаждение меняют требования к серверу

Crescent Island рассчитана на 350 Вт и устанавливается как PCIe-карта с воздушным охлаждением. Это важный параметр не только с точки зрения электропотребления. Для инфраструктуры имеет значение весь путь от электрической розетки до стойки.

Если ускоритель требует сложного жидкостного охлаждения, оператору приходится учитывать насосы, холодные пластины, трубки, распределение жидкости и совместимость серверного корпуса. Воздушная карта мощностью 350 Вт не устраняет тепловые проблемы, но позволяет использовать гораздо более привычную серверную инфраструктуру.

Intel прямо связывает конструкцию Crescent Island с существующими воздушно охлаждаемыми дата-центрами. Это позволяет рассматривать ускоритель как компонент, который можно добавлять в стандартные серверные конфигурации без полной перестройки охлаждения.

Для inference это особенно интересно из-за характера нагрузки. Сервер может одновременно обслуживать множество запросов, причём не каждый запрос постоянно держит вычислительные блоки на максимальной мощности. В такой среде важна не только абсолютная производительность пикового режима, но и способность оборудования эффективно работать в длительном потоке запросов.

350 Вт становятся частью экономической модели. При круглосуточной работе один ускоритель на уровне номинальной мощности потребляет:

350 Вт × 24 часа = 8,4 кВт·ч в сутки.

За 30 дней это уже 252 кВт·ч только на саму карту. Расход электроэнергии дата-центра будет выше, поскольку к GPU добавляются CPU, память, сеть, накопители и система охлаждения. Но этот расчёт хорошо показывает, почему показатель tokens per watt имеет практический смысл.

Tokens per watt нельзя честно посчитать без реального throughput

Именно здесь Crescent Island пока приходится оценивать осторожно. Intel делает tokens per watt одним из центральных ориентиров, однако опубликованного независимого набора реальных показателей tokens per second для разных моделей пока недостаточно, чтобы назвать достоверное число tokens per watt. На Hot Chips компания раскрыла архитектуру и параметры карты, но полноценной таблицы производительности для разных моделей не представила.

Сам расчёт простой:

tokens per watt = tokens per second / потребляемая мощность.

Для карты с лимитом 350 Вт получаются следующие ориентиры: если система выдаёт 700 токенов в секунду, это 2 токена в секунду на ватт; при 1400 токенах в секунду получается 4 токена в секунду на ватт; при 2100 токенах в секунду получается 6 токенов в секунду на ватт.

Но эти числа нельзя выдавать за результаты Crescent Island. Это только математическая шкала, которая показывает, какой throughput нужен для достижения конкретного показателя эффективности.

Для практического тестирования понадобятся как минимум модель, точность, длина входного контекста, длина генерируемого ответа, количество одновременных запросов, режим prefill/decode и фактическое энергопотребление. Без этих условий сравнение одной цифры tokens per watt может вводить в заблуждение.

Есть и ещё одна тонкость. Для agentic AI нельзя смотреть только на средний поток токенов. Если агент выполняет пять последовательных действий, задержка каждого шага становится частью итогового времени ответа. Ускоритель, который выдаёт немного меньше токенов в секунду, но позволяет держать больше параллельных сессий в одной памяти, в некоторых конфигурациях может оказаться выгоднее.

Большая память особенно полезна для длинного контекста и множества агентов

Agentic inference отличается от простого диалога тем, что одна сессия может создавать целую цепочку действий. Модель вызывает инструмент, получает результат, анализирует его, вызывает следующий инструмент и продолжает рассуждение. На каждом шаге сохраняется состояние.

Чем длиннее контекст и чем больше одновременно работающих агентов, тем сильнее растёт потребность в памяти. В такой системе 160 ГБ уже дают заметный запас по сравнению с типичными ускорителями меньшего объёма, а 480 ГБ превращают карту в гораздо более ёмкий узел для размещения моделей и состояний. Intel прямо связывает большой объём LPDDR5X с длинными контекстами и большим количеством параллельных агентов.

Можно рассмотреть условный сценарий с моделью на 70 млрд параметров. При представлении весов в 4 битах сами веса требуют около 35 ГБ без учёта служебных данных, масштабов квантования и других структур. Но в реальной системе память расходуется не только на веса. Добавляются KV-cache, временные буферы, промежуточные данные и состояние нескольких запросов.

Поэтому преимущество 480 ГБ появляется не тогда, когда модель просто "большая". Оно раскрывается при одновременном размещении нескольких компонентов и большого числа сессий. Чем больше данных удаётся оставить на одном ускорителе, тем меньше необходимость распределять состояние между несколькими устройствами.

Это потенциально снижает и системную задержку. Передача данных между ускорителями всегда требует времени и занимает часть полосы межсоединения. Если нужное состояние уже находится локально, этот участок цепочки исчезает.

Однако большая ёмкость не отменяет физику. Если вычислительные блоки требуют больше данных, чем способна предоставить LPDDR5X, они могут простаивать. Поэтому 480 ГБ следует рассматривать как преимущество по вместимости, а не как доказательство превосходства по скорости.

Архитектура Xe3P специально убирает часть функций ради эффективности

Crescent Island использует Xe3P как специализированный вариант Xe-архитектуры. Intel изменила состав блока относительно универсального GPU, убрав ресурсы, которые не нужны inference-ориентированному ускорителю в той же степени, что вычислительные и матричные блоки.

В частности, архитектура не пытается одновременно обслуживать полноценный набор графических сценариев. Освободившиеся ресурсы можно направить на те части GPU, которые непосредственно участвуют в AI inference. Tom's Hardware отмечает изменения Xe3P в иерархии кэшей, направленные на повышение загрузки вычислительных ресурсов и снижение потерь, связанных с регистрами.

Это соответствует общей стратегии Intel. Вместо попытки сделать Crescent Island самым быстрым ускорителем вообще компания выбирает конкретный профиль нагрузки. Здесь важны матричные операции, низкая точность, память большой ёмкости, работа с KV-cache и эффективность при ограничении 350 Вт.

Поддержка FP4 и MXFP4 особенно хорошо вписывается в эту концепцию. Чем ниже точность, тем меньше данных требуется передавать и хранить. Но при этом матричные операции становятся более требовательными к архитектуре вычислительного блока. Поэтому 16-deep systolic XMX является не второстепенной характеристикой, а одним из элементов, связывающих формат данных с реальной производительностью.

В результате Crescent Island можно рассматривать как ускоритель, у которого вычислительная часть и память проектировались совместно. Нельзя сказать, что LPDDR5X просто заменяет HBM. Вместо этого Intel построила другую систему балансов, где большая ёмкость и меньшая мощность компенсируют более низкую bandwidth.

PCIe Gen5 x16 делает Crescent Island более простой частью инфраструктуры

Ещё один важный элемент концепции заключается в форм-факторе. Crescent Island подключается через PCIe Gen5 x16, поэтому её можно рассматривать как дискретный ускоритель, который не требует полностью новой архитектуры сервера.

Для корпоративного заказчика это может быть не менее важно, чем характеристики самого GPU. Если ускоритель устанавливается в стандартную платформу, проще использовать уже существующие стойки, серверы, блоки питания и системы управления. Intel именно поэтому подчёркивает простоту внедрения в воздушно охлаждаемые инфраструктуры.

В agentic AI такой подход особенно интересен из-за неоднородности нагрузки. GPU не обязательно должен выполнять всю работу. CPU может заниматься orchestration, запуском программ и обработкой инструментов, а Crescent Island берёт на себя вычислительно насыщенную часть inference. В этом сценарии PCIe становится связующим интерфейсом между универсальным процессором и специализированным ускорителем.

Но PCIe также означает, что архитектура не ориентирована на ту же модель масштабирования, что крупные ускорительные системы с высокоскоростными специализированными фабриками. Поэтому преимущество одной большой памяти внутри карты становится ещё интереснее. Если модель и её состояние помещаются локально, можно уменьшить необходимость постоянного обмена между несколькими ускорителями.

Что происходит с latency в реальном agentic pipeline

Задержку агентного сценария удобно рассматривать как сумму нескольких компонентов. Условно можно записать:

Ttotal = Tprefill + Tdecode + Ttool + Tmemory + Ttransfer + Toverhead.

Это не формула конкретной реализации Crescent Island, а удобная модель для анализа. Если большая часть времени уходит на вычисление токенов, ускорение XMX даст заметный результат. Если же задержку создают вызовы инструментов, CPU, память или обмен данными, увеличение числа матричных блоков не устранит главный ограничитель.

Именно здесь становится важным сочетание 32 Xe3P ядер, большого L2 и LPDDR5X. Crescent Island пытается уменьшить сразу несколько факторов: ускорить вычислительную часть, держать больше данных локально и не требовать сложного охлаждения.

Предположим, условный pipeline занимает 100 мс на один шаг. Из них 60 мс приходится на вычисления GPU, 20 мс на операции с памятью и 20 мс на остальные задержки. Если удвоить скорость GPU-части, общий результат будет не в два раза быстрее. Вычислительная часть сократится с 60 до 30 мс, но остальные 40 мс останутся. В итоге шаг займёт 70 мс, а ускорение составит около 1,43 раза.

Этот простой пример показывает, почему оценка ускорителя по одной вычислительной характеристике недостаточна. Для agentic workloads важна вся цепочка. Если архитектура одновременно увеличивает ёмкость памяти и уменьшает количество перемещений состояния, эффект может оказаться выше, чем показывает сухая характеристика XMX.

Главная ставка Crescent Island заключается в экономике каждого токена

Intel фактически предлагает другой способ оценивать AI-ускоритель. Не только "сколько операций он способен выполнить", а "сколько полезного результата он выдаёт на затраченный ресурс".

При 350 Вт карта находится в относительно понятном энергетическом классе. Это позволяет сравнивать конфигурации по throughput на ватт, а затем переводить показатель в более понятную экономику. Например, при постоянной мощности 350 Вт каждый дополнительный 350 токенов в секунду дают ещё 1 токен в секунду на ватт.

Для владельца инфраструктуры можно идти дальше и считать энергозатраты на миллион токенов:

энергия на миллион токенов = 350 Вт × 1 000 000 / throughput токенов в секунду.

Если ускоритель выдаёт 1000 токенов в секунду при 350 Вт, миллион токенов потребует около 350 000 ватт-секунд, то есть примерно 97,2 кВт·ч. При 2000 токенах в секунду показатель будет около 48,6 кВт·ч. Но снова это математические примеры, а не измерения Crescent Island.

Реальное сравнение должно учитывать среднюю мощность, а не только паспортный предел 350 Вт. Если карта большую часть времени работает ниже максимального режима, фактический tokens per watt может быть выше. Если же в сервере одновременно работают другие устройства, для полной экономики нужно учитывать и их потребление.

И здесь Crescent Island получает потенциальное преимущество благодаря всей конструкции. Воздушное охлаждение упрощает систему, LPDDR5X снижает требования к памяти, а большой объём позволяет разместить больше inference-состояния локально.

Crescent Island не заменяет HBM ускорители, а занимает другой сегмент

Самая точная характеристика Crescent Island сегодня заключается не в том, что Intel нашла "лучше HBM". Это было бы слишком сильным выводом. LPDDR5X объективно уступает HBM по классу пропускной способности, зато предлагает другой баланс ёмкости, энергопотребления и стоимости.

Поэтому ускоритель разумно воспринимать как альтернативу для задач, где высокая bandwidth не является единственным ограничением. Если модель требует огромного потока данных на каждую единицу вычислений, HBM остаётся естественным выбором. Если же главным препятствием становятся объём памяти, количество одновременных сессий, длинный контекст и стоимость инфраструктуры, подход Crescent Island выглядит гораздо интереснее.

В этом смысле 480 ГБ является не просто характеристикой памяти. Это попытка Intel изменить точку, в которой заканчивается полезность одного ускорителя. Чем больше состояния можно держать внутри одной карты, тем меньше необходимость распределять модель и KV-cache по нескольким устройствам.

Для agentic AI это особенно актуально. Один пользовательский запрос может породить множество внутренних действий, а одновременно в системе могут работать сотни или тысячи агентов. Тогда вместимость памяти становится частью пропускной способности системы, даже если она не измеряется в FLOPS.

Crescent Island поэтому выглядит как довольно последовательный продуктовый эксперимент. Intel берёт Xe3P, делает четыре вычислительных среза с 32 Xe Core и 256 XMX, добавляет 32 МБ L2, подключает большой массив LPDDR5X и удерживает карту в пределах 350 Вт с воздушным охлаждением. Результат рассчитан не на максимальный пик вычислений, а на inference в условиях, где стоимость, вместимость и простота размещения становятся такими же важными, как скорость.

Пока главным неизвестным остаётся реальная производительность на конкретных моделях. Архитектура уже понятна, но окончательную оценку дадут измерения tokens per second, latency и energy per token при разных размерах моделей и длине контекста. Именно тогда станет ясно, насколько удачно Intel смогла превратить большую LPDDR5X в преимущество, а не просто в замену HBM.

На уровне архитектурной идеи ставка выглядит вполне логично. Crescent Island не пытается выиграть гонку за самый высокий уровень вычислительной мощности. Она предлагает другой критерий: больше памяти на одной карте, приемлемое энергопотребление, стандартный PCIe-формат и ориентация на длительную обработку большого количества inference-запросов.

Если реальные тесты подтвердят заявленный акцент на tokens per watt, Crescent Island сможет оказаться особенно интересной там, где AI-инфраструктуре приходится считать не только скорость одной модели, но и цену каждого обработанного токена. Именно в таком измерении отказ от HBM перестаёт выглядеть слабостью и превращается в центральную часть всей архитектуры.