Cerebras додасть стековану DRAM до майбутнього wafer-scale прискорювача CS-6
Компанія розвиває обчислювач розміром із кремнієву пластину: Nexus уже підвищує потужність CS-4, а наступні покоління мають подолати обмеження 44 ГБ локальної SRAM.

Cerebras на Hot Chips 2026 показала напрям розвитку своїх wafer-scale систем — прискорювачів, у яких більшу частину 300-мм кремнієвої пластини використовують як один обчислювальний пристрій. Нинішня платформа CS-4 отримує модульну архітектуру Nexus, а у віддаленішому поколінні CS-6 компанія планує розмістити DRAM над логікою та SRAM. Це має збільшити доступну пам’ять без відмови від обчислювальних блоків на самій пластині.
Перевага підходу Cerebras — величезна внутрішня пропускна здатність і відсутність багатьох зовнішніх з’єднань між дрібними GPU. Проте площа пластини обмежена: додавання SRAM забирає місце у логіки, а збільшення логіки зменшує локальну пам’ять. Сьогодні WS-3T має 44 ГБ SRAM, тому три пластини в системі CS-4 дають 132 ГБ. Для порівняння, великі GPU-стійки конкурентів оперують десятками терабайтів HBM, хоча їхня архітектура й характер обміну даними відрізняються.
Що змінює Nexus
CS-4 містить три оновлені WS-3T у самодостатніх модулях, які Cerebras називає backpack. Кожен об’єднує пластину, живлення, рідинне охолодження та інтерфейси масштабування. Модуль можна замінити без демонтажу всієї стійки, що полегшує обслуговування й майбутній апгрейд. Окремі блоки вводу-виводу підключаються до країв пластини та забезпечують RoCE v2 RDMA й прямий зв’язок з іншими WSE.
Вертикальне встановлення дозволило підвести мідну шину живлення безпосередньо до задньої сторони пластини. За твердженням виробника, менші втрати дають змогу подати вдвічі більше потужності, підняти частоти й отримати до дворазового приросту продуктивності WS-3T порівняно з WS-3. Компанія наводить показники розріджених FP16-обчислень, тому їх не слід прямо прирівнювати до щільних FLOPS звичайних GPU.
Стекована пам’ять — найскладніша частина плану
У CS-6 Cerebras хоче розмістити DRAM поверх wafer-scale логіки та SRAM. Тривимірне компонування скорочує довжину з’єднань і може різко збільшити місткість поруч з обчисленнями. Але з’єднати два великі шари з прийнятним виходом придатних пристроїв набагато складніше, ніж упакувати кілька невеликих кристалів. Дефект на великій площі, теплове розширення або проблема з відведенням тепла можуть вплинути на весь модуль.
Проміжне покоління CS-5 із новим WSE заплановане на 2027 рік. Cerebras заявляє до 10 000 токенів на секунду для менших моделей і до 5000 для великих моделей рівня frontier. Це прогноз виробника для майбутньої системи, а не незалежний бенчмарк; реальний результат залежатиме від моделі, точності, довжини контексту й кількості одночасних користувачів.
Для ринку значення roadmap полягає у спробі масштабувати AI не лише через дедалі більші кластери GPU. Wafer-scale конструкція міняє мережеві з’єднання на надшвидку внутрішню тканину, а стекована DRAM має прибрати її головне обмеження — місткість пам’яті. Якщо Cerebras реалізує задум без неприйнятних проблем із теплом, виходом придатних пластин і вартістю, CS-6 стане серйозною перевіркою альтернативної архітектури для швидкого інференсу.
Матеріал підготовлений редакцією HARDW на основі публікації Tom’s Hardware.
Відкрити оригінал на Tom’s Hardware ↗




